GPT-Live-1、GPT-Realtime-2.1、Gemini 3.1 Flash Live:每分钟 5 美分只是前台价,三份规格表各藏一个坑
Gemini 3.1 Flash Live 的文档里有一行规格:纯音频会话上限 15 分钟,音频加视频只有 2 分钟,单条连接大约 10 分钟就会被断开。
做过电话客服的人看到这行会愣一下。一通售后电话,查订单、核身份、等系统返回,15 分钟并不算长。
谷歌当然留了口子:打开上下文窗口压缩,会话可以无限续;配上会话恢复,一次会话能横跨多条连接。代价是断线重连得你自己处理,还得接受一件事:压缩之后,模型对通话前半段的记忆是被摘要过的版本。
语音模型的规格表,每家都藏着一两行这样的字。9 月 10 日 OpenAI 把 GPT-Live-1 放进 API 之后,做语音代理的团队手上一下子有了三个选项:新来的 GPT-Live-1,7 月 6 日才发布的 GPT-Realtime-2.1,以及价格低一个数量级的 Gemini 3.1 Flash Live。三份规格表我逐行对了一遍,坑的位置各不相同。
0.798 秒和 1.41 秒,差的是会不会接话
GPT-Live-1 和另外两个最大的区别是全双工。Realtime 系列本质上还是轮流发言:检测到你停顿,判断你说完了,它再开口。GPT-Live-1 是边听边说,一边输出语音,一边持续判断要不要停下、要不要插一句”嗯”。
OpenAI 公布的 Full Duplex Bench v1 轮次切换延迟,GPT-Live-1 是 0.798 秒,GPT-Realtime-2.1 是 1.41 秒,更早的 GPT-Realtime-2 是 1.63 秒。
快了 0.6 秒。
听着不多,放进电话里就是”对面在想”和”对面卡了”的区别。人与人对话的换人间隔通常只有两三百毫秒,超过一秒,大多数人会下意识”喂?”一声,然后两边同时开口,接下来就是互相道歉。
Artificial Analysis 的对话动态评分上,两者是 97.3% 对 95.7%,差距小得多。Realtime-2.1 在”说话像人”这件事上并不差,它输在节奏,不在表达。
86.2% 这个分数,考的不止 GPT-Live-1 一个
发布稿里最亮眼的数字是 Tau3:GPT-Live-1 拿到 86.2%,GPT-Realtime-2.1 是 45.7%,GPT-Realtime-2 是 42.4%,几乎翻倍。
细看条件,这个 86.2% 是 GPT-Live-1 搭配中等推理强度的 GPT-6 Astra 跑出来的。Tau3 测的是语音代理端到端办完客服任务的能力,查订单、改预约、走退款,真正动脑子的那部分由后端的 Astra 在做。
更准确的读法是:一个”前台加后台”的组合,打赢了一个单模型。
分数本身没有水分,架构就是这么设计的。GPT-Live-1 只管听和说,推理和工具调用委托给后端,后端可以是 Luna、Astra,也可以接第三方模型。麻烦在于,要是把 86.2% 当成 GPT-Live-1 自己的能力,再拿它的 0.05 美元去和别家比价,后端那一大块成本就被漏掉了。
工具调用上的领先倒是它自己的:Full Duplex Bench v3 的工具调用 Pass@1,GPT-Live-1 是 87.0%,Realtime-2.1 和 Realtime-2 分别是 60.0% 和 58.0%。
这套”前台加后台”的路子也不是 9 月才冒出来的,时间线捋一下就清楚:7 月 6 日 OpenAI 在 API 里发了 GPT-Realtime-2.1 和 2.1-mini,两天后的 7 月 8 日,ChatGPT 里的消费端 GPT-Live 上线,免费用户用的是 GPT-Live-1 mini,碰到难题就在后台转给 GPT-5.5 去想;又过了两个月,9 月 10 日,同一套架构以 GPT-Live-1 的名字进了 API,后端换成了可选的 Luna、Astra 或第三方模型,首批合作方里有 Yelp、Speak、Fin 和 Cognition。也就是说,OpenAI 先在几亿消费者身上把全双工跑了两个月,才把它交给开发者。
Realtime-2.1 发布两天就被自家的新架构抢了风头。
三种计价单位,折成同一把尺子
三家的计费单位都不一样,直接比没有意义。我按”一分钟通话,用户说一半、模型说一半”粗算了前台的纯音频成本。折算口径:OpenAI 音频输入约每分钟 600 token、输出约每分钟 1200 token;Gemini 输入每秒 32 token、输出每秒 25 token。
| GPT-Live-1 | GPT-Realtime-2.1 | Gemini 3.1 Flash Live | |
|---|---|---|---|
| 计价方式 | 按会话时长,0.05 美元/分钟,按秒计 | 音频输入 32 美元、输出 64 美元/百万 token,缓存音频 0.40 美元 | 音频输入 3 美元、输出 12 美元/百万 token |
| 前台成本估算 | 0.05 美元/分钟 | 约 0.048 美元/分钟(不含历史上下文) | 约 0.012 美元/分钟 |
| 推理 | 委托后端,另行计费 | 单模型内完成 | 单模型内完成 |
| 输入模态 | 音频、文本 | 音频、文本、图像 | 音频、文本、视频 |
| 接入方式 | 仅 v1/live/sessions | WebRTC、WebSocket、SIP | Live API |
| 容量限制 | 并发 25~500 路(按档位) | 上下文 128K,输出 32K | 纯音频 15 分钟,带视频 2 分钟 |
表里最反直觉的是第二行:按这个粗算,Realtime-2.1 的前台纯音频成本和 GPT-Live-1 的 5 美分几乎打平。
打平只是表面。
两边的”打平”建立在完全不同的前提上。Realtime-2.1 每回复一轮,都要把整段对话历史重新当作输入,历史音频走缓存价,每百万 token 0.40 美元,比新音频便宜 80 倍,但通话越长,这部分累积得越多。GPT-Live-1 按会话时长计费,历史长短不影响前台价格;可它按秒计的是整段会话,客户说”您稍等我找一下订单号”的那一分钟,照样在计费。
更大的变量在后端。GPT-Live-1 的 5 美分不含推理,接 Astra 这种旗舰,每一次委托都是一笔标准的文本 token 账单。一个需要频繁查系统的客服流程,后端费用超过前台是常态。顺带对比一下文本 token:Realtime-2.1 的文本输入每百万 4 美元、输出 24 美元,缓存文本 0.40 美元;Gemini 3.1 Flash Live 的文本输入 0.75 美元、输出 4.5 美元。两家把工具返回的结果、系统提示词喂进模型时,走的都是这条价目线。
Gemini 便宜到了另一个量级,约为前两者的四分之一。代价是开头说的会话时长,以及它没有前后台分离,复杂业务逻辑得全压在一个 Flash 级别的模型身上。
GPT-Live-1 模型页上不起眼的五行
把模型页从头看到尾,有几条限制对迁移影响很大。
它只支持新的 v1/live/sessions 端点,Chat Completions、Responses、Realtime 这些现有端点一概不认。已经基于 Realtime API 搭好 WebRTC 或 SIP 链路的团队,要换的不是一个模型名,是一整层接入代码。
不接图像和视频。Realtime-2.1 能看图,Gemini 能看摄像头和屏幕,GPT-Live-1 目前只有耳朵和嘴。7 月 8 日消费端的 GPT-Live 上线时同样没有摄像头和屏幕共享,OpenAI 当时的说法是”很快”,两个月过去,API 版本也还没带上。
限流按并发会话算,不按 token。Tier 1 只能同时开 25 路,Tier 2 是 50 路,Tier 3 是 200 路,Tier 4 是 300 路,Tier 5 是 500 路,免费档直接不支持。一个刚起步的外呼项目,25 路很快就顶到了。
25 路,一个小呼叫中心的早高峰都扛不住。
知识截止在 2025 年 7 月 31 日。前台模型自己知道的东西停在一年多以前,凡是涉及时效的问题都得交给后端,否则它会拿过期的常识张口就答。
结构化输出和微调都不支持,自定义声音得找销售谈。
Realtime-2.1 还没到该下线的时候
GPT-Live-1 一出来,很容易得出”Realtime 系列可以停了”的结论。我不这么看。
Realtime-2.1 发布才两个月,128K 上下文、最大输出 32K,支持图像输入,WebRTC、WebSocket、SIP 三种传输都已经很成熟。它的强项写在官方描述里:打断处理、轮次检测、噪声和静音管理,还有字母数字混合内容的识别。
最后这一条在客服场景里分量很重。订单号、车牌号、快递单号、带字母的会员编号,识别错一位,整通电话白打。有测评建议拿七种情况去压测语音模型:拼写敏感的客户姓名、字母数字混排的编号、背景噪音、长时间静音、用户中途插话、慢工具、工具报错。这份清单拿来测 GPT-Live-1 同样适用,而 OpenAI 目前没公布它在字母数字识别上的专项数据。
对一个已经在 Realtime API 上跑稳、以单轮问答为主的项目,迁移的收益是 0.6 秒延迟和更好的工具调用,成本是重写接入层、失去图像输入、接受新的并发上限。这笔账不一定划算。
Gemini 的问题不在价格
Gemini 3.1 Flash Live 折合每分钟输入约 0.005 美元、输出约 0.018 美元。做大规模、低客单价的语音应用,比如语言陪练、儿童故事、硬件上的语音助手,这个价格几乎没有对手。它还能直接吃视频流,另外两个都做不到。
短板有两处。一是会话时长,带视频 2 分钟就到顶,”看着屏幕教你操作”这类场景只能靠压缩和续连硬撑。二是听、想、说都挤在一个 Flash 级模型里,闲聊够用,碰上多步骤的业务流程,推理深度明显吃紧。消费端的 Gemini Live 就被测评指出过,遇到需要实时信息的问题,容易滑向空泛的套话,甚至轻度幻觉。
还有一个时间差:谷歌文本侧已经发到了 Gemini 3.8 Flash,目前能查到的最新原生音频模型却还是 3.1 这一代。文本和语音之间的能力代差,正在被拉大。
三类项目,三个答案
电话客服、预约改签这种要查系统、多轮办事的,GPT-Live-1 配一个中档后端是眼下体验最好的组合,前提是并发档位够用,预算里算进了后端费用。
已经在 Realtime 上跑稳、需要看图或者强依赖编号识别的,留在 Realtime-2.1,等 GPT-Live-1 补上图像输入、攒出更多实测数据再说。
量大价低、对话简单、想要视频输入的,用 Gemini 3.1 Flash Live,同时把 15 分钟的会话上限写进架构设计,别等上线之后才撞上。
这三家都在按月迭代,这张表的保质期大概也就一两个月。
相关对比:《Claude Fable 5.1 和 GPT-6 Astra:分数差在哪儿,钱为什么流向不一样》、《GPT-5.6 Luna、GLM-5.3-Flash、Gemini 3.8 Flash:便宜档的三张价目表,坑各不相同》
© 版权声明
文章版权归作者所有,未经允许请勿转载。






GPT-Live-1、GPT-Realtime-2.1、Gemini 3.1 Flash Live:每分钟 5 美分只是前台价,三份规格表各藏一个坑