以前的语音助手更像对讲机:你说完,它听完,它想,它说。你中途插一句,它就乱了。
OpenAI9月10日放进API的GPT-Live-1,要解决的就是这个。它是全双工语音模型,能同时听和说:说到一半被打断会停下,背景噪音能自己过滤,长对话不容易掉线,也能直接接进电话场景做语音代理。
更关键的是分工。GPT-Live-1只管”对话”这一层,复杂推理和工具调用可以交给后端模型。前台负责流畅,后台负责聪明。
成绩方面,OpenAI说它在Full Duplex Bench上比上一代GPT-Realtime-2.1高了30个百分点。这个基准测的就是全双工对话本身:什么时候该接话,什么时候该闭嘴,被打断后能不能自然接上。和中等推理强度的GPT-6 Astra搭配时,它在衡量语音代理端到端完成任务的Tau3上排第一。
价格是每分钟0.05美元,按秒计费。
这个数字很容易被看错。0.05美元只是语音前端的价钱,后端调用的推理模型和工具另外计费。如果你的语音客服每句话都要让Astra去查订单、算方案,真实成本得把后端那部分加上去。
即便这样,它对电话客服、预约、外呼这类业务仍然有吸引力。按每分钟0.05美元算,一小时通话的前端成本是3美元,比很多地区人工坐席的时薪低得多。
开发量的变化也不小。有评测称用GPT-Live-1搭语音代理,代码能少写八成左右。以前开发者要自己拼语音活动检测、打断处理、转写、合成这一整条链路,现在模型内部全包了。
全双工也有全双工的烦恼。模型能随时插话,就意味着它也可能在你没说完的时候抢话;降噪做得激进,口音重或者语速慢的用户容易被误判成”说完了”。这些问题只能在真实电话流量里慢慢暴露。
语音这条线今年卷得很凶,谷歌的Gemini Live、国内几家的实时语音都在往全双工走。OpenAI把前端价格直接打到每分钟5美分,等于先把基准线划了出来。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






GPT-Live-1进API:能边听边说,语音前端每分钟0.05美元