
OpenAI把一款"能边听边说"的语音模型塞进了API。开发者现在可以拿它做真刀真枪的实时语音应用——AI接客服电话、帮你订餐厅,你中途插话,它也不会卡壳。
这款模型叫GPT-Live-1。
它最核心的本事是全双工。打个比方:过去大多数语音AI像对讲机,你说完、它再说,中间得按一下才能换人;GPT-Live-1更像一通真正的电话,两边可以同时开口,它一边听一边说,还能分辨出你是说完了在等它,还是只是停顿想词,或者只是背景里有人咳嗽。
这背后是一次架构上的减法。传统语音助手要跑三段路:先把你的话转成文字,交给大模型想,再把答案转回语音。三次接力,每一棒都要等,延迟就是这么攒出来的。GPT-Live-1把"听懂"和"说出"塞进同一个模型,少了几次交接,反应自然更快。至于复杂的推理和工具调用,它还是甩给后端的文本模型去做,各干各擅长的活。
开发者能调的也很多。语气、语速、对话风格,用一段系统提示词就能改;后端接哪个模型、挂哪些工具、用哪套智能体框架,也都能配置。模型本身还带了语音转写、字母数字识别、关键词偏置和轮次检测这些能力。
效果有数可查。语言学习平台Speak用上GPT-Live-1后,学习者在思考停顿期间被误打断的次数,比之前那套按轮次切换的系统少了近80%——想想你在跟AI练口语,刚卡壳想词就被抢话,那种烦躁感基本消失了。医疗服务平台的一位联合创始人兼CTO Tony Stoyanov说,他们团队代码量少了80%,删掉大约2.3万行。
OpenAI公布的评测里,GPT-Live-1在Full Duplex Bench上比GPT-Realtime-2.1高出30个百分点;搭配GPT-6 Astra的中等推理强度时,在Tau3端到端语音智能体任务测试中排到第一。
真正让它能"干活"的,是它跟外部的连接能力。开发者可以把GPT-Live-1接到Codex这类工具上,也能通过OpenAI Presence做出能查企业系统、执行获批操作、实在搞不定就转人工的语音工作流。说白话就是:AI不再只是陪聊,它能真的去查订单、改地址、约时间,遇到复杂情况还会把电话交给真人。
价格也给得很清楚。前端语音层每分钟0.05美元,一小时大约3美元,折合人民币20块出头;后端模型和智能体工具的费用另算。按这个价,一通三分钟的电话成本不到1块1毛钱。声音库也扩了一圈,新增Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta和Cinder,未来几个月还会继续加语音和语种。
这事值得留意的地方在于:语音交互一直卡在两个体验杀手——延迟和打断。这两个坎压下去之后,电话这个最老土的渠道,反而可能变成AI落地最快的战场。订餐、挂号、退换货、催收、售后回访,这些原本靠人力堆起来的场景,成本结构要重新算一遍了。而每分钟5美分的定价,基本是把"AI接线员"从概念验证推到了可以规模铺开的门口。