OpenAI推出全双工语音模型GPT-Live改进ChatGPT语音体验,但首批反馈负面居多,暴露了当前实时语音交互的核心痛点。 ## 1. 升级背景与核心改进 OpenAI在GPT-Live之前推出的两代ChatGPT Voice均未脱离回合制,需要判断用户发言结束后才作答,易出现误判插话等问题。GPT-Live通过两项架构升级改进体验:一是引入全双工架构,可同时听、说并每秒多次做交互决策,能给出“嗯嗯”这类短情绪反馈;二是拆分功能,GPT-Live作为实时语音交互层负责把控对话节奏,复杂任务交给后台GPT-5.5处理。 ## 2. 覆盖范围与官方评测情况 GPT-Live现已向全球iOS、Android端ChatGPT用户及网页端用户开放,Go/Plus/Pro用户默认使用GPT-Live-1,免费用户默认使用GPT-Live-1 mini,推出暂不支持语音/视频通话、屏幕共享,官方正在适配。官方仅做纵向对比,称GPT-Live在科学推理、网页搜索、电信客服三类任务上表现优于此前的Advanced Voice,但未给出行业横向对比结果。 ## 3. 用户反馈与现存问题 目前用户对GPT-Live评价两极分化,部分用户认可其技术潜力,认为或能改变部分场景使用习惯。大量用户反馈其问题:短反馈过多过于频繁,令人生厌;实时模式无法调用ChatGPT记忆,无法在摄像头、屏幕共享模式下使用。 ## 4. 语音助手的核心考验 目前每周超1.5亿用户通过语音功能和ChatGPT交互,日常场景是语音功能的核心使用场景。语音交互和文字交互不同,声音会直接抢占注意力,对延迟和分寸感要求更高,不打扰用户才是语音助手能被用户接受的核心前提。GPT-Live的尝试补全了ChatGPT Voice的日常体验短板,其暴露出的问题也是行业普遍会遇到的问题,仍需要迭代优化。
OpenAI的新语音模型,先把用户烦到了
2026-07-09 08:25

OpenAI的新语音模型,先把用户烦到了

本文来自微信公众号:字母AI,作者:袁心玥,题图来自:AI生成


在昨夜凌晨的直播中,OpenAI发布了新一代语音模型GPT-Live,并宣布它将开始驱动ChatGPT Voice。



上次ChatGPT Voice的代际更新,还是2024年5月GPT-4o发布时展示的Advanced Voice;同年7月,它开始向部分Plus用户小范围推出。到GPT-Live发布,已经过去了两年。


这一次,OpenAI把full-duplex,也就是全双工架构,带进了ChatGPT Voice。


过去的AI语音助手,大多像一台反应很快的对讲机:用户说完一句,模型再回一句;模型说话时,用户可以打断,但系统往往要重新判断、重新组织回答。


它已经像对话,却还不够自然,不像真正的聊天。


GPT-Live要解决的,正是这层微妙的差别。


该功能今天将在ChatGPT上正式启用。但……反响似乎并不算很好?




对ChatGPT Voice的一次补课


在真实聊天里,除了打辩论,人和人很少是一句接一句、整整齐齐地轮流发言。我们会停顿,会犹豫,会突然改口,也会在对方说话时补一句“等等,不是这个意思”。


有时候,一声“嗯嗯”“我懂”,比一段完整回答更重要;有时候,最好的回应反而是先不要说话,让对方继续往下说。


过去的AI语音助手,最难处理的正是这些细节。


无论是ChatGPT、Gemini还是我们最熟悉的豆包,它们在“聊天”上都很干涩,很有人机感。


它们可以回答问题,可以读出文字,也可以在用户打断时停止。但它们通常仍然依赖一个前提:先判断用户是不是已经说完了,再决定模型该不该说话。判断一旦出错,对话就会变得别扭。


用户只是停顿了一秒,它可能以为问题结束了,急着接话;用户说到一半改了主意,它可能还在沿着上一句话往下答;背景里有人说话,它也可能把不属于用户的声音当成输入。


GPT-Live要改善的,就是这些很难被包装成“大功能”、但会直接决定体验的小问题。


要理解现在的GPT-Live,先要看OpenAI此前的语音系统是怎么工作的。


最早的ChatGPT Voice,采用的是级联语音系统(cascaded voice system)


简单说,它不是一个模型从头到尾处理语音,而是由多个模型接力完成:先把用户的语音转成文字,再让大语言模型根据文字生成回答,最后再把文字转换成语音。


这套方案的好处是容易搭建,也能很快把大语言模型接进语音交互里。但它的问题也很明显:语音里的大量信息,会在“语音转文字”的第一步就丢失。


模型生成回答时,它看到的往往只是一段被整理过的文字,而不是完整的对话现场。用户的语气、停顿、情绪变化,并不会进入后面的语言模型。再加上多个模型串联,延迟也会被一层层叠加,语音助手就很容易变成“听一句、想一下、再念一句”。



GPT-4o之后,OpenAI推出了Advanced Voice,开始用原生音频模型直接处理和生成声音。


相比级联系统,这是一次明显的进步:模型不用先把所有语音转成文字,再绕一圈生成语音;它能保留更多音频细节,延迟也更低,用户可以更自然地打断。


但Advanced Voice仍然没有完全摆脱回合制。


OpenAI在介绍GPT-Live时,把此前的Advanced Voice称为回合制语音模型(turn-based voice model)。它已经比传统语音助手更自然,但仍然要先判断用户是否说完,再决定模型是否应该开始回答。


这个机制在文本聊天里没有问题,用户按下发送键,就等于明确告诉模型这一轮输入结束了——但语音聊天并不会有那个按钮,什么时候应该回答,需要由模型自己判断。


用户停顿一秒,可能是说完了,也可能只是还在想;用户拖长音,可能是在组织语言,也可能是酝酿情绪;背景里传来别人的声音,可能被误判成新的输入。


回合制语音模型最难处理的,就是这个边界。



GPT-Live通过两项架构上的改进,去解决这个问题。


第一项改进,是把语音对话从“轮流发言”推进到full-duplex。


它可以持续听、持续判断、持续生成语音,而不只是在用户结束发言后才进入回答状态。


或者说,模型在参与一场仍在发生的对话,而不只是回答一个已经结束的问题。


根据官方介绍,GPT-Live每秒可以做出多次交互决策:是继续说话、继续倾听、暂停、打断对方的话语,还是调用某个工具。这让它能够进行更自然的互动交流、更好地把握时间顺序,甚至可以实时翻译。



可以看到,在用户说话的过程中,GPT-Live会给出一些情绪上的回应。就像你和你朋友煲电话粥,总会夹杂着一些“嗯”“哦”的声音。


事实上,GPT-Live并不是第一个尝试全双工架构的语音模型。此前Kyutai的Moshi、英伟达的PersonaPlex,以及一批学术模型,已经在探索让AI同时听和说,处理停顿、插话和短反馈;谷歌的Gemini Live虽然没有强调全双工,但也已经在做实时语音对话和原生音频模型,方向上非常接近。


GPT-Live的不同之处,是把“边听边说”的能力带进了ChatGPT这个主流入口,并且能和OpenAI的其它模型一起配合。


这就要说到第二项改进:语音交互层和后台智能之间的分工。


GPT-Live并不只是一个“更会说话的模型”,它更像ChatGPT的实时语音交互层:负责听、说、等待、打断、判断何时回应,也负责维持对话节奏。


遇到需要搜索、推理或复杂任务的问题时,它可以把任务交给背后的更强模型处理。


语音模型不必在每一句话里都承担全部智能压力。简单问题可以快速回答,复杂问题可以调用更高强度的推理;对话层负责保持流畅,后台模型负责完成真正的思考和任务处理。


这个架构同样不是很新,但不新,并不代表不好用。



我更愿意理解为这是OpenAI对ChatGPT Voice的一次补课:把过去已经在行业里出现的实时语音交互能力,和full-duplex语音结合起来,然后塞到ChatGPT里。


评测与评价


GPT-Live的实际效果,现在还不适合下太满的结论。


每次发布新模型,OpenAI都很擅长围绕新能力重新定义一套评估标准。模型会推理,就强调推理;模型会写代码,就强调代码。


这次它同样给出了一套自己的评估结果,包括对中断、等待、短反馈、背景噪音、语音理解等能力的测试。



根据这套新建的评估标准,在5到10分钟的匹配语音对话中,评测者明显更偏好GPT-Live-1和GPT-Live-1 mini。


除此之外,还有一些别的榜单,或许值得一看。


OpenAI称,GPT-Live-1在GPQA、BrowseComp和内部版本的τ³-Voice Telecom上都超过Advanced Voice Mode,分别对应科学推理、网页搜索和多轮电信客服任务。




但这部分也不能简单理解成“GPT-Live这个语音模型本身变聪明了”。因为GPT-Live在遇到搜索、推理和复杂任务时,会把任务交给背后的GPT-5.5。


换句话说,官方评估更像是在证明新的ChatGPT Voice系统更强,而不是单独证明语音交互层本身已经完成了质变。


而且你们可能已经注意到了,它只做了纵向比较(和自己以前的模型作对比),横向是一点也没提。


我们无从得知,GPT-Live放到整个语音AI行业里,到底处在什么位置。


网友对此的评价比较两极分化。


一部分人认为,这次更新具有非常大的潜力,如果能用在编程上,或许会改变很多人的习惯。






但也有很多网友认为,GPT-Live这种频频回应的方式有些令人生厌。




还有人指出了它现在的问题,比如在实时模式下无法查询到ChatGPT的记忆,又比如明明是语音功能,却在摄像头模式和屏幕共享模式下无法使用。




对,是的,无法使用。


根据官方文档,GPT-Live现已在全球范围内向所有使用iOS、Android系统的ChatGPT用户以及ChatGPT.com的用户开放。对于Go、Plus和Pro版用户来说,GPT-Live-1将成为驱动ChatGPT Voice功能的默认模型;而对于免费用户而言,GPT-Live-1 mini则将成为默认模型。


在推出时,GPT-Live不支持在ChatGPT中进行语音通话、视频通话或屏幕共享功能。官方正在努力尽快添加这些功能,用户仍然可以使用ChatGPT Voice的旧版本,包括标准语音模式和高级语音模式,这些版本中包含上述功能。


语音助手,先要变得不烦人


OpenAI披露,每周已经有超过1.5亿人通过Voice和Dictation与ChatGPT说话。用户拿它做的事情很日常:腾不出手时问点日常问题,练外语,讲睡前故事,通勤路上聊天。


这些事情算不上很炫酷,却是语音功能最真实的使用场景。


根据官方文档,OpenAI这次把升级拆成了四个方向:更自然的对话、更聪明的回答、更好的聆听,以及可视化回答。


更自然的对话,对应的是用户可以中途插话,可以停下来想一想,也可以要求ChatGPT放慢语速。模型会用“嗯嗯”“明白”这类短反馈表示自己在听,而不是永远等到用户说完才突然开始输出一大段回答。


OpenAI还重新处理了ChatGPT里的九种声音,让它们更适配GPT-Live。


更聪明的回答,对应的是语音模式和最新前沿模型的连接。用户可以选择不同推理强度:Instant用来快速回答,Medium和High则给需要更多思考的问题使用。


这个设计其实挺现实的,因为语音场景对延迟非常敏感。问一个简单问题时,你可能希望它立刻回答;讨论一个复杂问题时,又需要它真的多想一会儿。


更好的聆听,则是这次升级里最接近日常体验的一点。用户停顿时,ChatGPT Voice应该等待,而不是急着插话;用户要求它先安静听,它就应该保持安静;背景里有车声、旁边人说话时,它也要更专注于用户本人的声音。


对语音助手来说,这些能力听起来不如“推理更强”响亮,但往往决定用户愿不愿意继续用。


当然,从首批反馈看,GPT-Live还没有完全解决这个问题。有用户认为它的短反馈过多,甚至会变成另一种打扰。但我觉得可以给它一点时间。


最后是可视化回答。OpenAI 提到,用户说话时,ChatGPT可以展示天气、股票、体育等视觉卡片;Voice也继续支持搜索、记忆、图片和文件上传。


这说明OpenAI在把语音和屏幕信息重新组合起来:适合听的,用声音说;适合看的,就直接展示。


过去,语音更多是文本框的替代品。用户不想打字,就对着手机说一句;模型生成回答,再把文字念出来。它本质上还是文本交互的延伸,只是把键盘换成了麦克风,把屏幕上的文字换成了声音。


但包括GPT-Live在内的、当下的语音助手指向了另一种产品形态:语音不再只是输入输出通道,而是AI参与现实任务的实时入口。


GPT-Live的重点并不是要把ChatGPT从文本框里彻底解放出来。更准确地说,它是在补ChatGPT Voice的日常使用感。


不过,这件事要成立有一个前提:它会不会少打扰用户。


语音助手和文字助手最大的不同是,文字可以被忽略,可以慢慢读,也可以随时关掉;但声音会直接闯进人的注意力里。它接话太急、短反馈太多、判断错停顿,用户感受到的就不是智能,而是烦人。


GPT-Live的真正考验也在这里。


这次更新无疑是有价值的,它让AI语音助手变得更顺,也暴露出了变顺之后,它可能碰上什么问题。GPT-Live现在暴露出的问题,可能也会是其它AI语音助手未来(或者已经存在)的问题。


我想,我们需要一点耐心。


本文来自微信公众号:字母AI,作者:袁心玥

AI原生产品日报频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP