语音助手如果必须等你说完一整句才敢出声,它仍是对讲机。OpenAI的GPT-Live改成了可以互相打断的对话。
OpenAI是ChatGPT的开发者。GPT-Live是新的语音交互模式,采用全双工架构。全双工,白话就是两边可以同时说话:系统一边听,一边准备说,每秒多次判断应该继续倾听、暂停、插话,还是调用工具。用户可以随时打断、中途补充、改话题。这和“按住说话、松手再听回复”的半双工不同。
技术上分成前台和后台。前台语音模型负责快速接话,保证对话不出现长时间空白。遇到搜索、深度推理或复杂执行,请求会自动路由到后台更强的GPT-5.5,结果准备好后再带回对话,前台过程不中断。路由,是系统替用户决定这句话该由哪个模型处理。适合的场景包括实时翻译、口语练习和复杂问题咨询。实时翻译要的是不断句,口语练习要的是能被打断,复杂咨询要的是后台那一层更强的推理,而不是前台为了快而答得很浅。
OpenAI同时披露了安全研究。2025年与MIT Media Lab的联合研究发现,重度使用语音模式的用户,存在更高的孤独感、情感依赖和问题性使用倾向。MIT Media Lab是麻省理工学院媒体实验室。问题性使用,是使用方式已经影响到生活,而不只是“用得比较多”。GPT-Live已内置相关安全防护,家长可以通过家长控制限制青少年访问。研究说的是相关,不是“语音模式导致孤独”的因果结论,原文没有给出样本量和效应大小。
更自然的对话和更明确的使用边界被放在同一次发布里。产品若只强调能插话,而不提依赖风险,家长控制和研究者都无法判断该不该放开权限。下一步要看的是,安全防护在真实对话里如何触发,以及GPT-5.5在后台接手时,用户能否知道自己正在和更慢、更强的一层说话。
前后台分工把说得顺和想得深拆开。前台不能为了等GPT-5.5而让对话停住,后台也不能为了快而跳过搜索和推理。2025年与MIT Media Lab的联合研究发现的是相关,不是已经证明语音模式导致孤独。原文没有给出样本规模。家长控制因此被一起公布。更像真人的插话能力,和更明确的使用边界,是同一次发布里的两件事。