OpenAI 发布全双工语音模型 GPT-Live
推荐指数 89.0 NO. 001 · 2026.07.09
发布2026/07/08
为什么值得看
GPT-Live 采用全双工架构实现真正的实时双向语音交互,支持边听边说、自然打断和情绪反馈。对 AI 工程师而言,这标志着语音交互从"回合制"向"流式对话"的范式转移,语音 Agent 的延迟天花板被大幅抬高。
编辑判断
全双工架构的难点不在技术概念本身,而在于回声消除和语音活动检测的实时性——模型必须在 200ms 内判断用户是在停顿思考还是已经说完。GPT-Live 的"mhmm"式反馈暗示它可能采用了低延迟的副语言分类器,而非完整 LLM 推理,这是工程上的务实取舍。
对创业者来说,这直接冲击了 Bland、Retell 等专注语音延迟的初创公司。OpenAI 把语音延迟压到可商用水平后,独立语音中间件的价值主张会被削弱,差异化需要转向垂直场景的音色定制、合规录音或私有化部署。如果你在做语音客服或 AI 陪伴产品,建议尽快接入测试,同时准备 Plan B——语音交互的护城河正在从"延迟"转向"场景数据"。
相关内容
OpenAI推出GPT-Live语音模型 OpenAI推出基于全双工架构的GPT-Live语音模型,支持同时聆听和说话,将于7月8日发布GPT-Live-1和GPT-Live-1 mini两个版本。 OpenAI推出GPT-Live語音模型,為ChatGPT帶來更自然的對話體驗 OpenAI发布新一代语音模型GPT-Live,旨在让人工智能对话更加自然流畅,该模型已成为ChatGPT语音功能的核心驱动引擎。 面向生产环境语音智能体推出 gpt-realtime 及实时 API 更新 OpenAI推出更先进的语音转语音模型gpt-realtime,新增MCP服务器支持、图片输入及SIP电话呼叫功能,助力构建生产级语音智能体。 Live demo of 3 new OpenAI realtime audio models! OpenAI官方演示3款新实时音频模型:GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper,展示最新语音AI能力。