OpenAI 推全双工语音模型 GPT-Live
推荐指数 63.0 NO. 014 · 2026.07.09
发布2026/07/08Score363Comments256
为什么值得看
GPT-Live 采用全双工架构实现实时双向语音交互,支持边听边说、自然插话和停顿感知。对 AI 工程师而言,这标志着语音交互从"回合制"向"流式对话"的范式转移,语音 Agent 的延迟和体验瓶颈有望被根本性解决。
编辑判断
全双工语音不是新概念,但之前落地差强人意——Google Duplex 2018 年 demo 惊艳后始终没开放给开发者,国内厂商如 MiniMax、智谱的端到端语音模型也做了实时打断,但延迟和"机械感"仍是痛点。GPT-Live 的关键差异在于把"对话管理"和"深度推理"解耦:轻量语音模型负责实时交互流,重活扔给后端 frontier model,这种分层架构比端到端方案更易平衡延迟与智能。
对做语音 Agent 的团队,这意味着两件事:一是过去用 VAD(语音活动检测)+ ASR + LLM + TTS 拼接的管线可能被颠覆,需要评估是否迁移到原生全双工方案;二是"打断"和"沉默处理"这类交互细节会成为新的产品差异化点,而非单纯比拼模型智商。做实时翻译、客服、陪伴类产品的创业者,建议尽快申请 API 内测,窗口期可能只有 3-6 个月。
社区反馈
意见分歧 242 条评论
核心争论:全双工语音是体验突破还是营销噱头,实时翻译质量是否真达实用
相关内容
This solves my biggest annoyance with the current advanced voice: its speech getting interrupted by me setting yup or even background noise if loud enough
Now it consistently interrupts you
Yeah, looking at the waveforms from those sample conversations it looks like it's happening at the exact same interval every time