OpenAI 发布三款语音模型
推荐指数 82.0 NO. 001 · 2026.05.08
发布2026/05/07
为什么值得看
OpenAI API 新增 GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper 三款音频模型,覆盖实时对话、同声传译和流式语音转写。语音应用开发者现在可以用一套 API 实现接近人类自然度的交互体验,无需拼接多个厂商服务。
编辑判断
GPT-Realtime-2 是首个明确标注 GPT-5-class reasoning 的模型,这意味着语音交互终于不再是文本模型的 wrapper,而是原生多模态推理。之前做 voice agent 的团队普遍面临延迟和意图理解的双重瓶颈,常见方案是用 Whisper + GPT-4 + TTS 三段式拼接,延迟通常在 2-3 秒且上下文容易断裂。
实时翻译赛道此前被 DeepL、Google Translate 和新兴玩家如 ElevenLabs 的 Voice AI 把持,但 70+ 语言输入且保持说话者节奏的流式翻译是技术难点。OpenAI 直接打包进 API 会挤压独立语音翻译创业公司的生存空间,尤其是做会议同传、跨境客服的 B2B 服务商。
建议已经在用 Azure Speech 或 Amazon Transcribe 的团队直接跑 benchmark 对比延迟和准确率,如果 GPT-Realtime-Whisper 的流式延迟低于 300ms,迁移成本可能远低于维护多厂商拼接架构。