微软开源语音模型压缩至1.58GB
推荐指数 73.0 NO. 002 · 2026.07.30
Stars51,182
为什么值得看
VibeVoice-ASR 是微软开源的统一语音转文本模型,最新推出的 BitNet 量化版本将模型从 4.62GB 压缩到 1.58GB 并支持边缘 CPU 实时推理。对需要在端侧部署语音识别、又受限于存储和算力的团队来说,这是目前大厂开源方案中量化力度最激进的一个。
Open-Source Frontier Voice AI
媒体预览
编辑判断
端侧语音 ASR 长期面临两难:Whisper 系列精度够但模型太大,轻量化方案又牺牲准确率。VibeVoice-ASR 的 BitNet 版本用 I8_S + I2_S 异构量化把体积压到 1.58GB,比 Whisper Large 的 3GB 还轻近一半,且 RTF 达到实时标准。
需要关注的是,这种极端量化对语音这种时序敏感任务的精度损失目前缺乏公开 benchmark 对比,尤其是低资源语种和嘈杂场景。如果你现在的方案是 Whisper + ONNX Runtime 在 CPU 上跑,可以先拿 VibeVoice-BitNet 做 A/B 测试,但建议保留原有模型作为 fallback。
另外微软把它同时推进 Azure AI Foundry 和 Hugging Face Transformers,说明这是其边缘 AI 战略的标准组件,后续生态维护大概率优于纯研究项目。
Star History
生态分析
Production
微软开源的端侧语音AI标杆,以极端量化技术推动边缘语音识别普及
独特价值:BitNet量化将模型压至1.58GB,大厂开源方案中边缘部署最优