谷歌发布原生多模态模型 Gemini Omni
推荐指数 71.0 NO. 013 · 2026.05.20
发布2026/05/19Score98Comments42
为什么值得看
Gemini Omni 是 Google DeepMind 推出的下一代原生多模态模型,支持文本、图像、音频、视频的任意输入输出和跨模态生成。对 AI 工程师意味着可以构建更统一的多模态管线,减少拼接不同模型的复杂度。
编辑判断
Google 这次强调的是 native multimodality,和 GPT-4o 的"一个模型处理多种模态"路线直接对撞。关键差异在于 Omni 是否真正共享同一套表征空间,还是像之前 Gemini 一样只是工程层面的封装——这决定了跨模态编辑(比如用音频节奏改视频风格)的质量上限。
目前页面信息很薄,没有技术报告或 API 定价。建议等两个信号:一是有没有放出统一 tokenizer 的细节,二是视频生成的物理一致性是否超越 Veo 2。如果两者都为正,Google 可能在多模态基础设施上重新拿回定义权,做 Agent 的团队需要重新评估是否要把视觉-语言-动作统一到一个模型里。
社区反馈
意见分歧 45 条评论
核心争论:原生多模态能否真正颠覆影视创作,还是只是加速生产'有像素无剧情'的内容垃圾
I think Hollywood is in for a rough era. The disruption is happening at break neck speeds.
At the moment the duration of each shot is a major limitation. When that limitation gets solved is when we'll see actual disruption.
At one point the only way to know if something is real or by a major US tech company is nudity.