AMAZINGINDEX.COM 日报快照
55.8
VOL. 2026.05
2026.05.20
← 返回 2026.05.20 日报
日报快照 · Daily Snapshot
NO. 013

谷歌发布原生多模态模型 Gemini Omni

#ARTICLE HackerNews 2026.05.20
推荐指数 71.0 NO. 013 · 2026.05.20
发布2026/05/19Score98Comments42

Gemini Omni 是 Google DeepMind 推出的下一代原生多模态模型,支持文本、图像、音频、视频的任意输入输出和跨模态生成。对 AI 工程师意味着可以构建更统一的多模态管线,减少拼接不同模型的复杂度。

Google 这次强调的是 native multimodality,和 GPT-4o 的"一个模型处理多种模态"路线直接对撞。关键差异在于 Omni 是否真正共享同一套表征空间,还是像之前 Gemini 一样只是工程层面的封装——这决定了跨模态编辑(比如用音频节奏改视频风格)的质量上限。

目前页面信息很薄,没有技术报告或 API 定价。建议等两个信号:一是有没有放出统一 tokenizer 的细节,二是视频生成的物理一致性是否超越 Veo 2。如果两者都为正,Google 可能在多模态基础设施上重新拿回定义权,做 Agent 的团队需要重新评估是否要把视觉-语言-动作统一到一个模型里。

意见分歧 45 条评论

核心争论:原生多模态能否真正颠覆影视创作,还是只是加速生产'有像素无剧情'的内容垃圾

clapthewind

I think Hollywood is in for a rough era. The disruption is happening at break neck speeds.

advisedwang

At the moment the duration of each shot is a major limitation. When that limitation gets solved is when we'll see actual disruption.

franze

At one point the only way to know if something is real or by a major US tech company is nudity.

查看原文 →