跳到正文
原文
@berryxia· @berryxia · X·· 2026-05-20精选AI 评分75
AI 导读

Google DeepMind 发布 Gemini Omni,将 Gemini 的智能与生成媒体系统融合,可先定义角色再放入任意场景并保持外貌、动作和光影一致,也支持用自然语言改风格、加效果或重拍已有视频。

推荐理由

Gemini Omni 把生成视频做成可对话编辑的对象,并同步在 Gemini App 等入口上线,读者可据此观察视频生成向可编辑素材演进。

正文

Google I/O 大会发布会重要的一个发布就是它!

Google DeepMind今天直接把“从任何东西生成任何东西”这件事,迈出了第一步。

他们发布了Gemini Omni。

不仅仅是又一个视频生成工具,而是想把Gemini和生成媒体系统彻底融合。

它真正懂物理、懂历史、懂文化、懂故事逻辑。

你能定义一个角色,然后随便扔进任何场景,它都能保持一致的外貌、动作和光影。

你能用自然语言改风格、加效果,或者直接把你自己拍的视频重新想象——改环境、加物体、换动作,全程对话式操作。

以前生成视频是“拍完一段就结束”,现在它是活的、可编辑的、能持续演进的世界。

视频终于不再是死的内容,是可以被实时重写的“世界素材”。

Gemini Omni Flash已经在Gemini App、Flow by Google和YouTube Shorts上线,几周后也会开放API。

PS:有人说效果不如SD2,尤其中文就更不用说了。

但是支持片段编辑的效果还不错。

Video

引用Google DeepMind (@GoogleDeepMind)@GoogleDeepMind
We’re dropping Gemini Omni: our first step towards a model that can create anything from anything - starting with video. It combines Gemini’s intelligence with our generative media systems - representing a leap forward in world understanding, multimodality, and editing 🧵 Video
在 X 查看被引用的帖子

来源:@berryxia · x.com