跳到正文
@berryxia· @berryxia · X·· 2026-05-19AI 评分37
AI 导读

Odyssey AI 实验室发布 Starchild-1,称其为全球首个实时多模态世界模型,能同时生成画面与真实世界的声音,实现视觉与听觉同步融合。此前世界模型大多只能"看"世界,Starchild-1 进一步学会了"听",被视为迈向通用世界模型的关键一步。

正文

卧槽,这个模型真的有点东西啊!

看完后就想问什么时候可以上手啊!

Odyssey AI实验室刚刚扔出一个真正让人眼前一亮的家伙:Starchild-1。

这是全球第一个实时多模态世界模型。

它不只是生成画面,还能同时生成真实世界的声音。

视频里你能看到一个完整的场景:画面在动,声音同步响起,视觉和听觉完全融为一体,像真正活过来的世界模拟。

以前的世界模型大多只能“看”世界,现在Starchild-1直接学会了“听”。

这不仅仅是又一个视频生成工具,更大的意义是朝着通用世界模型又迈出的关键一步,真正理解并模拟物理世界的下一步。

Odyssey团队说,他们正在用这种新形式的多模态智能,重新定义AI对现实的认知。

Video

引用Odyssey (@odysseyml)@odysseyml
Meet our new friend, Starchild-1 ❤️ Starchild-1 is the first ever real-time multimodal world model. A world model understands and simulates the world. Starchild-1 has learned to generate not just the visuals of the world, but the sounds of it too! Video
在 X 查看被引用的帖子

来源:@berryxia · x.com