跳到正文
Hugging Face Daily Papers·· 2026-08-25AI 评分51

EchoWM:可进入的全模态世界模型,联合生成 720p 视频与音频

EchoWM: Open and Enterable Omnimodal World Models

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

EchoWM 是一个全模态世界模型,面向可进入的生成式媒体,在连续导航下联合生成 720p 视频、环境声音、音乐和语音。它围绕摄像机意图组织交互,把离散指令与连续位姿映射到统一的米制尺度相对 6-DoF 轨迹,并通过数据引擎、渐进训练和自回归后训练支持长时程生成。公开世界模型基准上的评测显示其轨迹跟随与视觉质量较强,可支持第一人称和第三人称交互,并保持环境声音与语音的同步。

来源:Hugging Face Daily Papers · arxiv.org