跳到正文
量子位 · 微信公众号·· 2026-06-30AI 评分49

虎牙发布实时多模态数字人基础模型 VAM 1.0,一张照片即可24小时直播

24小时直播,只靠一张照片?虎牙实时多模态数字人VAM 1.0率先突围行业三堵墙

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

虎牙推出基于 DiT 架构的实时多模态数字人基础模型 VAM 1.0(Vivid Avatar Model),只需一张照片即可生成能实时对话、唱歌跳舞的 AI 数字人。该模型支持 480×832 分辨率、28 帧实时流式输出,可连续运行 24 小时以上,在 8 块 H200 GPU 集群上达到 36.4 帧每秒推理速度,首帧延迟约 1.3 秒,每片段延迟 0.77 秒。

来源:量子位 · 微信公众号 · mp.weixin.qq.com