虎牙发布实时多模态数字人基础模型 VAM 1.0,一张照片即可24小时直播
24小时直播,只靠一张照片?虎牙实时多模态数字人VAM 1.0率先突围行业三堵墙
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
虎牙推出基于 DiT 架构的实时多模态数字人基础模型 VAM 1.0(Vivid Avatar Model),只需一张照片即可生成能实时对话、唱歌跳舞的 AI 数字人。该模型支持 480×832 分辨率、28 帧实时流式输出,可连续运行 24 小时以上,在 8 块 H200 GPU 集群上达到 36.4 帧每秒推理速度,首帧延迟约 1.3 秒,每片段延迟 0.77 秒。
来源:量子位 · 微信公众号 · mp.weixin.qq.com