谷歌 DeepMind 发布 GenCeption:基于阿里 Wan2.1,单模型统一深度估计与分割等视觉任务
谷歌 DeepMind 发布 GenCeption:基于阿里 Wan2.1,打破计算机视觉桎梏
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
谷歌 DeepMind 发布 GenCeption,将预训练视频生成器改造为视觉分析引擎,仅凭单一模型同时完成深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计。该模型基于阿里开源视频模型通义万相 Wan2.1 训练,一次前向传播即可完成预测,通过文本提示指定任务。训练数据仅 7500 段合成视频,大模型参数量 140 亿,处理 81 帧视频约需 10 秒,小模型约 6 秒。
来源:IT Home · ithome.com