视频生成模型如何成为几何学习器:GeoNeXt 用下一帧预测统一深度与法线估计
Video Generative Models as Geometry Learner
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
GeoNeXt 将预训练视频生成模型改造为统一的几何估计框架,把深度和表面法线估计重构为下一帧预测任务,实现图像与几何目标的联合建模。该方法在多个数据集上零样本单目深度和表面法线估计中超越此前的任务专用与统一生成模型,且训练数据量大幅减少。其性能可媲美使用 100 倍以上数据训练的判别式 SOTA 方法,并在若干 benchmark 上表现突出。
来源:Hugging Face Daily Papers · arxiv.org