Lucida:面向可组合真实到仿真场景建模的解析、生成与放置框架
Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Lucida 提出一种可组合场景建模框架,将真实室内视频解析为带多视角证据的场景图,为每个实例生成完整资产,并用 VLM 策略 GizmoAct 以多轮 GUI 交互方式闭环放置物体。在 R2S-Scene 上其 mAP 较 Boxer 提升 69%,CA-1M 上 ADD-SB@0.05 从 57.8% 升至 83.4%,场景 F-Score 从 SAM3D 的 0.794 提升至 0.924。
来源:Hugging Face Daily Papers · arxiv.org