PhysBrain 1.5:从视觉语言模型到物理基础模型
PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
DeepCybo 团队发布 PhysBrain 1.5,一个统一理解物理环境、生成动作并预测未来状态的物理基础模型。该模型从通用视觉语言模型出发,将语言响应、末端执行器运动和稠密视觉目标编码为离散序列,以自回归下一 token 预测联合优化,预训练监督全部来自人类交互视频。
来源:Hugging Face Daily Papers · arxiv.org