跳到正文
@AYi_AInotes· @AYi_AInotes · X·· 25 天前AI 评分64
AI 导读

宇树开源通用人形基座大模型 UnifoLM-WLA-1.0,6B 参数,用约 2500 小时高质量真机多任务数据训练,覆盖 64 项复杂任务。该模型用同一套权重完成底盘导航、全身大范围移动与桌面精细操作,在两指夹爪和五指灵巧手之间可不重训自适应,端侧策略推理延迟压到 106 毫秒。底座为 Qwen3-VL-4B 加 MMDiT 动作流专家,代码、模型权重和数据链路均已开源,并附带真机部署指南。

正文

6B 参数、2500 小时真机实测数据、64 项复杂任务,全部塞进同一套权重里直接开源,

看来宇树不只是一家卖机器人的硬件厂,他们刚放出的这个 UnifoLM-WLA,正在把最核心的具身大脑打成白菜价,

做具身智能的人都懂行业里最难言的痛处:
外面宣传吹得天花板乱坠,实际工程里全在搞特异性打补丁,
走路用一套强化学习,抓杯子切另一套扩散模型,一旦把二指夹爪换成五指灵巧手,前面的算法几乎瞬间报废。

宇树刚刚全面开源的通用人形基座大模型(UnifoLM-WLA-1.0),直接把这道卡了全行业几年的死穴给强行干穿了:

它最狠的突破不是模型刷分,而是这三项极其冷血的工业级泛化:

1️⃣ 单一权重通吃全身协同:
彻底抛弃了“小脑管走路、大脑管抓取”的割裂拼装。这套 6B 基础模型用同一套权重,把底盘导航、全身大范围移动和桌面毫米级操作焊死在了一起,厨房端茶、端脏衣服进洗衣机,全是一模驱动;
2️⃣ 跨末端执行器的恐怖泛化:
这是真正的技术分水岭——不管前端装的是廉价的两指夹爪,还是极其复杂的五指仿生灵巧手,模型不用全盘重训,在统一表征下全部自适应跑通;
3️⃣ 真正的端侧实时闭环:
看视频右侧的终端监控,头部与双腕双目立体视觉注入,策略推理延迟直接压到了 106 毫秒(Sub-110ms)。没有云端往返的延迟卡顿,动作才能做到像生物一样的流畅咬合。

底座用 Qwen3-VL-4B 做空间常识推理,外挂 MMDiT 动作流专家,
硬生生啃下了约 2500 小时的高质量真机多任务数据。

更具杀伤力的是他们的姿态:
海外很多团队把具身算法当成融资壁垒死死藏着,
而宇树直接把代码、模型权重和数据链路全部开源(甚至附带了完整的真机部署指南)。

做机器人硬件是把骨肉做扎实,
而把具身基座做成开源基建,才是真正要把整个物理 AGI 时代往前强推一步的狠活。

来源:@AYi_AInotes · x.com