更少 token、更高成功率:GPT-6 Astra 机器人智能体以 65% 更少 token 实现 14% 成功率提升
研究团队提出交互式代码执行框架 PyRUA-Lean,将反馈驱动的基元组合与选择性观察相结合,减少视觉语言模型(VLM)智能体控制机器人时的 token 开销。
研究团队提出交互式代码执行框架 PyRUA-Lean,将反馈驱动的基元组合与选择性观察相结合,减少视觉语言模型(VLM)智能体控制机器人时的 token 开销。
InterEvolve 提出一种测试时进化方法,让人形机器人控制器无需重新训练即可通过重编程现有技能解决新任务。它用 LLM 智能体在上下文中修订奖励程序结构,并由数值优化器调整常数,在并行仿真中验证候选程序。实验表明,InterEvolve 进化出的程序释放了 FB 模型未被充分利用的移动操作能力,进化技能可在物理 Unitree G1 上自主运行。
如今机器人能完成哪些工作?这可能对未来数年的经济结构意味着什么? @rclegateyang 和 Maxim Massenkoff 的新研究今日发布,探讨了这些问题。
零样本机器人抓取系统 BeyondSCe 可依据目标在过往事件中扮演的角色而非名称或外观来定位并抓取,目标被遮挡时结合事件先验与当前场景几何主动选择视角。在单腕部 RGB-D 相机真机实验中,初始可见与遮挡目标抓取成功率分别为 76% 和 77%,最强基线为 40% 和 55%;在四个重度遮挡场景中成功率从 75% 提升至 95%,平均视角数从 3.35 降至 2.20。
DexPolicy 将强化学习的探索尺度设为训练步数的显式函数,从宽到窄退火,在 ViViDex 等轨迹引导的灵巧操作任务中提升确定性 Target 成功率。在五个 YCB 物体、三个随机种子上,FPO 的平均成功率从 49.4% 升至 68.1%,GRPO 从 14.1% 升至 45.4%,PPO 从 32.0% 升至 35.7%。
研究者提出 ATLAS 训练目标,通过将编码器表示中的归一化成对结构迁移到规划潜在空间,并用 Wasserstein 嵌入匹配(WEMReg)校准其边缘分布,从而在变换中保留规划相关的关系几何。
研究者提出 EvolvingNav,通过时间索引的 3D 物体历史构建持久-迁移结构化信念,并用事件驱动滤波器在目标未被观测移动时预测其状态、结合 RGB-D 证据修正位置假设,配合冻结的零样本视觉语言控制器完成动作选择与重规划。
EgoTools 发布,成为首个面向第一视角工具使用理解的综合套件,包含 100 小时带同步音频、密集标注与 3D 信息的 EgoTools-Data 语料库,以及覆盖感知、几何、流程与因果推理四条轨道的 1,000 对 QA 基准 EgoTools-Bench。
DyRAD 用静态背景反射体与运动跟踪的动态点反射体建模动态驾驶场景,渲染完整的距离-方位-多普勒(RAD)张量,并通过源自雷达信号处理链的固定解析点扩散函数(PSF)渲染反射体,避免传感器扩散被写入场景表示。
TERRA 是一套端到端流水线,仅凭运动学轨迹即可结合地形先验、估计接触与负自由空间证据恢复支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。基于五个数据集生成的运动-地形配对,团队用 9.4 小时多样化运动数据训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升地形精度、大幅减少解剖与交互违规,并在各类支撑地形上取得最高完成率。
Import AI 第 474 期关注 Michael Levin 提出的"柏拉图式心智空间"假说,认为心智是非物理模式,身体与机器只是其进入物理世界的接口。本期还涉及太空 TPU 与智谱启动外层 RSI 循环,并指出机器人领域正为 LLM 时刻做准备,但尚缺通用算法。
研究提出 Agent Priors-guided Policy Learning(APPL),把每个策略的结构先验同时用作训练约束与组合接口:构建智能体将完整演示切分为可复用技能,为每个技能提出多个结构先验并各训练、验证一个策略,运行时智能体再按先验接口选择并组合这些策略。
NavHarness 是一个面向终身具身导航的训练无关框架,将记忆处理纳入导航循环,通过多轮智能体会话调用地图、任务记录与房屋知识并对照观测修正。
研究者提出 Future-Aware Recall(FAR),一个从未来感知预测监督中学习情景记忆召回的框架,通过负扩散预测损失近似条件对数似然来衡量记忆的预测效用,并训练一个推理时对未来盲的检索器。该检索器能学习各线索的相关性,自动决定每个查询该信任时间、姿态、视觉、音频中的哪些线索。在三种互补设置下,FAR 即使使用相同检索线索也优于手工设计的召回方法。
Sakana AI 与东京大学合作提出 SAIL(Scaling In-Context Imitation Learning),通过测试时扩展让 VLM 更可靠地生成机器人轨迹,该工作将在 IROS2026 展示。
DMM(Decentralized Master-Mind)提出用离散的迭代意图精炼替代一次性动作采样,解决多智能体路径规划中局部有效动作重组为不兼容联合动作的问题。该方法受扩散模型去噪启发,通过通信轮次耦合智能体选择,并用模仿学习预训练、MICPO 强化学习优化。在 1,600 个 MovingAI 任务上,DMM 经 MICPO 微调后解决 1,598 个,覆盖率最高,且可扩展至超百万智能体。
Microsoft Research 宣布在 Physical AI Toolchain 中新增推理卸载能力,可将机器人 AI 工作负载容器化并通过 Kubernetes 编排到机器人、边缘与云端 GPU。
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的推理输出映射为 XR 中与语音同步的手势,让 AI 智能体在 3D 空间里用手演示而非仅靠语言描述。系统包含环境感知、手势事件库、手势嵌入推理和 XR 同步执行四个模块,手势按左右手、空间锚定、时序动效等维度分类。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指向上取得显著提升。
微软研究院发布 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上表现明显优于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成工具仅在单帧内保留结构关系时有用,跨多步操作仍不可靠。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的"状态-输入"梯度。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维隐空间失效模式等问题,使基于梯度的长时程规划更稳健。