更少 token、更高成功率:GPT-6 Astra 机器人智能体以 65% 更少 token 实现 14% 成功率提升
研究团队提出交互式代码执行框架 PyRUA-Lean,将反馈驱动的基元组合与选择性观察相结合,减少视觉语言模型(VLM)智能体控制机器人时的 token 开销。
研究团队提出交互式代码执行框架 PyRUA-Lean,将反馈驱动的基元组合与选择性观察相结合,减少视觉语言模型(VLM)智能体控制机器人时的 token 开销。
极狐汽车为阿尔法 T5 推送新一轮 OTA,包含 5 项新增功能与 1 项优化。元境版车型新增苹果 CarPlay、华为 HiCar 手机互联及高悟性端到端 4.0 辅助驾驶模型,后者基于海量真实路况数据训练,可提升窄路通行、泊车、变道场景表现。睿享版新增 APA 泊出辅助、RPA 遥控泊车及哨兵模式远程控制,全车型新增 HUD 红绿灯读秒功能。
特斯拉正持续推进 FSD 监管版辅助驾驶系统在中国台湾地区的落地申请,已于 9 月完成首轮技术审查会议,并根据意见优化道路测试计划,测试路线将纳入城市到乡村的多种交通环境,验证其在机动车与摩托车混行及当地交通规则下的适应能力。
InterEvolve 提出一种测试时进化方法,让人形机器人控制器无需重新训练即可通过重编程现有技能解决新任务。它用 LLM 智能体在上下文中修订奖励程序结构,并由数值优化器调整常数,在并行仿真中验证候选程序。实验表明,InterEvolve 进化出的程序释放了 FB 模型未被充分利用的移动操作能力,进化技能可在物理 Unitree G1 上自主运行。
加州州长纽森签署参议院第 1246 号法案,要求 Robotaxi 故障或妨碍应急处置时安排本地人员到场协助,阻碍应急任务超 30 分钟企业可被罚款。法案还规定远程驾驶员须持美国驾照、企业须向地方政府通报车辆状态,将于 2028 年 7 月生效。此前多起事件多与 Waymo 有关,其约 4000 辆自动驾驶车辆中约 1200 辆在旧金山湾区运营。
波士顿动力为 Atlas 机器人升级机械手,自由度从 7 个提升至 13 个,采用 1 个拇指加 3 根额外手指的设计。官方演示中,新机械手可操控钻头、单手移动两个高尔夫球以及拧螺丝。机械工程师 Dylan Thrush 表示,自由度增加后可控制的独立动作维度更多,手部能完成更多独立关节动作。
马斯克在 X 宣布,为储备足够内存用于 Optimus 机器人量产,特斯拉削减 AI5 和 AI6 芯片的内存用量:AI5 的 RAM 从原计划 144GB 降至 72GB LP5,减少 50%;AI6 从 216GB 降至 144GB LP6,减少约 33%。
哈佛的 Julian Simcock 和 Google DeepMind 的 Rick Ingram 参加了 Runway AI 峰会,讨论物理 AI 的监管、政策制定以及与中国的竞赛。
在一场深度问答中,Runway Research 团队探讨了实时模型、生成式界面以及机器人技术的下一步。
如今机器人能完成哪些工作?这可能对未来数年的经济结构意味着什么? @rclegateyang 和 Maxim Massenkoff 的新研究今日发布,探讨了这些问题。
很想看看 microduck 的生产和组装线是什么样子! 我们的下一代机器人应该要有手臂,这样它就能参与 microduck 的生产了 😅😅😅
The Microduck adventure continues, and the shipping dates are close enough to feel real now. We are proud to tell you that 10,950 Microducks will come off the line between December 10 and January 10! Weekly batches, earliest orders first. Every date is in here.
心资本创始合伙人韩彦在 SuperReturn Asia 2026 演讲中判断,2026至2028年是中国硬科技早期投资窗口:IPO市场回暖、退出路径变清晰,但愿意支持早期企业的资本尚未充分回流。他援引数据称,2026年上半年香港85宗上市募资约2,100亿港元、同比增长92%,中国VC/PE投资金额4,310亿元人民币、同比增长173%,其中44.7%投向AI。
零样本机器人抓取系统 BeyondSCe 可依据目标在过往事件中扮演的角色而非名称或外观来定位并抓取,目标被遮挡时结合事件先验与当前场景几何主动选择视角。在单腕部 RGB-D 相机真机实验中,初始可见与遮挡目标抓取成功率分别为 76% 和 77%,最强基线为 40% 和 55%;在四个重度遮挡场景中成功率从 75% 提升至 95%,平均视角数从 3.35 降至 2.20。
DexPolicy 将强化学习的探索尺度设为训练步数的显式函数,从宽到窄退火,在 ViViDex 等轨迹引导的灵巧操作任务中提升确定性 Target 成功率。在五个 YCB 物体、三个随机种子上,FPO 的平均成功率从 49.4% 升至 68.1%,GRPO 从 14.1% 升至 45.4%,PPO 从 32.0% 升至 35.7%。
研究者提出 ATLAS 训练目标,通过将编码器表示中的归一化成对结构迁移到规划潜在空间,并用 Wasserstein 嵌入匹配(WEMReg)校准其边缘分布,从而在变换中保留规划相关的关系几何。
研究者提出 EvolvingNav,通过时间索引的 3D 物体历史构建持久-迁移结构化信念,并用事件驱动滤波器在目标未被观测移动时预测其状态、结合 RGB-D 证据修正位置假设,配合冻结的零样本视觉语言控制器完成动作选择与重规划。
EgoTools 发布,成为首个面向第一视角工具使用理解的综合套件,包含 100 小时带同步音频、密集标注与 3D 信息的 EgoTools-Data 语料库,以及覆盖感知、几何、流程与因果推理四条轨道的 1,000 对 QA 基准 EgoTools-Bench。
DyRAD 用静态背景反射体与运动跟踪的动态点反射体建模动态驾驶场景,渲染完整的距离-方位-多普勒(RAD)张量,并通过源自雷达信号处理链的固定解析点扩散函数(PSF)渲染反射体,避免传感器扩散被写入场景表示。
TERRA 是一套端到端流水线,仅凭运动学轨迹即可结合地形先验、估计接触与负自由空间证据恢复支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。基于五个数据集生成的运动-地形配对,团队用 9.4 小时多样化运动数据训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升地形精度、大幅减少解剖与交互违规,并在各类支撑地形上取得最高完成率。
Import AI 第 474 期关注 Michael Levin 提出的"柏拉图式心智空间"假说,认为心智是非物理模式,身体与机器只是其进入物理世界的接口。本期还涉及太空 TPU 与智谱启动外层 RSI 循环,并指出机器人领域正为 LLM 时刻做准备,但尚缺通用算法。
研究提出 Agent Priors-guided Policy Learning(APPL),把每个策略的结构先验同时用作训练约束与组合接口:构建智能体将完整演示切分为可复用技能,为每个技能提出多个结构先验并各训练、验证一个策略,运行时智能体再按先验接口选择并组合这些策略。
NavHarness 是一个面向终身具身导航的训练无关框架,将记忆处理纳入导航循环,通过多轮智能体会话调用地图、任务记录与房屋知识并对照观测修正。
研究者提出 Future-Aware Recall(FAR),一个从未来感知预测监督中学习情景记忆召回的框架,通过负扩散预测损失近似条件对数似然来衡量记忆的预测效用,并训练一个推理时对未来盲的检索器。该检索器能学习各线索的相关性,自动决定每个查询该信任时间、姿态、视觉、音频中的哪些线索。在三种互补设置下,FAR 即使使用相同检索线索也优于手工设计的召回方法。
Sakana AI 与东京大学合作提出 SAIL(Scaling In-Context Imitation Learning),通过测试时扩展让 VLM 更可靠地生成机器人轨迹,该工作将在 IROS2026 展示。
270M+ miles. 841 fewer injury-causing crashes. Our latest safety data shows the Waymo Driver continues to make roads safer for everyone. Compared to human drivers across 5 territories, it reduced: 📉 Injury crashes by 82% 📉 Serious injury crashes by 95% Full data: https://waymo.com/safety/impact
DMM(Decentralized Master-Mind)提出用离散的迭代意图精炼替代一次性动作采样,解决多智能体路径规划中局部有效动作重组为不兼容联合动作的问题。该方法受扩散模型去噪启发,通过通信轮次耦合智能体选择,并用模仿学习预训练、MICPO 强化学习优化。在 1,600 个 MovingAI 任务上,DMM 经 MICPO 微调后解决 1,598 个,覆盖率最高,且可扩展至超百万智能体。
你知道吗,你可以从真实大鼠神经元的计算中学到有趣的东西?我很喜欢 @AlexKsendzovsky 和团队在 @BioComputingCo 所做的工作。
What happens when neurons meet silicon? A new world emerges. Partnering with Amazon to bring it to customers. DM me for early access.
Microsoft Research 宣布在 Physical AI Toolchain 中新增推理卸载能力,可将机器人 AI 工作负载容器化并通过 Kubernetes 编排到机器人、边缘与云端 GPU。
Sakana AI 宣布 Jürgen Schmidhuber 出任首席科学顾问,同时保留现职,并将参与新设的 RSI Lab。他将协助公司开发 Agent-Native World Models,用于在行动发生前安全模拟物理后果,服务于日本制造业与机器人应用,并定期赴东京支持团队和日本 AI 生态。
NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04。
非侵入AI脑机接口公司华超神控(BCI-Sonics)完成2亿元人民币Pre-A轮融资,由云启资本与红杉中国联合领投,比邻星投资、元禾控股、徐汇科创投、德石投资跟投,老股东经纬创投、德联资本持续加注。公司以低强度经颅聚焦超声写脑、fUS/EEG/fMRI/PET多模态读脑与AI神经解码构建闭环系统,闭环超声脑机系统计划2027年Q1进入临床,成立至今累计融资近3亿元。
NVIDIA 发布 Halos 全栈安全系统,用于物理 AI 在设计、验证和部署各环节的安全工程。该系统面向自动驾驶提供 DRIVE AGX Thor、Hyperion。
十字路口播客访谈清华交叉信息研究院助理教授徐梦迪,主题是其持续押注的机器人 In-Context Learning,即让机器人通过一两次交互在新环境当场学会新任务。
清华叉院助理教授徐梦迪在播客对谈中提出,机器人应通过 in-context learning(ICL)在新环境中经一两次交互当场学会新任务,且越学越快。她认为机器人仍处 GPT-1 阶段,低 Loss 不等于高成功率,具身领域进步与泡沫共存。
24 岁的深朴智能(Simple AI)首席科学家王家伟在播客中讲述自己从中科大少年班、MSRA、DeepSeek、字节 Seed 转向具身智能的选择。深朴智能已开源 2,000 小时 HiFi-UMI 数据,内部积累数万小时,模型观察到一定 Zero-shot 泛化,并自研 Agentic OS 连接上层意图与底层动作。他认为通用大模型会承担更多理解与规划,但机器人快速反应仍需专门的动作模型。
苏度科技韩铮、蚂蚁灵波沈宇军、自变量王潜、破壳许华哲在 2026 Inclusion 外滩大会圆桌中,围绕具身智能的数据来源、模型路线与落地场景展开了一场未收敛的路线级分歧讨论。对话聚焦 GPT-6 Astra 的能力边界及其对具身行业的冲击,并探讨高成功率与泛化性、客户持续付费等跨越泡沫的指标。嘉宾还就五年后被高估与低估的领域给出各自判断。