跳到正文

#具身智能

今日 8 条
9月11日周五
9月10日周四
9月9日周三
9月3日周四
  1. elsewhere articles46

    对卷卷的3小时访谈:从抖音到AI 3D、成为制造业OS的野心、基础模型不会吞噬一切

    数美万物创始人兼CEO任利锋(卷卷)在近3小时访谈中回顾了从0到1孵化抖音的经历,并介绍了公司最新发布的Hi3D 3.0 2048³模型。他将公司目标从Maker OS推向制造业OS,认为基础模型不会吞噬一切,实体制造仍需能产出生产级3D资产的模型,难点在于拆件、连接结构、材料设备适配与按时交付。

8月26日周三
  1. Google Research44

    Google 研究 AgentHands:为 XR 中的智能体对话生成同步手势

    Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的推理输出映射为 XR 中与语音同步的手势,让 AI 智能体在 3D 空间里用手演示而非仅靠语言描述。系统包含环境感知、手势事件库、手势嵌入推理和 XR 同步执行四个模块,手势按左右手、空间锚定、时序动效等维度分类。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指向上取得显著提升。

8月24日周一
  1. elsewhere articles49

    22 岁 RoboParty 创始人黄一:一年 5 轮融资超 1 亿美元,谈具身智能创业

    RoboParty 萝博派对创始人兼 CEO 黄一在一年内完成 5 轮融资、累计超 1 亿美元,股东包括知名 VC 及小米、宁德等产业方。他将具身智能比作 42 公里马拉松:机器人本体已跑完 1/4,小脑约跑了一半,大脑可能才跑了一两公里。公司从第一代原型机 RPO 走向 RP1,近 150 人团队采用“蜂巢结构”管理,RP1 先服务科研教育场景。

8月13日周四
  1. Microsoft Research41

    MindTopo:微软推出评估多模态模型拓扑推理能力的新基准

    微软研究院发布 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上表现明显优于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成工具仅在单帧内保留结构关系时有用,跨多步操作仍不可靠。

7月30日周四
  1. Google DeepMind67

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,新增视频理解与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,可通过连续视频流追踪任务进度、编排多步任务,并支持多机器人协作,将运动执行交给下层 VLA 模型。

    推荐理由:官方公布具身推理模型的能力指标与 API 入口,开发者可以据此评估它在实体机器人任务编排中的可用性。

7月28日周二
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics 2,实现机器人全身智能控制

    Google DeepMind 发布 Gemini Robotics 2 系列模型,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和可本地运行的 Gemini Robotics On-Device 2,实现人形机器人全身控制、精细操作和多机器人协作。

    推荐理由:官方完整说明了三个模型的能力分工、适配速度和安全基准,读者可了解机器人全身体智能的最新进展与获取方式。

7月9日周四
7月8日周三
6月29日周一
  1. elsewhere articles50

    十字路口对话越伴动力创始人世博:陪伴机器人小伴的产品判断与工程细节

    十字路口播客对话越伴动力创始人世博,介绍其发布的陪伴机器人小伴。产品不发人话而用类似外星语的声音,全身90%以上为柔软材质,采用端侧快脑1.7B、慢脑7B的快慢脑分工加云端超长程记忆,把交互延迟压到0.4秒以内。世博提出陪伴不是讨好、生命力不是可爱、少就是多的产品判断,并谈到创业时机与家庭机器人基座加情感交互模型基座两项基座能力。

6月1日周一
4月20日周一
  1. Berkeley AI Research46

    GRASP:面向世界模型的梯度规划器,让长时程规划更稳健

    Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的"状态-输入"梯度。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维隐空间失效模式等问题,使基于梯度的长时程规划更稳健。

4月13日周一