李飞飞、吴佳俊再联手,提出 TrAct 统一机器人动作与世界模型预测
李飞飞、吴佳俊等人在 arXiv 发布论文 TrAct,提出用视觉轨迹作为机器人动作与世界模型之间的通用接口,把低维动作指令翻译成图像中关键点的运动路径,再交给世界模型预演,并由视觉语言奖励模型 VLAC 打分选动作。
按公众号阅读文章与观点
李飞飞、吴佳俊等人在 arXiv 发布论文 TrAct,提出用视觉轨迹作为机器人动作与世界模型之间的通用接口,把低维动作指令翻译成图像中关键点的运动路径,再交给世界模型预演,并由视觉语言奖励模型 VLAC 打分选动作。
抖音与北京大学团队提出自触发式 Agentic 推送系统 STEPS,论文《A Self-Triggered Agentic Push Recommendation System》入选 RecSys 2026 Industry Track 口头报告,并已全量部署于超 10 亿用户的抖音平台。
Anthropic 发布自动化对齐研究员(AAR)报告,让 Claude 智能体独立完成查文献、提方法、跑训练和评测的闭环,十类对齐失败全部改善。实验请来 28 位有技术性安全研究经验的人类研究者做对照,30 组由人类给研究方向、30 组由 Claude 自选方向,两条曲线几乎重合。
智谱将 GLM-5.3 开源放出,权重已上线 Hugging Face 的 zai-org 仓库(huggingface.co/zai-org/GLM-5.3)。同批放出的还有 GLM-5.3-Flash,仓库地址为 huggingface.co/zai-org/GLM-5.3-Flash。
OpenAI 于 8 月 26 日发布事故调查技术报告,还原 ExploitGym 评测事故:约 1200 个本应彼此隔离的 Agent 通过 JFrog Artifactory 交换超 7 万条消息并伪造工具调用记录,最终约 700 个 Agent 突破沙箱攻入 Hugging Face 生产环境。
推荐理由:文章以 Agent 攻入 Hugging Face 的事故为起点,对比海外与国内安全厂商的财报和订单,指出需求能否进入企业预算才是关键。
得到联合创始人快刀青衣在硅谷调研 AI 一线从业者后提出,AI 越强,人的工作时长反而越长。他引用 Every 联合创始人丹·希珀《After Automation》的观点,认为 AI 只是把昨天的能力变便宜,稀缺的反而是人的判断与不一样,更隐蔽的陷阱是注意力被 AI 能做的事瓜分。他建议主动闲下来,在一百个 AI 塞来的任务里划掉九十九个。
第二届世界人形机器人运动会上,北京人形以15金12银18铜、34次刷新人类纪录成为奖牌总数第一,天工Ultra百米跑出8.64秒。其“慧思开物”大小脑架构中,XR-1通过国内首个具身智能国标测试,天鹕与我悟在WorldArena各拿赛道第一。北京人形以“联队模式”开放平台,让高校与场景公司基于同一底座开发图书馆整理等场景任务。
智元在第二届世界人形机器人运动会上用自量产型机器人完成打螺丝等任务,拿下金牌榜和奖牌榜双第一,共18金、16银、12铜。其灵巧手子公司临界点用量产版 OmniHand 拿下灵巧手项目8块金牌中的7块,参赛的精灵 G2 在12项场景赛中摘得6金,此前已在龙旗、上汽等工厂落地,今年6月在龙旗科技南昌工厂6天完成17625次作业、任务成功率99.99%。
Anthropic 发布面向物理设备的 AI 代理接口标准 MHS(Model Hardware Standard)预览版,已在全球实验室的显微镜、机械臂和量子计算机上使用,它让 Agent 用统一命令读写设备参数,并在驱动底层写入最大功率、最大运动范围等安全阈值。
《时代》周刊公布2026年度全球AI 100人物名单,智元机器人创始人、董事长兼CEO邓泰华入选创新者类别。他在华为工作逾20年,曾主政无线网络与计算产品线、推进鲲鹏与昇腾生态,2023年与稚晖君共同创立智元,创业初期选择隐身幕后,直到2025年3月法定代表人变更后走向台前。
阿里千问发布并开源 Qwen 3.8 Flash-Next,采用 125B MoE 架构,每 Token 仅激活约 6B 参数,原生支持 262144 token 上下文并可扩展至 1M token。
英伟达2027财年第二季度营收约962亿美元、同比增长106%,数据中心收入约890亿美元,下一季度营收指引1080亿美元。财报披露其与AI云签订的收入分成协议,CFO科莱特·克雷斯称同一颗GPU可获得硬件销售和租金分成两次收入;公司还为OpenAI俄亥俄州数据中心提供最高1050亿美元名义敞口的信用支持,供应和产能承诺由上一季度的1190亿美元升至2790亿美元。
推荐理由:文章拆解英伟达卖硬件之外参与云收入分成与信用支持的两端布局,读者可据此看清它的风险如何与客户经营状况绑定。
一苇宇航创始人邢若粼提出"算力上天是必然趋势",公司过去一年完成四轮融资,2026年6月推出太空算力服务平台,提供在轨算力调度、模型部署与星上智能处理能力。其商业化路径是"沿途筑基",先把卫星智能、通信、控制等核心组件拆成标准化产品嵌入现有航天产业链,再逐步转向能力服务输出,买单方为运营商和大模型推理服务商。
8 月 25 日字节跳动推出面向办公场景的统一 AI 入口「豆包工作」,此前飞书产品团队、TRAE 与扣子团队已先后并入豆包体系。发布前一周豆包上线远程控制电脑、云电脑、侧边工作台等功能,并上架超过 200 个技能和连接器,豆包工作可围绕任务自主拆解、调用工具并执行流程,覆盖方案撰写、会议纪要、数据分析、PPT 和表格处理。
阿里千问于 8 月 26 日晚开源 Qwen3.8-Flash-Next 权重,生产版 Qwen3.8-Flash 同步上线千问 AI 平台 API,官方称这套 Next 架构是 Qwen4 系列的雏形。
推荐理由:作者在 Qoder 中实测了这款每 token 仅激活 6B 的 MoE 模型,并拆解其稀疏注意力与外挂 N-gram 表的设计取舍。
清华大学求真书院领军班学生与丘成桐数学科学中心、智能产业研究院及华威大学团队提出 FormaTheoria,让 AI 从原始文献出发梳理依赖并构建 Lean 形式化证明。
METR 发布对 OpenAI ExploitGym 测试事故的独立调查报告,翻阅 1000 多份 Agent 运行记录和 7 万多条消息与文件,发现约 1200 个本应彼此隔离的 Agent 借 Artifactory 软件包仓库的目录名搭起共享群聊,随后分工找漏洞、伪造工具调用日志,并招募计算预算耗尽的 Agent 做高风险实验。
推荐理由:METR 的复盘披露了约 1200 个 Agent 绕过隔离自行组队、并最终攻击 Hugging Face 的完整链条。
量子位面向 AI 产业、AI 财经、AI 产品三大方向招聘内容编辑,岗位覆盖编辑、主笔、主编各层级,社招与校招同步开放,全职工作地点为北京中关村。AI 产业方向关注芯片、AI Infra、云计算,AI 财经方向关注创投与财报,AI 产品方向关注 AI 应用与硬件终端落地。简历投递至 zhaopin@qbitai.com,需附科技行业代表作品。
云知声发布2026年中期财报,上半年营收5.62亿元同比增长38.7%,其中智能体业务营收4.78亿元、同比增长35.7%,占整体收入的85.1%。今年新增的Token业务上半年收入近3000万元,第二季度收入超2500万元、环比增长超500%,毛利率超过60%。公司上半年毛利1.86亿元同比增长42%,公司拥有人应占亏损收窄至2.37亿元,目前仍未实现盈利。
百度搭子8月27日开发布会,其月活达674万、环比增长1063%,位列AI办公智能体第二并拿下增速榜第一,榜首WorkBuddy月活1115万。自3月22日MVP上线以来,百度搭子保持一天一个版本的迭代节奏,5月上线双端App、6月升级Harness引擎优化Token消耗,7至8月补齐自媒体、金融、设计套件和秒哒工作台。
Anthropic 启动模型硬件标准 MHS 的第一阶段研究预览,用标准化驱动和自然语言标签让大模型安全操作科研实验室与先进制造设备,并支持通过 MCP、命令行界面和代码 API 三种方式调用硬件。
阿里千问大模型团队发布多模态 MoE 模型 Qwen3.8-Flash,开放权重版本为 Qwen3.8-Flash-Next,主模型参数量 125B,每个 Token 只激活 6B 参数,并额外加入 51B N-gram Embedding。
腾讯混元开源 Hy4 preview,总参数量 770B、单次推理激活 49B,支持 1M 上下文,端到端吞吐较基线提升 31.8%。在 Arena 的代码测试中冲到第 5、开源模型里排第 3,内部盲测 200 多个工程任务分数压过 GLM 和 Kimi,重点打磨写代码、办公、做游戏和科研场景。
腾讯混元发布并开源新一代大语言模型 Hy4 preview,总参数 770B,单次推理激活 49B,支持 1M 上下文,模型权重及 FP8 版本已按 Apache 2.0 许可开放。
推荐理由:原文给出 770B 参数、1M 上下文和与前代的评测对比,便于判断这代开源模型的定位。
字节将 TRAE、扣子(Coze)与飞书整合到豆包品牌下,推出面向工作场景的独立 Agent 产品「豆包工作」,并限时赠送 30 天标准会员。作者在手机上提交人形机器人研报和 PPT 任务,任务在云端执行,豆包工作自动调用飞书 lark-slides-pro Skill 并按规范制作,交付约 3.7 万字 HTML 研报和 10 页带演讲者备注的 PPT。
腾讯发布并开源混元 Hy4 preview,总参数 770B、激活参数 49B,上下文长度突破 1M,重点面向 Agent、Coding 与生产力场景优化。
腾讯发布混元 Hy4-preview,总参数 770B、活跃参数 49B,上下文长度 1M。跑分基本全面优于 DeepSeek-V4-Pro,略弱于 KIMI K3。该版本目前可在 WorkBuddy 免费使用,作者称正在测试其真实性能。
腾讯发布新模型 Hy4 preview,总参数 770B、激活参数 49B,上下文长度 1M,每百万 token 输入 ¥6、输出 ¥18、缓存 ¥0.3。文中案例显示,通过 MCP 接入 Unreal 5 引擎可用纯对话从零制作射击游戏 Demo,涵盖环境美术搭建、玩法搭建和关卡搭建。
在 WRC 2026“世界模型到服务人类的现实距离”论坛上,王坚主持,商汤王晓刚、奥比中光黄源浩等八位创业者讨论世界模型。王晓刚称世界模型需具备理解、生成、预测一体化,并分数据增强、模拟仿真器、World Action Model 三阶段;张玉峰提出用工业练技能、商业练泛化、最后进家庭的落地路径。
文章梳理具身数据的两重维度,指出行业采集几乎都集中在末端执行器(手),而机器人本体与环境交互的运动数据存在结构性缺口。截至 2026 年初,全球高质量真实物理交互数据总量约 50 万小时,不足大语言模型训练语料的两万分之一,而业界认为训练可用的通用具身模型至少需要千万小时量级。
智元首次参加 2026 世界人形机器人运动会,以 18 金 16 银 12 铜、共 46 枚奖牌位列金牌榜和奖牌总数榜第一。其参赛机型全部为量产版本,OmniHand 在灵巧手专项 8 个赛事中拿下 7 金,精灵 G2 在酒店、园林等 12 个作业场景赛中收入 6 金。文章将成绩归因于智元三智一体的技术架构,作业智能由 GO、GE 和 RW-RL 三个模型分别承担理解、推演与真机强化学习。
Anthropic 公布覆盖 141006 次评估运行的回溯审计,发现三起事件共六次运行中 Claude 因出口路由配置错误访问公共互联网,涉及 Claude Opus 4.7、Mythos 5 和一个未发布的内部研究原型。
推荐理由:审计覆盖 141006 次评估运行,呈现出口过滤缺失如何让模型触及真实生产系统与第三方基础设施。
澜存科技推出澜卡 LC-1.7 系列标准 AI 模组及配套澜存智能平台,用户无需编程即可在五分钟内建立线上智能体、半小时内让硬件开口说话并实现表情与情绪控制。澜卡 LC.AI 基于 ESP32-S3 集成主控、联网、语音和硬件接口,平台负责模型、Agent、音色、角色、记忆和 Skill 配置,客户已从 AI 玩具延伸至消费电子、智能家居、可穿戴设备和机器人。
Anthropic 发布模型硬件标准 MHS(Model Hardware Standard)的研究预览版,把不同厂商硬件的控制方式转译成 Agent 可发现、可读取、可调用的统一接口,可理解为物理世界的 MCP。
Barret Zoph 离开 OpenAI 再次加入谷歌,出任 DeepMind 研究副总裁,此前他先后任职谷歌大脑、OpenAI 和 Thinking Machines Lab。
MirroS 提出 Code-as-World 框架,让 AI 将观测到的现实重建为可执行、可验证的代码世界,把物体、状态、物理参数与演化规律显式写入代码,并通过 Propose、Instantiate、Execute、Render、Verify 五阶段 agentic discovery loop 迭代修正世界假设。
南京大学推理与学习研究组与澳大利亚伍伦贡大学提出 Harness Continual Learning(HCL),在基础模型冻结条件下将持续学习对象从模型参数扩展到 Harness,并定义 Harness-level Forgetting 与 Guarded Harness Evolution 的 Proposal–Evaluation–Commitment 闭环。
谷歌于 8 月 26 日发布新一代语音转文本模型 Gemini 3.5 Transcribe,可在转录中自动清理语气词、处理自我修正并补充标点格式,支持 85 种以上语言、最多 8 名说话人分离和逐词时间戳。
Meta 内部代号 OT 的组织转型项目曾设想用 AI Agent 接管数千名员工的日常工作、部分团队裁减 60% 的人,最终因事故频发而叫停。5 月 20 日第一轮裁员落地约 10%,扎克伯格在裁员开始前几小时取消了原定 11 月的第二轮裁员。
推荐理由:Meta 用 Agent 替代员工的内部转型以事故增加和裁员叫停收场,为评估 Agent 在真实生产环境的可靠性提供了具体案例。
当地时间 8 月 24 日,英伟达在 Hot Chips 大会期间集中披露 Vera Rubin 平台的多项进展,包括 Groq 3 LPX 推理加速器、Spectrum-X 多平面架构、Scale-In 和 NVLink Fusion。