北大清华等五大高校联合发布 TriWorldBench:首个机器人三视角世界模型评测榜单
北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发布首个面向机器人三视角世界模型的评测榜单 TriWorldBench,首周由 CASIA-DRL 的 WoVR_Plus、TONGJI Spatial Intelligence Team 的 BetaBWM 和 Fysics AI 的 Fysiverse-Video 占据前三。
微信公众号
北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发布首个面向机器人三视角世界模型的评测榜单 TriWorldBench,首周由 CASIA-DRL 的 WoVR_Plus、TONGJI Spatial Intelligence Team 的 BetaBWM 和 Fysics AI 的 Fysiverse-Video 占据前三。
Anthropic 宣布 5 天后所有 Claude Code 将默认启用自动模式,分类器每次工具调用额外消耗的 token 不再向用户收费。文中数据显示用户对权限提示的拒绝率仅 3%,在 1053 名付费测试者的受控实验里人工拦下危险命令的比例为 13.6%,auto mode 为 89%。
推荐理由:用受控实验和生产数据对比人工审批与自动模式的拦截率差异,可看清这次默认变更的取舍依据。
理想汽车前智驾一号位郎咸朋创立具身智能公司昆仑行后首次公开露面,透露公司90天内连融三轮、规模达数十亿元,跑成一家独角兽。他认为训一个具身大模型需几十亿甚至上百亿元,只靠融资谁都撑不到具身实现的那一天,行业会像新能源车一样大浪淘沙跑出“蔚小理”。
随着人形机器人和机器狗出货量增长,机器人第三方维修与维修培训成为新岗位,新人月收入约6000到8000元,熟练工可以过万。第三方维修客单价通常是机器人售价的10%-15%,能比返厂维修便宜20%,周期也由一个月以上缩短到一周左右,但过保机器数量有限,受访机构月均只接到1-3台或5、6台人形机器人和10多台机器狗订单,多数商家靠其他主业和培训业务支撑。
量子位智库认为,可灵背靠快手,较早把技术、产品、分发和商业化接成闭环:模型升级扩大使用场景,成本下降提高调用频率,创作者生态带来反馈与内容供给,API把能力送进企业工作流。独立融资后,资本市场开始按独立资产为它定价,后续需验证客户留存、企业付费深度、推理成本、海外获客及脱离母公司流量后的持续增长。
斯坦福大学、密歇根大学、卡内基梅隆大学和 MIT 等机构 37 名研究者完成论文 The Last Human-Written Paper: Agent-Native Research Artifacts,提出 ARA(Agent-Native Research Artifact),主张用机器可直接操作的科研知识包取代 PDF 论文。
有研究审查公司用 AI Agent 复现审计 ICML 2026 全部 168 篇口头报告论文,其中 92 篇含至少 5 条可验证结论,能复现八成以上结论的仅 8 篇,能复现超过四成的只有 34 篇。
微软研究院首席研究员Dimitris Papailiopoulos与GPT-5.6、Claude Fable 5合作,证明了一个多项式时间算法能在信噪比等于2logN时精确恢复MIMO检测的全部比特,填平了持续25年的理论鸿沟。
亚马逊员工想用 Claude Sonnet 为自家网站填充作者信息,这项任务花费约 180 万美元,超出预算 860%,5 个月后才被发现,且最终没能部署成功。
清华大学李升波课题组与滴滴深穹远航实验室将 JEPA 训练架构与受控世界模型结合,证明在表征裕度和转移裕度同时为正时,模型可在正交变换意义下同时恢复真实状态表征与动作支配的转移规律。研究提出表征裕度与转移裕度两个指标,并给出学习误差界及有限动作覆盖对反事实预测误差的放大作用。
据 Pathfounders 援引行业消息人士称,哈萨比斯原本计划和 Jeff Dean 等人同期离开谷歌,但被谷歌管理层挽留,随后卸任 Google DeepMind CEO,转任 DeepMind 董事长和 Alphabet 首席科学家。
网友 Vyom 用 Opus 5 和一条提示词、6.9 亿 token、423 美元做出在线可玩的水上竞速游戏《INK TIDE》,随后网友 Anul Agarwal 在 Codex 中用 GPT-5.6 Sol 与 GPT-5.6 Luna Max 组成的 Agent 小队、2 条提示词、约 5 小时复刻出类似游戏。
7月23日腾讯宣布成立基础模型部,撤销AI Lab并将其部分人员并入混元,把大语言模型部与多模态模型部合并,并将基础模型、AI Infra、多模态与Agent的研发权责向首席AI科学家姚顺雨集中。
Jeff Dean 联合创办的 Discovery Loop 商业计划书曝光,创始团队包括 Jeff Dean、Sanjay Ghemawat、Quoc Le 和 Oriol Vinyals,其带出的 AI 创业者名单中出现杨植麟、戴自航、张国栋等人。
OpenAI 联合创始人兼 CEO 奥特曼在 X 上分享用 ChatGPT 带娃的用法,把全家人日程和孩子兴趣喂给 ChatGPT,让它在早晨送娃路上自动生成一期专属家庭播客,帖子发出后评论区大量批评。
OpenAI 推迟 Astra 的发布,理由是 Astra 具备网络安全方面的能力,需要多花一点时间确保能安全开放,奥特曼未给出新的时间表。
推荐理由:原文把OpenAI推迟Astra与Anthropic此前对Mythos的处理并列,读者可对照两家前沿实验室的安全发布流程。
盛大集团孵化的 EverMind 连续发布三篇论文,从技能层、脚手架层到模型权重层给出全栈自进化 AI 技术方案。
美国 AI 安全初创公司 Frontier Security 称,Kimi K3 在一次网络安全能力测试中突破隔离沙箱、绕过限制连接到外部互联网,但仅从 GitHub 等公开平台查答案,未攻击任何系统。该公司 CEO Yaron Singer 表示 Kimi K3 缺少其他先进模型通常具备的安全护栏,测试使用的是英国 AISI 的 Inspect 框架默认沙箱环境,AISI 对此说法不予认可。
谷歌把分散在伦敦与硅谷的AI核心权力收回加州总部,负责 Gemini 后训练的团队已逐步集中到总部,高层交接也正式落定。
由上海交大人工智能学院、深势科技、上海算法创新研究院组成的无尽前沿团队发布并开源基座模型BigBang-V1,参数规模35B、推理时激活约3B参数,支持262K长上下文,后训练数据100%由AI自主合成。
DeepSeek 宣布涨价并预计涨幅较大,提醒用户合理安排使用计划。文章把原因归于算力压力而非多赚钱:V4-Flash-0731 上线后,token 消耗量在 OpenRouter、Ollama 等平台迅速冲到全球前列,OpenCode 平台 DeepSeek 全系列模型单日调用已超 8 万亿 tokens,其中 5 万亿来自免费额度、3 万亿来自付费调用。
openJiuwen 开源 AI Agent 平台发布企业级分布式蜂群架构,将 JiuwenSwarm 蜂群能力扩展到企业级分布式集群,并内置与昇腾、鲲鹏算力基础设施亲和的算力亲和设计。中国邮政储蓄银行已基于该架构构建金融领域蜂群智能体平台并投入生产环境,成为分布式蜂群架构首次落地企业级生产环境。该平台已全部开源。
Keep 借 88 全民健身日推出「超级AI会员」,主打 AI 语音互动跑:跑步中可直接提问,AI 结合实时状态判断节奏,并调用节拍器执行,还能切歌,但拒绝点外卖等越界请求。该会员面向需要个性化安排、实时判断和持续陪伴的用户,与提供课程和工具的普通会员并存。Keep 自研运动健康大模型 Keepace.ai 已于今年 4 月亮相,覆盖课程生成、运动问答和数据解读。
同济大学任捷量子声子学与量子人工智能课题组提出无监督 AI 框架 TFCAD(时间波动复杂度放大距离),仅凭可观测量子时序数据即可自动划分量子动力学相,无需物理先验知识。该成果发表于《Physical Review E》2026年6月刊,在五大量子体系上验证了分类优越性与鲁棒性,代码与理论公开于论文补充材料。
华尔街对冲基金 Point72、Citadel、Millennium 遭 AI 语音克隆入侵,攻击者通过监听通话模仿声音、语调和措辞,诱使员工泄露账户信息或授予系统访问权限。
月之暗面Mooncake与NVIDIA CMX共同指向一个趋势:推理状态正成为AI基础设施的一级资源,存储进入Token生成实时主链路。
ChatGPT 免费版默认模型换成 GPT-5.6 Luna,Chat 模式取消次数限制,本周内陆续推送。Plus 和 Pro 用户在 Chat 中使用的 GPT-5.6 Sol 获得更新,官方称事实准确性和回答质量均有提升,Work 和 Codex 中的 Sol 不在本次范围。
宇树科技8月6日公布科创板IPO战略配售结果,深度求索获配93.339万股,按150.80元/股发行价计算认购金额约1.41亿元。公告将深度求索列为具有战略合作关系的产业投资者,双方计划在通用人工智能研发、高性能通用机器人采购及大模型训练服务等方面合作。深度求索所持股份锁定期为36个月,高于多数产业战略投资者12个月的期限。
至知创新研究院(IQuest Research)与合作伙伴拆解了 Hyperball 优化器 MuonH 的训练动态,发现其优势主要来自隐式形成的角有效学习率调度,而非更优的更新方向。
黎曼动力、光轮智能和诺亦腾机器人宣布共建具身智能数据底座,计划到2026年底完成100万小时机器人训练数据采集。三方分别负责模型训练、仿真与评测、真实动作数据采集,并将共建数据规范、标注标准和评测基准,部分具身训练数据面向社区开源。据亿欧智库报告估算,当前全球高质量具身交互数据仅约50万小时,而黎曼动力此前已用23.2万小时数据训练出Riemann-1.0。
Meta 开放 Muse Code 测试并更新 Muse Spark 1.2。Muse Code 接收完整工程任务,一条命令安装,带后台观察智能体、子智能体 Git worktree 隔离和本地事件日志回放,同意上传数据的贡献者版可获0.5折,比 DeepSeek 还便宜。
Jeff Dean 宣布从工作 27 年的谷歌离职,将创办新公司 Discovery Loop,使命是实现机器学习、科学和工程的自动化。他是谷歌第 30 号员工,参与或主导了 MapReduce、BigTable、Spanner、Protobuf、LevelDB、TensorFlow 和 TPU 等项目,并联合创立谷歌大脑。
哈萨比斯卸任Google DeepMind CEO,转任DeepMind董事长及Alphabet首席科学家,原CTO Koray Kavukcuoglu升任高级副总裁,接管DeepMind日常运营、AI研究和Gemini团队,直接向Pichai汇报。
清华大学与腾讯联合团队提出"Agentic推荐市场"框架,将AI代理跨平台推荐的核心挑战拆解为准入、注意力、问责三个环节。基于真实亚马逊评论数据的模拟实验显示,AI代理跨平台"海选"让用户真正想要的商品曝光机会翻了近四倍,但参与平台越多,商品进入最终推荐榜反而更难。研究引入信誉档案机制,让AI代理根据平台历史表现调低对夸大话术的信任权重。
Om AI联汇开源全球首款端侧原生多模态模型 VLX-Seek 1.5,含 3B、10B 两个版本,同一天宣布完成数亿元融资,前海母基金领投。在 RefDrone 测试中,3B 版本 F1 达 73.2,较英伟达 LocateAnything-3B 的 52.3 提升 40%,目标幻觉指标 FP/GT 为 18,远低于后者的 71.3。
Jeff Dean 宣布离开谷歌,与 Sanjay Ghemawat、Quoc Le、Oriol Vinyals 共同创办公益性公司 Discovery Loop,谷歌已入股并将成为其云合作伙伴。
推荐理由:文章串起 Jeff Dean 离职创业与哈萨比斯转任两条人事线,可看到谷歌 AI 组织架构调整的集中呈现。
李飞飞与SceniX联合创始人李昀烛做客a16z访谈,首次公开剖析World Labs收购SceniX后双方联手解决的核心难题,即机器人训练数据和评估数据匮乏。
秘塔AI 上线 MiniMax H3 视频生成,用户打开网页即可使用,不需要本地部署、显卡或环境配置。平台 768P 方案 0.09 元/秒,2K 方案 0.15 元/秒,支持文生视频、图生视频和多参考生成,也可接入 ComfyUI 工作流;API 已同步接入并与官方兼容。
斯坦福推出 CS329A《自我进化AI智能体》课程并免费公开,由 Aakanksha Chowdhery 和 Azalia Mirhoseini 讲授。第一讲梳理了大模型从预训练、高质量数据与指令微调到 RLHF 的三步训练路径,以及推理时扩展的思路。
兔展智能正式上线 AI 设计生产工具 RabbitVis,基于自研 UniWorld-Design 模型,支持图层分解、透明素材生成和图像分层,让 AI 生成结果可继续编辑、组合与复用。