中科院自动化所提出 PhiZero:让世界模型学会「物理语言」
中科院自动化所团队提出世界模型 PhiZero,通过自监督学习从大规模真实视频中获得离散的「物理语言」表示,并构建 Reason-then-Render 框架:Physical Language Tokenizer 将状态变化编码为符号序列,Physical Language Reasoner 自回归预测未来符号,再由扩散解码器还原为视频。
微信公众号
中科院自动化所团队提出世界模型 PhiZero,通过自监督学习从大规模真实视频中获得离散的「物理语言」表示,并构建 Reason-then-Render 框架:Physical Language Tokenizer 将状态变化编码为符号序列,Physical Language Reasoner 自回归预测未来符号,再由扩散解码器还原为视频。
清华大学、中国科学技术大学、SparcAI 等团队提出 OVOW,可从一段普通单目视频重建实例级 4D Mesh 世界并送入物理引擎仿真,已被 ECCV 2026 接收。
据彭博社报道,Anthropic 向投资者披露,截至今年 7 月底其年化营收运行率已达 650 亿美元,最新结束季度的初步收入超过 115 亿美元。2025 年末该指标刚刚超过 90 亿美元,今年 5 月跨过 470 亿美元,两个月增长约 38%,且该季度已录得调整后营业利润为正。据《金融时报》报道,投资者预计 Anthropic 可能在今年 10 月上市,估值达 2 万亿美元甚至更高。
推荐理由:材料把 Anthropic 营收暴涨与企业级 Agent 的消耗模式联系起来,并给出其 IPO 前的估值筹码。
OpenAI 内部设有一个 friction@openai.com 邮箱,员工遇到技术故障、流程失灵甚至停车位不足都可上报,重要问题可能直接惊动 CEO 山姆·奥特曼或总裁格雷格·布罗克曼。
Current Robotics 发布 CurrentWorld-0,称其为全球首个将跨本体、多视角与力触觉预测整合进同一世界仿真器的物理世界模型,可建模移动机器人、双足人形与灵巧手,并处理柔性物体和流体。该模型不靠人工编写物理公式,而是从真实交互数据中学习动作后果,用于机器人策略评测,并支持人类遥操作接管失败状态、回滚生成新训练数据。
Symbiosis Robotics(共生知行)发布 Direct Perception Control(DPC),取消需独立 Whole-Body Tracker 追踪的中间运动表示,直接由画面、任务和身体反馈计算关节与手部目标。
RoboScience 机器科学发布首款轮式仿人形通用操作机器人 REX G1,搭载自研 VLOA 架构通用具身大模型 Visics,面向物流、工厂、零售及家庭场景。
在 OpenAI 工作十年的 GPU 内核工程师 Scott Gray 把社交账号简介改为「Former GPU geek at @OpenAI」,被广泛报道为已离职,他本人和 OpenAI 均未发声。
北京大学、阶跃星辰与北京邮电大学联合提出 TensorCast,在计算引擎、网络与存储之间引入统一可编程的张量生命周期管理抽象层,将模型权重、KV Cache 等张量状态从具体系统中解耦。
智象未来发布原生全模态交互式世界模型 HiDream-O1-World,基于自研原生全模态 UiT 架构,支持文本、图像、交互等多模态输入,可生成具长时空一致性和物理一致性的动态世界。
大连理工大学、Alaya Lab 与东京大学团队联合提出 Vinci2,把第一人称视频助手的主动服务形式化为基于持续视频流的决策与生成联合任务,论文已被 ECCV 2026 接收。
开源项目 watermarks-remover 发布五天在 GitHub 获 11k Star,可去除 Claude、Gemini 和 OpenAI 的 AI 水印。
ScienceDiscovery 是基于 Agent OS(JiuwenSwarm)开发的一站式 AI 科研工作台,正式发布 v0.1 版本,在生物医学智能体基准 BiomniBench-DA 上基于 GLM-5.2 模型评测分数达 77.4,达到业界 SOTA。
循环模型在隐空间中反复运行同一组网络层,但测试时增加循环次数未必提升表现:1.4B 参数的 Ouro-Thinking 在 AIME 2024 上从第四轮 65 分掉到第八轮 38.67 分。2026 年的 Parcae 研究发现循环语言模型易出现残差爆炸和损失突升,重新设计稳定机制后验证集困惑度最多降低 6.3%,13 亿参数下超过传统 Transformer 基线。
初创科技公司 CEO Lech Mazur 借助 GPT-5.6 Pro 完成森多夫猜想的证明,论文配有约 9 万行 Lean 4 形式化代码。陶哲轩用数天时间在大量 AI 辅助下消化、简化并重新形式化该证明,Lean 代码缩减到约 1.5 万行,并发现整理后的论证实际上证明了更强的 Phelps-Rodriguez 猜想,该猜想已于 1972 年提出。
推荐理由:一篇非职业数学家借助 AI 完成的证明经陶哲轩简化后得出更强结果,可看到 AI 参与数学研究的具体分工。
香港中文大学与中国科学技术大学团队提出 VideoCoCo,用可执行代码作为"过程级思维链",先由 Coding agent 生成 Blender 白模视频固定动力学过程,再由 Visual agent 重绘为真实画面。
优必选发布仿生陪伴人形机器人「优世界 U1」,售价 11.98 万至 99 万元,累计订单 13361 台;珞博智能的 AI 潮玩 Fuzozo 芙崽国内销量累计近 30 万台。研报预计 2025-2028 年我国 AI 情感陪伴市场规模从 38.66 亿元增至 595.06 亿元,年复合增长率 148.74%,但业内对同质化拼装与数据隐私仍有顾虑。
中科大联合华为、清华等提出 RiO-DETR,将端到端 DETR 旋转检测推进到实时区间,已被 ECCV 2026 接收为 Oral。在 DOTA-1.0 单尺度下,4.0M 参数的 RiO-DETR-n 端到端延迟 2.7 ms、AP50 达 78.4,最强的 RiO-DETR-x 以 29.9 ms 跑出 81.8 AP50。
据彭博看到的投资者文件,Anthropic 今年第二季度初步营收超过 115 亿美元,较去年同期的 7.87 亿美元增长超过 14 倍,也高于其此前至少 109 亿美元的预期,并录得正的调整后营业利润。
斯坦福、CMU、MIT、UT Austin 等机构的研究人员发布系统提示词库 System Prompt Index,汇集 Claude、ChatGPT 等 400 多款 AI 产品的 1000 余个系统提示词,并提出以用户为中心的系统提示词审计框架 AISPA,相关代码和模型已全部开源。
OpenAI 推理模型方向研究者 Giambattista Parascandolo 2020 年在 MIT 面试教授岗位时,因报告用 GPT 做推理被多数面试委员会教授斥为「无稽之谈」。该报告提出「开放式推理」,即模型可投入更多时间和计算持续修正答案,并主张将语言作为推理载体、把学习过程纳入 Agent 操作空间。他 2021 年加入 OpenAI,后参与 GPT-4 及 o1、o3 基础研究。
浙江大学团队开源 AI 科研智能体 Polaris,把文献调研、想法生成与评审、实验、论文写作与评审六个阶段串成一条流水线,研究者只在关键节点做决定。想法评审由多位立场各异的 AI 评审员正反辩论后按 Elo 排名,实验环节可连接实验室 GPU 服务器自动设计、编码、训练并逐项校验产物与指标,遇到取舍节点会暂停向研究者提问。
2026 年 7 月 Stack Overflow 全站提问量只有 1304 个,而 2014 年 3 月的单月峰值是 20.7 万个。开发者 Daniel Lockyer 把来自 Stack Exchange Data Explorer 的数据画成折线图发到 X,称这是「一个时代的终结」,Pieter Levels 转发后追问没有新内容后下一代模型拿什么训练。
机器之心梳理 Anthropic 近期争议,指出其内部文化裂缝与资本市场压力同时显现。匿名投资人与博主 Brian Roemmele 的转述称,公司投资者和员工士气低迷、对日渐封闭的高层不满,这些说法尚未得到 Anthropic 证实。
Waymo 联席 CEO Dmitri Dolgov 在 Y Combinator Startup School 演讲中回顾,团队约 12 人用 18 个月完成累计行驶 10 万英里、在 10 条约 100 英里路线上全程无人干预的 Demo,但此后约 10 年才推出无人驾驶服务,再用约 5 年扩大规模。
北京大学、东华大学与华南理工大学团队提出 UniMotion,将连续运动作为独立模态纳入统一多模态模型,在同一框架中连接 Motion、Text 与 RGB,论文已被 ECCV 2026 录用。该框架基于 Show-o2 1.5B,覆盖运动理解、生成、预测与编辑等七项任务,是对比方法中唯一覆盖全部任务方向的模型。
机器之心解读了 DeepSeek Harness 背后的八十页论文《A Programming Paradigm for Spatiotemporal Composability》。
推荐理由:文章把八十页论文里的效应与余效应机制讲成运行时插件的卸载设计,便于理解自修改智能体如何干净回收组件。
Anthropic 发布第二份《风险报告》,共 186 页,披露了一款尚未向公众开放、能力略强于 Claude Mythos 5 的内部模型 Model 2,它已被大量用于编码、数据生成和其他智能体任务,并与 Mythos 5 并列公司内部使用最多的模型。
北京邮电大学牵头,联合北京大学、清华大学、南京大学、明体科技和面壁智能提出 Physical AI 统一推理运行时 PhyAI,论文已发布在 arXiv。
小红书 dots 实验室宣布开源 dots3-note preview,它是 dots3 系列首个开源版本,总参数 280B、激活参数 16B,支持 512K 超长上下文窗口,具备文本、视觉与语音多模态理解能力,并针对复杂推理、Agent 和多模态感知做了优化。
Transluce 发布研究《User awareness in frontier models》,在 280 个用户身份、4 项任务和 24 个模型上测试,发现模型会从上下文推断用户身份并调整回答,对齐与安全研究者的行为位移最大。
音潮大模型 V4.0 于 8 月 14 日全平台上线,从底层重新训练,重点提升指令理解、情绪落地与曲风细分,并新增俄、德、葡、意、法五大语种,实现全球十大主流语种覆盖。纯音乐生成同步向普通用户开放,此前仅面向 B 端商用客户。该模型全程依托壁仞国产 GPU 训练,已连续两年为 WAIC 世界人工智能大会制作官方主题曲。
OpenAI 联合 AI 芯片厂商 Cerebras 预览了旗舰模型 GPT-5.6 Sol 的全新服务层级超高速模式(Ultrafast Mode),输出速度最高可达 750 tokens/s,相比标准模式约 53 tokens/s 的推理基线提升最高 14 倍,且不降低质量。
ChatTJB 是在旧金山买广告牌宣传的「大语言模型」,实际所有消息都由一位名叫 Tucker 的真人亲自阅读、思考后用两根大拇指手工回复,连图像生成也是他手绘完成。
Google 联合创始人谢尔盖·布林近几个月深度介入公司的 AI 研发,推动资源投入递归式自我改进(RSI),并要求关键 AI 员工全力投入 Gemini。Google 于 8 月 5 日调整 DeepMind 管理层,Demis Hassabis 转任董事长,Koray Kavukcuoglu 接管日常运营并继续负责 Gemini。
京东健康 8 月 13 日公布 2026 年中期业绩,总收入 409 亿元、同比增长 15.9%,Non-IFRS 经营利润 35 亿元、同比增长 40.3%,AI 医生「大为」在绩后电话会上被数次提及。
包括 OpenAI、Anthropic、Google、Meta、Microsoft 在内的一批公司签署了欧盟《AI 生成内容透明度行为准则》,承诺推进 AI 生成内容的标记与检测。
推荐理由:Claude 的水印方案给出了可查验的落地细节,也让人看到文本水印在改写与翻译后可能失效的边界。
机器之心联合多个合作伙伴发起「点燃 AI 火种·助力科研到创业」长期计划,为从事创新性 AI 技术研究的项目提供 200 万元概念验证基金和顶级早期投资机构种子轮风险投资。每期精选 5 个项目开展线下闭门评审,并配套 BP 打磨、资本对接、产业资源链接等全流程服务,全年滚动征集。
DeepSeek 开源了开发者预览版智能体框架 DeepSeek Harness,它是一套用来构建、运行和扩展智能体的 SDK 与应用框架,默认可连接 DeepSeek 模型,开源地址在 GitHub。
推荐理由:作者以提前内测的第三方身份跑通游戏与 3D 动画案例,展示了这套插件化智能体框架的组装方式与能力边界。
小红书 dots 团队与上海交通大学 X-LANCE 实验室开源 20 亿参数端到端自回归 TTS 基座 dots.tts,在连续隐空间中逐块建模声学,不使用离散声学 Token。