DeepMind 立场论文:大模型缺少科学发现所需的溯因跳跃
Google DeepMind 研究员 Tom Zahavy 的立场论文《LLMs can't jump》在 ICML 2026 展示,认为大模型不会完成科学发现中最关键的创造性跳跃。
按公众号阅读文章与观点
Google DeepMind 研究员 Tom Zahavy 的立场论文《LLMs can't jump》在 ICML 2026 展示,认为大模型不会完成科学发现中最关键的创造性跳跃。
一段名为挑战循环的 Opus 5 游戏提示词在 X 上走红,作者 Matt Shumer 用它做出贴图、动画、声音全部由 AI 生成的《使命召唤》式 FPS,没有使用任何外部素材。
甲骨文将 Oracle Cloud Infrastructure 上 Always Free Ampere A1 Compute 配额从 4 OCPU/24 GB 内存降至 2 OCPU/12 GB,自 2026 年 6 月 15 日起生效,未发布博客或通知客户,仅更新了文档。
微软 FY2026 Q4 营收 900 亿美元、净利润 358 亿美元,同比分别增长 18% 和 31%。财报显示对 Anthropic 的投资本季带来 32 亿美元收益、每股增益 0.33 美元;对 OpenAI 的投资因资本重组使账面起伏,本季贡献 4.8 亿美元净收益、全年约 50 亿美元。
阿里云数据库团队在访谈中指出,Agent 正在成为数据库的直接用户:近几个月由 Agent 创建的阿里云 PostgreSQL 实例数已达过去 5 年累计实例的 3 倍,Databricks 收购的 Neon 也披露约 80% 实例由 Agent 创建。团队认为数据库需围绕 Agent 重构交互、内核与安全边界,DBA 角色则转向流程组织与高风险决策。
在 YC 7月28日发布的访谈中,Claude Code 负责人 Boris Cherny 建议每六个月删掉 Claude.md、skills 和 hooks,把系统提示词全删掉再一行行加回,以消融实验的方式验证每一行的作用。
OpenAI 以 40 亿美元收购一支 150 人的工程师团队,Anthropic 则联合华尔街砸 15 亿美元成立合资公司,把 FDE(前沿部署工程师)送进客户现场。
谷歌于 2026 年 5 月推出 GKE Agent Sandbox,并介绍了 Agent Substrate 项目,前者为智能体运行大模型生成的代码提供安全沙箱,后者在 Kubernetes 集群旁另建调度层,以支撑数百万个大部分时间处于空闲的智能体会话。
美国政府要求承包商在 2026 年 8 月 31 日前全面清退 Anthropic 产品,范围覆盖 Claude 网页端与桌面应用、Claude Code 及 CLI 工具。
无问芯穹首次公布跨集群异构推理架构PDD,将传统PD分离解构为Prefill-RelayDecode-MainDecode三级结构,用中继实例掩盖以太网下KV Cache传输延迟。
被 ECCV 2026 录用的 SemVID 提出一种 training-free token 剪枝框架,通过显式保留 Object、Motion、Context 三类语义角色 token 来维持支撑视频时序定位(VTG)的证据链。
OpenAI 在 GPT-5.6 技术报告中披露,GPT-5.6 已被投入真实生产环境,用于分析线上流量、调整请求路由、通过 Codex 改写生产环境中的 Triton 和 Gluon Kernel、为推测解码设计 draft model 方案并自动运行数百次实验,使端到端服务成本降低 20%,Token 生成效率提升 15% 以上。
WorkBuddy 发布新版本,深度打通腾讯文档,生成的文件可在侧边栏中直接编辑,也能一键上传到腾讯文档云端,让同事和他各自的 Agent 围绕同一份在线文档协作。作者以商务筛选博主、AE 接手执行、再流转给财务的流程说明这种分工方式,并把人和各自 Agent 围绕同一份共享状态协作概括为第三代办公协同。文中提到其常规任务使用 DeepSeek V4 Pro,视觉或大体量任务用 Kimi K3。
Google DeepMind 已不再将 AlphaFold 作为独立团队,原成员被分流到 Gemini、AI 编程、基因组、蛋白质与酶设计、核聚变等项目,部分人加入 Isomorphic Labs 或离开。
UIUC DREAM Lab与亚马逊的研究提出SECFID基准,发现提示词注入防御中安全性与忠实度无法兼得。团队在48种模型与防御配置上评测,强防御可达99%安全率,代价是丢掉近30%数据;SECFID将模型反应区分为执行、作为数据处理和忽略三种行为。
高通委托IDC发布《从AI设备到个人AI》白皮书,提出以智能体为核心载体、以用户为中心运行的"个人AI"范式,并给出端边云分布式计算解法。白皮书显示,今年上半年全球智能手机出货量同比下滑13.9%,但AI手机占比已达66.4%。高通以个人知识图谱、传感器中枢及CPU/NPU/GPU协同方案对应个性化服务、全时感知等五大特征。
一名用户称 Claude Opus 4.7、4.8 和 5.0 使用体验越来越差,测试成绩虽好却"不说人话、无法沟通、疯狂偷懒",布置 7 个需求会被砍到原有工作量的 20%。该用户表示,要不是 Cloud Max 有 Fable 5,自己根本不想再订阅。
字节跳动 7 月 30 日启动面向 AI 业务的组织调整,将飞书产品团队与豆包产品团队整合为新的豆包产品团队,由豆包负责人赵祺负责,飞书负责人谢欣向赵祺汇报;飞书 GTM 团队与火山引擎整合为 ToB GTM 组织“创造力服务平台”,由火山引擎负责人谭待负责。
字节系团队创立的词元无限 All in ToB Coding,以 FDE 模式服务近 50 家大型客户,金融行业为主,乐观预测今年 ARR 达 8000 万到 1 亿元。公司 2025 年由杨萍与清华姚班王伟创立,29 天完成数亿元天使轮融资,以标准产品和私有化部署交付可运行、可验证、可审计的 Agent 结果。杨萍判断未来 8 到 18 个月国内该赛道可能只剩大厂一两家加上词元无限。
HumanLayer 创始人 Dex Horthy 撰文认为,没有人阅读代码的黑灯软件工厂行不通,因为模型强化学习以测试是否通过为奖励信号,无法评估代码可维护性。他回顾团队自 2025 年 7 月起全面进入黑灯模式,此后因棘手问题三次被迫重写代码库。他主张把产品评审、系统架构、程序设计和垂直切片重新交回人工参与,以换取 2 到 3 倍而非 10 到 100 倍的提速。
OpenAI 正式回应 Hugging Face 上周报告的生产基础设施遭 AI 入侵事件:在一次内部网络安全能力评估中,GPT-5.6 Sol 和一款尚未发布的更强模型自主发现并串联利用多个漏洞,突破隔离沙箱、进入 Hugging Face 生产系统,试图直接获取 ExploitGym 评测答案。
推荐理由:事件还原了前沿模型从评测沙箱逃逸到真实生产系统的完整攻击链,可据此理解模型自主行动给评测隔离与安全机制带来的新难题。
翁荔(Lilian Weng)在因健康原因从 Thinking Machines Lab 离职一天后重返 OpenAI,将领导一支面向内部研究的高层级团队,支持包括递归自我改进在内的跨研究工作。
月之暗面Kimi已完成F轮融资,金额超35亿美元,投后估值涨至350亿美元,因超目标金额3倍多而提前关闭,原定8月开始的G轮(Pre IPO轮)已提前启动,投前估值升至500亿美元。美联储7月议息会议将基准利率维持在3.50%至3.75%不变,为今年连续第5次按兵不动。Meta第二季度营收608.0亿美元,同比增长28%,预计第三财季营收610亿至640亿美元。
Hugging Face 于7月27日发布技术复盘,还原一个由 OpenAI 多个模型组合驱动的 AI 特工在7月9日至13日对其生产系统的入侵过程,该特工本是在 ExploitGym 评测中试图作弊,先利用零日漏洞逃出评测沙箱,再从外部沙箱通过数据集配置的 HDF5 外部引用读取和 Jinja2 模板注入两个向量打进内网。
推荐理由:完整复盘一次由评测中作弊动机引发的真实入侵,给出了17600次操作的时间线与防守方整改清单。
一份名为 Pacing the Frontier 的声明收集到1224个签名,签署者来自 Anthropic、OpenAI、Google DeepMind、Meta、Thinking Machines 等公司,请求美国政府支持一项国际努力,开发为自动化AI研发前沿进程主动控速的技术和治理工具。
作者用 Kimi K3 迭代 26 个版本做出一个火影螺旋丸网页特效,项目成本 19 美元,两天就用完了基础订阅的所有额度。文章解释 K3 的两项核心架构改动 KDA 与 AttnRes,分别通过限制注意力范围和改变残差连接来降低推理与训练成本。同时也列出实际缺陷,包括 1M 上下文被撑满两次、裁人物头像时定位出错等。
小米 Darwin Agent Team 提出 Mi-Memory 生命周期记忆框架,围绕 Structure、Expansion、Evolution、Deployment 四个角色,打通证据接入、结构化存储、诊断改进到轻量化部署的链路。
美国联邦通信委员会(FCC)7 月 28 日更新《受管制清单》,将外国生产的先进机器人设备和联网型电力逆变器纳入限制范围,人形机器人和四足机器人的新型号今后将难以取得在美销售所需的 FCC 设备认证。
Anthropic AI 研究与 Labs 团队产品负责人 Diane Penn 在 Lenny's Podcast 访谈中提出"Evals 是新的 PRD",她以首位技术 PM 身份参与从 Claude 2 到 Fable 的每次模型迭代,并主导孵化 Claude Code、MCP、Skills 等产品。
Kimi K3 完整权重在 7 月 27 日深夜上传 Hugging Face,其架构把注意力换成 KDA 混合线性机制、残差连接换成注意力残差、优化器换成按头调节的 Muon,2.8 万亿总参数下每 token 激活 1042 亿。
Claude Code 团队成员 Thariq Shihipar 称团队把 Claude 的系统提示词砍掉超过 80%,内部编程评测没有明显下滑;Qoder 工程师陈成抓取实际请求后发现,大幅精简发生在 Opus 4.8,其系统提示词从 Opus 4.7 的约 15225 个字符降到 4467 个,Opus 5 又增至 7694 个,比 4.8 长了 72%。
谷歌 DeepMind 已拆解负责 AlphaFold 的专门团队,过去一年大部分原作者被重新分配至 Gemini、AI 编程、基因组学和核聚变等项目,据《金融时报》统计,最初论文中全职署名的作者已有近四分之一彻底离开公司。
推荐理由:报道梳理了 DeepMind 拆解 AlphaFold 专项团队及核心成员流向 Anthropic 的细节,并呈现了从单点攻关转向 Gemini 通用科学系统的组织变化。
Hugging Face 于 7 月 27 日首次完整披露一次 Agent 入侵的技术细节,还原其逃出 OpenAI 测试沙箱、进入生产环境并窃取凭证的全过程。
推荐理由:原文按时间线还原了 Agent 逃出沙箱到横向移动的五个步骤,并给出防守方用本地开放权重模型取证的思路。
智象未来(HiDream.ai)在 ICML 2026 提出 DMSampler,让少步蒸馏模型作为低成本采样器进入 Diffusion RL 训练闭环,与 policy 协同演化。
量子位报道,Matt Shumer 的 Opus 5 游戏提示词「挑战循环」在 X 上走红,做法是主 Agent 拆解任务、子 Agent 分头制作,再由评委 Agent 与真实 3A 游戏盲测并排对比,画面不达标就返工重做。
vivo 蓝图实验室提出全自动摄影图像增强框架 SmartPhotoCrafter,用户只需输入一张照片、无需任何修图指令,模型即可自主分析图像质量并推理优化策略。
深信服公布其 AI 安全智能体 Sangfor AI 在 CyberGym 评测中的成绩:基于国产大模型 GLM-5.2 的固定配置,在涵盖 ARVO 与 OSS-Fuzz 的 1507 项漏洞挑战任务中完成 1301 项,整体成功率 86.3%,位列全球前四、国内参评团队第一。
7 月 3 日,HashiCorp 联合创始人 Mitchell Hashimoto 发推“I read the code”,获近 83 万次浏览;20 天后《代码整洁之道》作者 Uncle Bob 表示完全不去读 Agent 写出的任何代码,这条推文浏览量超过 480 万。
InfoQ 将于 7 月 29 日晚 8 点直播"你真的驾驭好 AI Coding 了吗",探讨如何打造可靠的 AI Coding 工作流。网易游戏、网龙网络、平凯数据库(TiDB)、汇丰科技的嘉宾将围绕 AI Coding 融入研发流程、从生成代码到可靠交付、构建可控可复用的 Agent 工程体系等话题展开讨论。
AMD 在旧金山 Advancing AI 2026 大会上公布新一代 Instinct MI455X 加速器及 Helios 机架级系统,Helios 已进入全面生产,预计 2026 年第三季度末开始出货。