AI 日报 · 2026 年 10 月 9 日 · 星期五
AI RADAR
数学家呼吁抵制 OpenAI,AI 证明涌入数学界引争议
OpenAI 宣称其内部模型一个月解决超 100 个开放数学问题并一次性发布 700 多份文件,引发数学界争议,部分数学家呼吁抵制。菲尔兹奖得主 Terence Tao 提出 Math 2.0,主张以解释和社区建设取代解题作为学科核心。同日,OpenAI 被曝年化营收接近 500 亿美元,并解雇三名安全研究员。

产品发布/更新
Google 开源 AQuA 环境质量智能体,自动诊断生产环境 Agent 失效
Google 发布并开源 AQuA(Ambient Quality Agent),运行在用户 Google Cloud 项目内,定期从 Cloud Trace、Cloud Logging 或 BigQuery 抽取生产会话轨迹,按抽样、审查、聚类、验证、追踪五阶段输出经验证的失效洞察,并支持结合部署时源码快照做根因定位,可从编码智能体经 agents-cli 驱动。
Claude Managed Agents 教程:用 Claude Code 搭建定时自动化智能体
Claude Devs 发布用 Claude Managed Agents 构建自动化的教程,示例是部署一个按计划读取 Slack 和 GitHub(带凭证和记忆)并发布更新的智能体,可用一条 Claude Code 命令完成设置,并使用 Max 和 Team 计划中包含的新 API 额度。教程链接:https://claude.dev/blog/building-effective-agent-automations/
Google Cloud 在 Gemini at Work 2026 发布通用工作智能体 Gemini agent
Google Cloud 在 Gemini at Work 2026 大会上宣布 Gemini agent,一个统一的工作智能体,可回答问题、处理知识工作、生成媒体并编写运行代码,覆盖 Gmail、Docs、Sheets 等 Workspace 应用及第三方渠道。
Anthropic 推出面向开源项目的免费漏洞扫描服务 OSS Scanner
Anthropic 推出开源漏洞扫描服务 OSS Scanner,为自愿加入的开源项目免费提供由最强模型(含 Claude Mythos)生成的周期性安全扫描。
Google 开源端侧 GPU 推理引擎 ML Drift
Google AI Edge 团队以 Apache 2.0 协议开源 ML Drift,一个跨平台端侧 GPU 计算引擎,作为 LiteRT 的核心 GPU 加速引擎,支持 OpenGL ES、OpenCL、Metal 和 WebGPU。
行业动态
部分数学家呼吁抵制 OpenAI,AI 生成的数学证明涌入数学界引争议
部分数学家呼吁抵制 OpenAI,此前 OpenAI 宣称内部模型一个月解决了超过 100 个开放数学问题并一次性发布 700 多份文件。菲尔兹奖得主 Terence Tao 提出 Math 2.0,主张以解释和社区建设取代解题作为学科核心;Scott Aaronson 称之为 Mathocalypse,并对比 Anthropic 与研究者合作并支付报酬的模式。
Crowdstrike 报告:AI 黑客工具 ARTEX 或助单一攻击者入侵多家韩国银行
Crowdstrike 报告称,一名疑似中文使用者于2026年9月底至10月初利用开源 AI 渗透测试工具 ARTEX 攻击多家韩国金融机构并窃取大量数据,仅新韩银行就有超过 25,000 条含姓名、联系方式、收入和信用额度的记录失窃。
OpenAI 年化营收被曝接近 500 亿美元,与此前预期缺口约 200 亿
金融时报援引向投资者披露的财务文件称,截至 9 月底 OpenAI 年化营收逼近 500 亿美元,比此前媒体估算的 700 亿美元低约 200 亿。差异源于统计口径不同,OpenAI 剔除了 AWS 和谷歌云等合作伙伴销售产生的收入,而 Anthropic 将其计入。报道发布后纳斯达克 100 指数收跌 1.4%,英伟达跌 2.9%,甲骨文跌 5.5%。
Zenity 研究人员:一条提示词即可劫持同一 AWS 账户内全部 Bedrock AgentCore 智能体
Zenity Labs 发现 AWS Bedrock AgentCore 的一组漏洞链,并将其命名为 AgentCorruption。攻击者只需对一个公开智能体有聊天权限,即可通过元数据服务 169.254.169.254 获取临时凭证,进而读取、下载同账户同区域内所有智能体的代码、私密对话和存储凭证,还可篡改长期记忆。
OpenAI 解雇三名安全研究员,当事人称因重视 AI 安全被清除
OpenAI 以向外部 AI 安全组织分享机密信息为由,解雇 Tomek Korbak、Jasmine Wang 和 Mikita Balesni 三名安全与对齐研究员。当事人在公开信中表示,认为被解雇是因为把安全置于公司近期利益之上,并担忧此事会让员工不敢再公开提出安全担忧。
Manus母公司蝴蝶效应完成超5亿美元融资,将回国运营并争夺Agent入口
10月8日,Manus母公司蝴蝶效应宣布完成超5亿美元新一轮融资,由博裕投资、IDG资本领投,腾讯、红杉中国、真格基金继续加持。Manus于9月1日恢复独立运营,由原创始团队领导,正在补充算法、评测等岗位人手并回归国内运营。文章分析其面临大厂把业务网络转化为Agent执行能力的竞争压力,同时个人Agent使用习惯尚未定型,Manus仍有机会争取跨模型、跨服务的独立执行入口。
Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元
Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元,由 Lightspeed 与 Khosla Ventures 联合领投,a16z、Felicis、The House Fund 等参投。自 A 轮以来年化收入超 1 亿美元,平台累计 3.5 亿次会话,不到五个月完成 700 万次 Agent Arena 会话,覆盖 150 多个国家用户。融资同时 Arena 发布基于真实 agent 轨迹构建的 Alignment Index,对 20 多个前沿模型衡量 Unauthorized Action、False Attribution 和 Deceptive Completion 三项信号。Arena 2023 年源于 UC Berkeley 研究项目,2025 年成立公司。
WSJ:Broadcom 为 OpenAI 自研芯片洽谈逾 500 亿美元融资
WSJ 报道,Broadcom 正为 OpenAI 自研芯片洽谈逾 500 亿美元融资,Apollo 和 Blackstone 参与其中,目标 2026 年底前敲定。
论文研究
Google AMIE 与 BIDMC 合作的前瞻性对话式诊断研究发表于 The Lancet
Sundar Pichai 宣布 @TheLancet 发表 Google 与 BIDMC 合作的 AMIE 研究,这是首个针对面向患者对话式诊断的真实诊所前瞻性研究。
技巧与观点
SemiAnalysis 长文分析:北京不会配合放慢前沿,中国的速度优先 AI 安全体制
SemiAnalysis 发布长文,认为中国的 AI 安全路线是速度优先而非安全优先,官方框架虽使用前沿风险词汇,但监管集中在内容与应用层,无基于训练算力的前沿风险义务。
Hugging Face 作者用 ML Intern 花约 103 美元自制七个不存在的模型
作者因官方 Qwen-Image 2.1 的 9B 提示词改写器太耗资源,用 HuggingChat 的 ML Intern 蒸馏出可在 CPU 运行的 0.8B 版本,几天内以约 103 美元总算力成本做了 7 个模型,包括柑橘病害 VLM、Huggy LoRA、视角与涂改 LoRA、Agate 4 步蒸馏等,全部公开在 Hub。
Databricks Lakebase 用数据库分支支撑智能体软件开发生命周期
Databricks 介绍 Lakebase Postgres 的数据库分支能力,为并行编码智能体提供隔离数据库环境。分支基于 copy-on-write,一秒内创建、可 scale-to-zero、闲置不产生计算成本。
LangChain 发布 Restock 示例,演示用 Stripe Link 和 Managed Deep Agents 构建可付款的智能体
LangChain 发布 Restock,一个运行在 Slack 上的办公用品采购智能体示例,通过 Zinc 的 MPP 订单 API 和 Stripe Link 钱包完成真实付款,示例订单为 22.18 美元含费的 12 支蓝墨水笔。