AI 日报 · 2026 年 10 月 7 日 · 星期三
AI RADAR
Bloomberg:DeepSeek 接近完成至少 120 亿美元融资,估值或达 710 亿美元
Bloomberg 报道 DeepSeek 接近完成至少 120 亿美元融资,高于其自身募资目标,估值可能达 710 亿美元,V4 Flash 发布后需求激增,已签署的 term sheets 可能使总额接近 150 亿美元。同日 Mistral 发布 1 万亿参数开源权重模型 Mistral Large 4 公测预览,OpenAI 则洽谈阿联酋基金与 BlackRock 参与 300 亿美元融资。

模型发布/更新
Mistral 发布 Mistral Large 4 公测预览,1 万亿参数开源权重模型
Mistral 发布 Mistral Large 4(ML4)公测预览,1 万亿参数、490 亿激活参数的原生多模态模型,权重将于本月底开放。
Google DeepMind 发布 740M 参数多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布开放权重多模态嵌入模型 EmbeddingGemma 2,将文本、图像、视频帧和音频映射到统一向量空间,参数量 740M。文本权重约 191MB、完整多模态约 567MB 即可在 Pixel 11 Pro 上运行;无需微调即可做零样本意图路由,MacBook M5 Pro GPU 上视觉嵌入低至 37.3ms。
DeepSeek V4.1 Flash 在 ARC-AGI (Verified) 上的评测结果
ARC Prize 公布 DeepSeek V4.1 Flash 在 ARC-AGI (Verified) 上的评测成绩。ARC-AGI-2 得分 72.9%,每任务成本 $0.13;ARC-AGI-1 得分 94.5%,每任务成本 $0.07。相比 V4 Flash 的最好成绩,ARC-AGI-1 高 5.5 分、ARC-AGI-2 高 11.5 分,但每任务成本高出约 250%。
Mistral Large 4 上线 Agent Arena 与 Code Arena
Mistral 的 Mistral Large 4(Le Chonk,1T 参数、49B 激活、原生多模态)已上线 Arena。用户可在 Agent Arena 中用网络搜索、文件系统和终端工具测试其长程智能体任务表现,票数将参与评测,分数随后公布;该模型也可在 Code Arena 的 WebDev、Text 和 Vision 中使用。
OpenAI 公布内部前沿模型在数学开放问题上的新结果
OpenAI 公布其内部前沿模型在数学开放问题上的新结果,并在 GitHub 上分享 Lean 证明形式化和研究细节。
蚂蚁 Ling 3.1 Flash 发布,Artificial Analysis 智能指数从 20 升至 41
Ant LingAGI 发布推理模型 Ling 3.1 Flash,总参数 560B、激活 25B、上下文窗口 1M tokens,在 Artificial Analysis Intelligence Index v4.3 得分 41,较 8 月发布的 Ling 3.0 Flash 的 20 分大幅提升,智能体能力进步明显,权重即将开放。
产品发布/更新
Claude 接入 Google Docs、Sheets 和 Slides,可在侧边栏直接编辑文件
Claude 现在可在 Google Docs、Sheets 和 Slides 中使用,这些文件也能在 Claude 内打开。在 Google Workspace 中,Claude 位于文件旁的侧边栏,可读取当前打开的内容并就地编辑,每次编辑落地前需用户批准。
Google 发布 Gemini Nano Banana 2.1 图像模型,gemini-3.1-flash-image 将于 10 月 29 日停用
Google 发布 Gemini Nano Banana 2.1(gemini-nano-banana-2.1)正式版,是 Nano Banana 2(gemini-3.1-flash-image)的高效图像生成与对话式编辑更新,保持 Flash 级速度和成本。
Gamma 发布 Gamma 5:以智能体为核心重构演示文稿制作
Gamma 发布 Gamma 5,将 Agent 置于平台规划、设计和编辑演示文稿的核心,官方称为公司史上最大产品改版。Agent 会先询问目标和受众并展示计划再动手构建;支持导入 PowerPoint 并保留格式导出,可原地重设样式且保留原内容;Notion、Slack 和 HubSpot 连接器可为每份文稿汇集上下文。旧文稿仍保存,用户可随时使用 Gamma Classic。
Sierra 与 Meta 发布 Personal Agent Protocol 开放协议
Sierra 与 Meta 联合 Genesys、Shopify、Stripe、Walmart 等企业推出 Personal Agent Protocol 开放标准,定义个人 AI 智能体与企业交互的方式。协议基于 OAuth 构建会话,消费者可控制智能体的只读或写入权限,企业可通过网站、基于 MCP 和 OpenAPI 的 API 或自有智能体接入,并计划本月发布 v0.1 规范和参考实现。
行业动态
Bloomberg 报道 DeepSeek 接近完成至少 120 亿美元融资,估值或达 710 亿美元
Bloomberg 报道 DeepSeek 接近完成至少 120 亿美元融资,高于其自身募资目标,估值可能达 710 亿美元。V4 Flash 模型发布后需求激增,已签署的 term sheets 可能使总额接近 150 亿美元。
Anthropic $518B 算力承诺中约 $413.7B 即使闲置也须支付
Anthropic 的 $518B 算力计划中约 $413.7B(约年均 $41B)为无论是否使用都须支付的承诺,数据来自投资 Anthropic 的两只基金向 SEC 提交的招股说明书。
被 AI 取代的知识工作者,正在训练 AI 做自己原来的工作
《The Verge》与《New York》联合发布非虚构报道,采访 30 多名劳动者,揭示他们被 AI 取代后转入 Mercor、Scale AI 等数据平台,为训练模型编写评分细则、标准答案和推理轨迹。
亚利桑那州上诉法院裁定 AI 生成受害者视频影响量刑,凶手将获重新量刑
亚利桑那州上诉法院裁定,Gabriel Horcasitas 量刑听证中播放的 AI 生成受害者 Christopher Pelkey 视频带有"过度情感影响",过失杀人罪名维持但刑期须重新考虑。
SemiAnalysis 实测:200美元订阅下 Anthropic 给出的算力价值约为 OpenAI 的5倍
SemiAnalysis 实测各大厂商订阅套餐,200美元月费下 Claude Max 20x 中端主力模型 Opus 5.5 可跑出折合11726美元的 API 等价 Token,为 ChatGPT Pro 200(2084美元)的5倍以上。
Meta 和微软削减内部 Claude 使用,Anthropic 称整体影响有限
据 The Information 报道,Meta 将内部 Claude Code 活跃用户从 6 万砍到 3 万,推动员工转向自家 Muse Code(内部用户超 6000 人)和 MetaCode(超 3 万人)。
Bloomberg:OpenAI 洽谈阿联酋基金和 BlackRock 参与 300 亿美元融资
Bloomberg 报道,OpenAI 正与多家阿联酋投资基金(包括阿布扎比的 MGX)洽谈,寻求其牵头 300 亿美元融资轮,投前估值 1.4 万亿美元(不含新增资金)。BlackRock 讨论一同参与,现有投资方 Thrive Capital、Andreessen Horowitz 和加州大学捐赠基金也在洽谈加注。
Wikimedia 称与 OpenAI 相关的智能体可能致 Wikidata 查询服务部分宕机
Wikimedia 基金会表示,与 OpenAI 相关的智能体可能部分导致了 Wikidata 查询服务宕机,事故记录将部分宕机定于 5 月 7-11 日。这些智能体发出数百万次 API 请求并抓取数百万页面,主要集中在 Wikidata 和 Wikimedia Commons;基金会同时归咎于激进的爬虫,只声称智能体是可能因素。
论文研究
AutomationBench Verified 审查 Zapier 基准评分器,206 个验证器缺陷改变 Kimi K3 近 28% 的评分
Parsewave 发布 AutomationBench Verified,审查了 Zapier AutomationBench 全部 600 个公开任务,确认 206 个验证器存在真实缺陷并全部修复。
技巧与观点
Claude Code 推出 Cloud sessions,可为每个任务在全新 VM 上运行
Claude Code 推出 Cloud sessions,为每个任务在全新 VM 上运行 Claude Code,可同时启动多个任务,合上笔记本后仍继续运行。官方同步发布了一份实地指南,介绍七种适合该方式的工作流,以及如何首次连接 GitHub,见 https://claude.dev/blog/claude-code-in-the-cloud。
PromptArmor 演示后门 Skill 绕过 Anthropic Skill 扫描器并窃取用户文件
PromptArmor 发布研究称,含后门的 Skill 可通过运行时从外部数据源加载恶意 payload 绕过 Anthropic 的 Skill 扫描器并被评为 pass。
Vercel COO 讲解如何用智能体自动化 Inbound 销售
Vercel COO Jeanne DeWitt Grosser 在 Tom Tunguz 的 Office Hours 节目中讲解团队如何搭建运行销售漏斗顶端的智能体。
Anthropic 工程师谈 Claude Code:CLAUDE.md 可能该删了,Agent 安全与 Claude Mods 也在计划中
Anthropic Claude Code 团队成员 Thariq Shihipar 做客 Latent Space 播客,确认 Claude Code 将支持 AGENTS.md,并认为随着模型变强,CLAUDE.md 这类静态指令文件最终可能不再需要,新项目甚至可以先不写。
Mustafa Suleyman 创办 The Humanist Review,刊发 Daron Acemoglu「10 年仅 5% 工作被 AI 替代」长文
Microsoft AI 负责人 Mustafa Suleyman 宣布新杂志 The Humanist Review 创刊,首期刊发诺贝尔奖得主 Daron Acemoglu 的文章。