AI 推理市场的达尔文式分化
AI 推理市场正像数据库市场一样按工作负载分裂,形成实时(sub-100ms)、近实时(100ms-2s)与批处理三类延迟层级,以及多模态和边缘等不同基础设施。
媒体报道、公司博客与研究文章
AI 推理市场正像数据库市场一样按工作负载分裂,形成实时(sub-100ms)、近实时(100ms-2s)与批处理三类延迟层级,以及多模态和边缘等不同基础设施。
Anthropic 产品经理分享在 Claude Managed Agents(beta)上构建云端智能体的实践:用 Claude Code 对着预发布 API 规格搭建原型,一个下午即可端到端跑通。他借此自动化了采用数据分析、开发者情绪监控、演示构建等长尾运营工作,并称该套可组合 API 让原本难以规模化的流程变得易于自动化。
CodeRabbit、JetBrains、Resolve AI 和 Warp 现已内置 claude-api skill,让开发者在常用工具中直接获得生产级 Claude API 代码。
Anthropic 发布 Claude Cowork 企业部署指南,把 Claude Code 的智能体能力从命令行扩展到桌面,面向分析师、律师、销售和营销等非开发人员。
Anthropic 发布 Claude API skill,这是一个开源 Agent Skill,为 Claude 提供构建 Messages API 和 Claude Managed Agents 的最新参考资料,覆盖 8 种语言。该 skill 随 Claude Code 捆绑提供,也可在 Anthropic skills 仓库获取。
SGLang 为 RL 工作负载引入基于 RDMA 的 P2P 权重更新机制,通过 Mooncake TransferEngine 传输,将 1T 参数 Kimi-K2 的权重传输从 53 秒缩短至 7.2 秒,提速 7 倍,代价是每个训练 rank 额外占用 32G CPU 内存的推理引擎副本。
NVIDIA 发布开源全能多模态理解模型 Nemotron 3 Nano Omni 30B-A3B,在 OCRBenchV2-En 得分 65.8、MMLongBench-Doc 57.5,并新增音频与视频理解能力。
推荐理由:原文列出文档、视频与音频榜单成绩及吞吐对比,读者可据此判断该开源全能模型的能力边界。
OpenAI 通过模型防护、滥用检测、政策执行以及与安全专家的合作,保障 ChatGPT 的社区安全。
华盛顿大学 MacCoss 实验室的 Brendan MacLean 将17年培养新开发者的入职方法应用于 Claude Code,把 AI 上下文放入独立仓库 pwiz-ai,用 CLAUDE.md、技能库和 MCP 集成管理 70 万行 C# 的 Skyline 代码库。
推荐理由:原文给出维护17年、70万行C#代码库的上下文分层和技能库方法,对长期项目接入 Claude Code 有可迁移的参考。
OpenAI 宣布 GPT 模型、Codex 和 Managed Agents 已在 AWS 上线,企业可以在自有 AWS 环境中构建安全的 AI 应用。
推荐理由:OpenAI 的模型、Codex 与 Managed Agents 上线 AWS,企业多了一条在自有云环境内构建 AI 应用的路径。
Anthropic 发布一批面向创意工作的 Claude 连接器,可直连 Ableton、Adobe Creative Cloud、Affinity by Canva、Autodesk Fusion、Blender、Resolume Arena 与 Wire、SketchUp 和 Splice。
推荐理由:连接器把 Claude 嵌入创意行业既有软件,Blender 的 MCP 连接器还向其他 LLM 开放。
Anthropic 发布一批面向创意工作的连接器,让 Claude 可直接对接 Ableton、Adobe Creative Cloud、Affinity by Canva、Autodesk Fusion、Blender、Resolume、SketchUp、Splice 等创意软件。
OpenAI 宣布 ChatGPT Enterprise 和 OpenAI API 已获得 FedRAMP Moderate 授权,使美国联邦机构能够安全采用其 AI 能力。授权覆盖这两项面向机构的产品,OpenAI 未披露更多细节。
Dwarkesh Patel 发布博客悬赏征集 AI 开放问题的解答,目标是招募一位共同研究员。他提出的问题包括:5 家超大规模厂商掌握全球 70%+ 的 AI 算力且大部分预留给 OpenAI/Ant/GDM。
Mistral AI 发布 Workflows 公开预览版,定位为企业 AI 的编排层,提供持久执行、可观测性和人工审批能力。开发者用 Python 编写工作流,可发布到 Le Chat 由业务人员触发,每步在 Studio 中可追踪审计。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作关系,正值 AlphaGo 首尔对局十周年。
OpenAI 与 Microsoft 宣布一项修订协议,简化了双方的合作关系,增加长期确定性,并支持继续推进大规模 AI 创新。原文未给出条款细节。
推荐理由:协议修订简化了双方的合作框架并增加长期确定性,可作为观察两家公司合作走向的节点。
Choco 利用 OpenAI API 构建 AI 智能体,实现食品分销流程自动化,以提升生产力并推动业务增长。该案例展示了 AI 在食品分销行业的实际落地效果。
作者基于 OpenAI 本周在 Hub 上开源的 Privacy Filter,用 gradio.Server 搭建了三个 PII 脱敏 Web 应用:文档高亮浏览器、图像匿名化工具和 SmartRedact Paste。
推荐理由:文章以三个可运行示例展示 Privacy Filter 的接入方式,可供搭建 PII 脱敏应用时参考。
Anthropic 任命 Theo Hourmouzis 为澳大利亚与新西兰总经理,并正式启用悉尼办公室。Hourmouzis 此前在 Snowflake 担任澳新及东盟高级副总裁,将领导本地团队,推动 Claude 进入澳新客户的核心业务。悉尼办公室紧随东京、班加罗尔之后开设,首尔办公室也即将启用。
Runway 将 Kueue 作为 Kubernetes 准入控制器管理多团队共享的 GPU 集群,在保证团队预留容量的同时把 GPU 利用率提升超过 20 个百分点。
OpenAI 发布开源规范 Symphony,用于 Codex 编排,可把 issue tracker 变成常驻运行的智能体系统。该规范旨在提升工程产出并减少上下文切换。
Anthropic 在 Opus 4.7 中更换了 tokenizer,OpenRouter 通过对比从 4.6 迁移到 4.7 的实际用量,测算了这一改动对成本的具体影响。
OpenAI 公布指导其 AGI 工作的五项原则:民主化、赋能、普遍繁荣、韧性与适应性,目标是让通用 AI 尽可能广泛地交到人们手中,而非由少数公司掌控超级智能。OpenAI 称将借助基金会资源与各方合作应对 AI 新风险,并延续迭代部署策略,同时承认随着规模变大,其运营原则的调整会保持透明。
OpenAI 发布 AI Jobs Transition Framework,不再把技术暴露等同于岗位消失,而是围绕 AI 能否承担任务、人是否仍居核心、需求是否随成本下降而增长三个问题评估就业转型。
Dwarkesh Patel 发起 2 万美元博客征文奖,围绕 AI 进展为何未放缓、基础模型公司如何盈利、OpenAI Foundation 如何花钱、非 AI 生产链国家如何应对等四类问题征集答案,每篇不超过 1000 词,5 月 10 日 23:59 PST 截止,前三名分获 1 万、6000、4000 美元。
SGLang 与 Miles 团队宣布在发布当天为 DeepSeek-V4 (1.6T Pro, 284B Flash) 提供推理与 RL 训练的开源支持,针对其混合稀疏注意力、mHC 和 FP4 专家权重架构做了专项适配。
推荐理由:原文给出 ShadowRadix、HiSparse 等具体优化机制和基准数字,读者可以了解混合稀疏注意力架构对推理与 RL 训练系统的实际工程要求。
OpenRouter 发布教程,介绍用 create-agent-tui 和 create-headless-agent 两个 skill 在几分钟内搭建个性化的编码智能体。两种 skill 分别对应终端界面和无头模式,后者可用于脚本与流水线。
推荐理由:原文给出两个 skill 的用法,读者据此可在几分钟内搭出带终端界面或无头运行的编码智能体。
OpenRouter 发布 Agent SDK,提供 callModel 函数,可把一次 chat completion 变成带工具调用、停止条件和成本追踪的多步智能体。该 SDK 支持 400+ 模型。
DeepSeek 发布 V4,Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,两者均支持 1M token 上下文窗口。
推荐理由:原文拆解了 V4 面向长上下文智能体的注意力与后训练设计,可据此判断开源模型跑长任务时的成本变化。
Anthropic 公布 Claude 在美国中期选举及今年全球多场重要选举前的保障措施,Opus 4.7 和 Sonnet 4.6 在政治偏见评测中分别得分 95% 和 96%。
NEC 将向全球约 3 万名 NEC 集团员工部署 Claude,并成为 Anthropic 首个日本全球合作伙伴,双方将面向日本金融、制造和地方政府等市场共同开发安全行业 AI 产品。
Anthropic 为 Claude 平台推出 Rate Limits API,管理员可通过编程方式查询其组织与工作区已配置的速率限制。
DeepSeek API 已支持 V4-Pro 与 V4-Flash,兼容 OpenAI ChatCompletions 接口与 Anthropic 接口,base_url 不变,model 参数改为 deepseek-v4-pro 或 deepseek-v4-flash。
推荐理由:官方说明了新模型接入方式与旧模型名停用时间,开发者可以据此安排迁移。
OpenAI 发布 GPT-5.5,这是一款面向编码、研究和数据分析等复杂任务的模型。该模型强调跨工具处理这些任务。
推荐理由:OpenAI 发布 GPT-5.5,面向编码、研究和数据分析等复杂任务,读者可了解其跨工具能力定位。
OpenAI 发布 GPT-5.5 系统卡,介绍该模型面向写代码、在线研究、分析信息、创建文档与表格等复杂实际工作,并能跨工具完成任务。系统卡披露了预部署安全评估和 Preparedness Framework 下的针对性红队测试,覆盖高级网络安全与生物能力,并在发布前收集了近 200 家早期访问伙伴的反馈。
推荐理由:系统卡列出 GPT-5.5 的预部署安全评估、针对性红队测试和近 200 家早期访问伙伴的反馈,读者可据此了解其发布前的安全审查流程。
OpenAI 列出 Codex 在工作中的 10 个实用场景,覆盖跨工具、文件与工作流的任务自动化、交付物生成,以及把真实输入转化为输出。
ChatGPT Codex 支持通过插件与技能连接工具、访问数据,并遵循可重复的工作流来自动化任务、提升结果。
OpenAI 介绍 Codex 的 10 个日常实用场景,覆盖自动化任务、生成交付物,以及把真实输入转化为输出,横跨多种工具、文件与工作流。
ChatGPT Codex 让用户超越对话式交互,通过自动化任务、连接工具并产出文档和仪表盘等真实成果。该产品定位为在聊天之外完成实际工作的能力。