最新精选
第 241–260 条 · 共 427 条OpenAI 推出 ChatGPT Work 智能体,由 GPT-5.6 提供支持,定位为可承担长时、多步骤任务的智能体。该智能体即日起在 ChatGPT 网页端和移动端向 Pro、Enterprise 和 Edu 用户开放,Plus 和 Business 将在未来几天推出。OpenAI 称 Codex 每周用户数已超过 500 万,其中超 100 万人将其用于软件开发之外的工作。
推荐理由:OpenAI 把智能体能力从编码扩展到销售和财务,案例给出流程从数周缩短到 24 小时的具体参照。
OpenAI 推出 ChatGPT Work 智能体,可在应用与文件间执行操作,必要时为一个项目持续工作数小时,把目标转化为完成的工作。
推荐理由:官方给出跨应用与文件执行任务的能力定位,读者可据此判断项目型智能体的工作方式。
Hugging Face 宣布 vLLM 的 transformers modeling backend 现在在多种 LLM 架构上达到甚至超过 vLLM 手写原生实现的速度,模型作者无需移植即可获得原生推理性能。
推荐理由:官方给出三种 Qwen3 规模下的对比数据和方法,读者可以据此评估是否直接用 transformers 后端替代手写 vLLM 实现。
Microsoft 在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集,精选开源权重模型每周更新,可一键部署到 Azure 预置的 GPU 托管平台。
推荐理由:官方详解 Hugging Face 模型进入 Foundry Managed Compute 的策展流程、支持运行时和部署方式,读者可以据此评估企业侧部署开源模型的实际路径。
Hugging Face LeRobot 团队发布 v0.6.0,引入 VLA-JEPA、LingBot-VA、FastWAM 三个世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及 Robometer、TOPReward 奖励模型和统一奖励 API。
推荐理由:官方完整发布说明覆盖世界模型策略、奖励模型、基准与部署 CLI,读者可据此评估是否升级自己的机器人训练工作流。
Hugging Face 与 SkyPilot 联合推出 store: hf 后端,用一个 hf:// URL 和现有 HF_TOKEN 即可将 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,任务可调度到 20+ 云、Kubernetes 和本地集群。
推荐理由:原文给出具体价格对比和三云基准数字,读者可以据此评估零出流存储对跨云训练成本的实际影响。
Claude Code v2.1.197 引入 Claude Sonnet 5 并设为默认模型,提供原生 1M-token 上下文窗口。8 月 31 日前提供 $2/$10 每百万 token 的促销价,需更新到该版本才能使用。
推荐理由:原文给出了 Claude Code 默认模型切换到 Claude Sonnet 5 的关键细节和限时定价,读者可据此评估是否升级版本。
Google 在 Gemini API 更新日志中发布 gemini-omni-flash-preview 公开预览版,面向高速视频生成和对话式视频编辑,可通过 Interactions API 从文本生成 720p 的 3-10 秒视频,或让静态图片动起来,并支持对话式编辑输出。
推荐理由:官方更新日志同时给出模型入口和生成参数,开发者可以据此评估视频与图像能力的接入方式。
Anthropic 宣布 Claude 模型在 Microsoft Foundry 正式可用,托管于 Azure,由 Anthropic 负责推理并作为数据处理方。
推荐理由:原文给出 Azure 原生托管与 Anthropic 托管两种运行方式及首批可用模型,读者可据此判断企业部署如何选择。
OpenAI 与博通联合打造的首款定制 AI 芯片 Jalapeño 正式展示,博通 CEO Hock Tan 称其性能可媲美英伟达 Blackwell 或谷歌 TPU,OpenAI 计划今年年底前部署,从初始设计到流片仅用九个月。
推荐理由:呈现 OpenAI 与博通定制推理芯片的落地细节,以及训练与推理基础设施走向分化的路线差异。
OpenAI 发布首款自研芯片 Jalapeño,这是一款专为大模型推理设计的智能处理器,从最初设计到流片只用了九个月。OpenAI 负责从零设计芯片架构,博通负责芯片实现、网络和大规模量产,Celestica 负责板卡、机架与系统组装。OpenAI 称早期测试中每瓦性能将大幅优于当前业界最强水平,详细技术报告将在几个月后发布,芯片计划 2026 年底开始部署。
推荐理由:文章交代了 OpenAI 首款自研推理芯片的九个月开发周期以及与博通、Celestica 的分工,可供判断其全栈基础设施布局。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,此前该能力仅由独立的 Gemini 2.5 computer use 模型提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash,并给出 API 入口与企业级防护选项,便于开发者评估接入。
NVIDIA 发布 NeMo AutoModel 开源库,基于 Transformers v5,在 Qwen3-30B-A3B 和 Nemotron 3 Nano 30B A3B 微调中实现 3.4 至 3.7 倍训练吞吐提升与 29% 至 32% 显存下降,只需改动一行 import。
推荐理由:只需改动一行 import,MoE 微调吞吐即可提升 3.4 至 3.7 倍、显存降低 29% 至 32%,读者可据此判断迁移成本。
OpenAI与博通联合发布自研AI推理芯片Jalapeño,这是OpenAI第一颗自研智能处理器,从最初设计到制造流片用时九个月。工程样品已在实验室以量产目标频率和功耗稳定运行ML工作负载,其中包括GPT-5.3-Codex-Spark,早期测试显示其每瓦性能将大幅优于当前最先进水平。Jalapeño计划于2026年底开始初步部署,并与微软等合作伙伴共同推进吉瓦级数据中心。
推荐理由:原文交代了OpenAI自研推理芯片的架构取向、合作分工与部署节奏,读者可据此理解其全栈基础设施布局。
OpenAI 发布首颗自研 AI 芯片 Jalapeño,由 OpenAI 与 Broadcom 联合发布,专门用于大模型推理加速而非训练,并兼容所有 LLM。
推荐理由:芯片由 OpenAI 与 Broadcom 联合设计并给出 2026 年底部署时间和多代路线图,可用于观察自研算力的推进节奏。
Gemini API 为 Gemini 3.5 Flash 推出 Computer Use 工具公开预览,支持基于 intents 的简化操作。内置浏览器、移动端和桌面环境支持,并提供可配置安全策略和高级 prompt injection 检测。
推荐理由:官方日志列出 Computer Use 工具的-preview 能力清单,读者可以对照现有 Gemini 自动化方案评估迁移成本。
IBM 开源了 CUGA(Configurable Generalist Agent)智能体框架,并发布 cuga-apps 项目,内含 24 个单文件 FastAPI 智能体应用示例。
推荐理由:原文给出可直接克隆的 24 个单文件智能体应用模板,并拆解工具与提示词的复用写法。
Anthropic 发布 Claude Tag,让 Claude 作为团队成员加入 Slack 频道,频道内任何人可 @Claude 分派任务,功能今日起面向 Claude Enterprise 和 Team 客户开放 beta。
推荐理由:Claude Tag 把 Claude 以团队成员身份接入 Slack,给出多人共享、异步委派的产品形态与权限隔离方式。
昇腾 0 Day 支持智谱 GLM-5.2,为编程与长程任务提供全面推理优化,A3 系列产品已支持单双机及大 EP 推理部署。官方围绕 MoE 大融合算子、通信与计算融合、多 Token 预测、高并发调度、智能缓存以及 PD 分离与 Prefix Cache 等关键技术做推理优化。GLM-5.2 于 6 月 17 日上线并开源,已在 Day 0 完成与华为昇腾等国产算力平台的推理适配。
推荐理由:原文列出昇腾针对 GLM-5.2 的多项推理优化技术,读者可了解国产算力平台适配长上下文模型的工程路径。
Anthropic 在 Claude 上线 MCP 连接器的企业托管授权,管理员可通过身份提供商为整个组织统一配置连接器,用户首次登录即自动获得访问权限,无需逐人授权。
推荐理由:原文给出企业托管授权的接入路径与首批支持方,读者可据此了解 MCP 连接器的企业部署方式。