Anthropic 恢复对部分类别拒答请求计费,Compliance API 多项更新
Anthropic 恢复对输出前拒答的计费,仅限 stop_details.category 为 "bio"、"frontier_llm" 或 "reasoning_extraction" 三类,按实际运行模型的费率收费,其他类别输出前拒答仍不计费,该变更适用于所有平台。
Anthropic 恢复对输出前拒答的计费,仅限 stop_details.category 为 "bio"、"frontier_llm" 或 "reasoning_extraction" 三类,按实际运行模型的费率收费,其他类别输出前拒答仍不计费,该变更适用于所有平台。
OpenAI Academy 迎来两周年,目标是把 AI 技能带给更多社区。
Anthropic 让 201 名员工的 Claude 智能体在六个办公室的去中心化交易楼层代用户交换书籍。5 分钟 intake 对话后,Claude 对书对的排序与本人一致率达 61%,市场效率 0.55(最优 0.89),其中 85% 的差距来自偏好表征不准而非谈判;重跑显示模型选择比指令更影响谈判结果,Opus 楼层效率 0.88 高于 Haiku 的 0.75。
推荐理由:原文把市场失分的 85% 归因于偏好表征而非谈判能力,并给出模型选择比指令更影响结果的可复现数据。
inclusionAI 发布 Ming-Image-0.1-Design-Layer,可将一张平面设计图按指定层数拆解为多个 RGBA 图层,采用 MIT 许可证。模型推荐 1024 分辨率、12 步采样、CFG 2.0、BF16 精度,需单张 80 GiB 显存 CUDA GPU,可用 vLLM-Omni 部署,提示词增强支持 Ling-3.0-flash-VL 或 qwen3.8-27B。
inclusionAI 发布 Ming-Image-0.1-Design,一个面向 UI、信息图、海报等文字密集视觉设计的 6B 文生图模型,支持 RGBA 透明背景输出。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词设计角色声音、30 秒音频样本复刻声音,并逐行指挥表演。
推荐理由:原文给出两个 TTS 模型的定位差异、基准成绩和开放渠道,读者可据此评估语音生成工作流的选型。
NVIDIA 验证工程师 Sakeena Fiza 的工作是在产品量产前充当"第一个客户",把硬件逼到极限以提前发现问题。她最难忘的时刻之一是 NVIDIA Rubin GPU 首次在系统层面被识别,屏幕上只显示"NVIDIA Corporation Device",全场欢呼。她所在的机架可能包含近 50 万个组件,验证需覆盖固件、硬件、软件、散热与制造等环节。
Sakana AI 宣布 Jürgen Schmidhuber 出任首席科学顾问,同时保留现职,并将参与新设的 RSI Lab。他将协助公司开发 Agent-Native World Models,用于在行动发生前安全模拟物理后果,服务于日本制造业与机器人应用,并定期赴东京支持团队和日本 AI 生态。
OpenAI 宣布将 Daybreak 计划的使用权限扩展至乌克兰政府,用于支持民用基础设施的网络防御。
invideo 借助 GPT-6 Astra 更精准地规划剪辑,将色彩校正与调色效率提升 3 倍,并在一天内生成 50 个自定义特效。
Cursor 官方博客介绍其智能体 harness 的多项 token 效率优化,整体将用户 token 成本降低 7% 且质量未下降。
推荐理由:Cursor 自述其 harness 层的多项 token 优化手段与量化收益,读者可以借鉴这些方法来降低长时智能体运行成本。
Harvey 借助 GPT-6 Astra 生成结构更清晰、更贴合上下文的法律文档,让律师得以专注策略性工作。
OpenAI CEO Sam Altman 在联合国安理会发表讲话,讨论 AI 安全、人类控制和国际合作三个主题。
Cursor 推出 Rollouts 和 Security Reviewer 两款软件开发 Bots。
推荐理由:官方说明了两款 Bot 的具体工作机制和启用入口,读者可以对照自身部署与安全审查流程评估适用性。
OpenAI 发布 MentalHealthBench,一个由专家参与构建的基准,用于评估 AI 在真实心理健康对话中回复是否有帮助且安全。该基准覆盖多种现实心理健康对话场景,衡量模型回复的助益性与安全性。
inclusionAI(Venus Team,蚂蚁集团与清华大学)在 Hugging Face 开源 Realtime-Venus,包含基于 MiniCPM-o 4.5 的 9B 视听交互模型 Realtime-Venus-Omni 和纯音频模型 Realtime-Venus-Audio。
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚 AI 进展,新加坡 HTX 将研究使用 Nemotron 3 Super 和 Nemotron 3 Nano Omni 模型推进公共安全 AI。
ChatGPT Ads 扩展至东南亚和台湾,使符合条件的企业可在超过 60 个国家和地区触达用户。
Apple 研究团队提出 probe guidance,利用现有扩散模型冻结的内部状态构建引导信号,无需在推理时增加额外前向计算。该方法在连续扩散语言模型的无条件生成上刷新 SOTA,应用于 1.7B 扩散语言模型时持续提升多项选择题基准表现。研究还发现,autoguidance 中的弱模型必须来自训练的低熵区域。
OpenRouter 发布 2026 年嵌入模型选购指南,通过对 19 个模型发起 28 项 API 实测,按用例给出推荐:英文 RAG 首选 openai/text-embedding-3-small。
推荐理由:OpenRouter 用自家端点实测 19 个嵌入模型并按用例给出推荐表,读者可直接按输入类型和价格约束对号入座。
OpenRouter 发布 TypeScript 教程,讲解如何通过 Decisions API(模型 ID typesafe/jev-1.13,端点 POST https://openrouter.ai/api/alpha/decisions)用 TypeSafe 的 Jev 决策模型审核二手市场商品列表。
Google 宣布 Antigravity SDK 支持本地工作流,首发支持通过 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B,可完全离线提供智能体能力,建议机器配备 24GB 以上 VRAM 或统一内存。
推荐理由:原文给出本地运行智能体的具体配置方法和混合编排演示数据,开发者可以直接照此把智能体工作流搬到本地 GPU 上。
OpenAI 与 Grab 联合推出区域性项目 GO Forward with AI,计划帮助东南亚 3 万名合作伙伴掌握实用 AI 技能。该项目面向 Grab 生态内的合作伙伴,覆盖东南亚地区。
GPT-6 改进了提示词缓存,带来更高的缓存命中率、新的诊断工具、显式断点以及可降低延迟与成本的控制项。
Claude Code v2.1.280 加入 Claude Opus 5.5(claude-opus-5-5)作为默认 Opus 模型,1M 上下文,$4/$20 per Mtok,cache reads $0.20/Mtok;Pro 和 Team Standard 计划默认模型由 Sonnet 改为 Opus。
推荐理由:发布日志列出 Opus 5.5 成为默认模型及其定价上下文,并包含大量修复与 VSCode 新对话框,读者可对照更新自己的工作流。
Claude API 的缓存诊断功能结束 beta,不再需要 cache-diagnosis-2026-04-07 beta header。在 Messages 请求中加入 diagnostics 对象即可启用,仍发送该 header 的请求行为不变;POST /v1/messages 的响应现在始终包含 diagnostics 字段,未启用时为 null。
Anthropic 前线部署工程师在 Notes from the Field 系列中分享管理大规模代码现代化项目的经验:原本需数年的项目现在可在数月或数周内完成,但瓶颈从编写变更转移到组织动员。
推荐理由:来自 Anthropic 一线工程师的实战经验,给出 AI 代码现代化项目启动前的组织性准备工作清单和可复用六步流程。
CodeRabbit、Power Digital 和 ThoughtSpot 通过 Claude Marketplace 用已有的 Anthropic 承诺额度扩容 Vercel 和 Snowflake。
Anthropic 宣布 Claude Marketplace 上线,把插件与连接器、智能体与产品以及服务合作伙伴聚合到一处。
推荐理由:Anthropic 官方宣布 Marketplace 上线,说明客户可用已承诺消费额度购买合作方工具,读者可据此了解生态采购方式的变化。
Anthropic 成立生命科学研究组和实验室,宣布 Claude 智能体在约 950 个智能体、21 小时、2.1 亿 token 的搜索后,自主发现一种与 DNA 重复序列相关的新型酶系统,命名为 array-associated reverse transcriptases(ART)。
推荐理由:原文给出 Claude 智能体自主发现新酶系统的过程细节和预印本,读者可以据此了解 AI 驱动生物学研究的实际工作方式。
NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04。
Parallel 借助 GPT-6 Astra 让智能体研究并综合劳动力市场数据,耗时和成本均降至此前模型的一半。
英国 AI 安全研究所(AISI)宣布使用 EvalEval 的 Evaluation Cards 开放共享评测结果,以支持更可复现、可验证的评测科学。
OpenRouter 发文解析 NVIDIA 的 Nemotron 3.5 Lightning,这是一个 30B 总参数、每 token 激活约 3B 的 MoE 开源权重模型,定位于智能体工作流中的高频执行步骤。
推荐理由:原文梳理了模型规格、与 Ultra 的分工、各端点差异和路由方法,可帮助读者判断何时用它替代大模型执行高频调用。
OpenRouter 用 Banking77 测试集的 3,080 条客服语句对比 Jev 1.13 和 Claude Opus 5 的意图分类能力。
推荐理由:原文给出了同一测试集下的准确率、延迟和成本对比,以及置信度级联方案,可用于判断小判断模型能否替代前沿模型。
oMLX 创作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将从副业转为有资金支持的正式项目,继续以 Apache 2.0 开源并由 Jun 领导,目标是加快开发并更好引导贡献者。Hugging Face 计划让 oMLX 成为新想法的试验场,并推动 transformers 模型定义快速转为可被不同引擎使用的 MLX 参考实现。
OpenAI 阐述了针对前沿模型与防护措施的第三方 AI 安全评估的优先事项与原则,强调评估应严谨、安全且独立。
Google AI 订阅用户现可直接获得 Colab 高级权益,包括优先使用更快的加速器和更强算力的机器。Google AI Ultra 订阅者还可解锁不间断后台执行和 Premium GPU 访问,长时间训练无需保持浏览器标签页开启。该权益将在未来几周内向 Colab 支持国家的 Google AI 订阅用户逐步推送,已有 Colab 订阅不受影响。
OpenRouter 推出 Batch API,提交批量请求后供应商可在 24 小时窗口内完成,per-token 价格通常为常规价的 50% 或更低,已支持 70 多个模型。
推荐理由:官方给出了实测的批次完成时长分布和提交时段差异,便于读者判断批量推理能否接入现有工作流。
Hugging Face 宣布 transformers 支持通过 from_pretrained 加载 GGUF 量化模型,复用 ggml 的 Metal 内核,初始聚焦 Apple Silicon 上的 Qwen3.5 架构。
推荐理由:原文给出加载方式、性能对比数据和方法论,读者可据此判断在 Mac 上用 transformers 跑 GGUF 的可行路径。