inclusionAI 开源 Ling-2.5-1T:1T 总参数、63B 激活的即时模型,支持 1M 上下文
inclusionAI 发布并开源 Ling-2.5-1T,总参数 1T、激活 63B,预训练语料扩至 29T tokens,经 YaRN 外推支持最长 1M tokens 上下文。
推荐理由:官方模型卡给出架构、token 效率和长上下文评测细节,可帮助读者评估这款万亿参数即时模型对现有部署工作流的适配。
inclusionAI 发布并开源 Ling-2.5-1T,总参数 1T、激活 63B,预训练语料扩至 29T tokens,经 YaRN 外推支持最长 1M tokens 上下文。
推荐理由:官方模型卡给出架构、token 效率和长上下文评测细节,可帮助读者评估这款万亿参数即时模型对现有部署工作流的适配。
inclusionAI 正式开源 instruct 模型 Ling-2.6-flash,总参数 104B、激活 7.4B,采用 1:7 MLA + Lightning Linear 混合线性注意力与高稀疏 MoE 架构。
推荐理由:官方给出架构细节、340 tokens/s 推理速度和 15M tokens 评测用量等数据,也坦承工具幻觉局限,读者可据此评估高频率 Agent 部署场景的适配度。
Google 团队在 MaxText/JAX 和 Google Cloud TPU 上从零复现了 Ai2 的 Olmo 3 7B,覆盖 stage-1 预训练(约5.93T token)和 stage-2 中期训练 anneal,held-out C4 loss 与 8 项下游任务均与 Ai2 参考持平。
Meta 宣布把 Private Processing 机密计算基础设施扩展到 Meta AI 眼镜,让 AI 在云端 CVM 内处理个人上下文,连 Meta 自己也无法访问数据。系统基于 TEE 硬件隔离,采用匿名凭证加第三方 OHTTP 中继实现不可定向路由,通过 RA-TLS 远程证明核对公开透明账本,持久记忆以用户密钥加密存储在 TEE 内,并扩展 Bug Bounty 供外部研究者审计。
GitHub Copilot app 重建了 Pull Request 视图,可流畅打开含 2,200 个文件、超过一百万行变更和 400 多条内联评论的超大 PR。核心做法是把高度拆成确定性的代码几何与动态评论块两套独立体系,配合基于身份锚定的滚动校正、先流式返回结构的 pipeline,以及用生产探针和自动巡航跑 change → measure → improve 循环来定位 bug。
Microsoft Research 宣布在 Physical AI Toolchain 中新增推理卸载能力,可将机器人 AI 工作负载容器化并通过 Kubernetes 编排到机器人、边缘与云端 GPU。
LangChain 在 LangSmith 中推出 Custom Apps,可在 LangSmith 数据之上构建、发布并直接运行自定义 UI,免去托管、认证和权限维护。
Cursor 推出 Rollouts 和 Security Reviewer 两款软件开发 Bots。
推荐理由:官方说明了两款 Bot 的具体工作机制和启用入口,读者可以对照自身部署与安全审查流程评估适用性。
OpenRouter 发布 2026 年嵌入模型选购指南,通过对 19 个模型发起 28 项 API 实测,按用例给出推荐:英文 RAG 首选 openai/text-embedding-3-small。
推荐理由:OpenRouter 用自家端点实测 19 个嵌入模型并按用例给出推荐表,读者可直接按输入类型和价格约束对号入座。
OpenRouter 发布 TypeScript 教程,讲解如何通过 Decisions API(模型 ID typesafe/jev-1.13,端点 POST https://openrouter.ai/api/alpha/decisions)用 TypeSafe 的 Jev 决策模型审核二手市场商品列表。
英国 AI 安全研究所(AISI)宣布使用 EvalEval 的 Evaluation Cards 开放共享评测结果,以支持更可复现、可验证的评测科学。
OpenRouter 发文解析 NVIDIA 的 Nemotron 3.5 Lightning,这是一个 30B 总参数、每 token 激活约 3B 的 MoE 开源权重模型,定位于智能体工作流中的高频执行步骤。
推荐理由:原文梳理了模型规格、与 Ultra 的分工、各端点差异和路由方法,可帮助读者判断何时用它替代大模型执行高频调用。
OpenRouter 用 Banking77 测试集的 3,080 条客服语句对比 Jev 1.13 和 Claude Opus 5 的意图分类能力。
推荐理由:原文给出了同一测试集下的准确率、延迟和成本对比,以及置信度级联方案,可用于判断小判断模型能否替代前沿模型。
Google AI 订阅用户现可直接获得 Colab 高级权益,包括优先使用更快的加速器和更强算力的机器。Google AI Ultra 订阅者还可解锁不间断后台执行和 Premium GPU 访问,长时间训练无需保持浏览器标签页开启。该权益将在未来几周内向 Colab 支持国家的 Google AI 订阅用户逐步推送,已有 Colab 订阅不受影响。
OpenRouter 推出 Batch API,提交批量请求后供应商可在 24 小时窗口内完成,per-token 价格通常为常规价的 50% 或更低,已支持 70 多个模型。
推荐理由:官方给出了实测的批次完成时长分布和提交时段差异,便于读者判断批量推理能否接入现有工作流。
Hugging Face 宣布 transformers 支持通过 from_pretrained 加载 GGUF 量化模型,复用 ggml 的 Metal 内核,初始聚焦 Apple Silicon 上的 Qwen3.5 架构。
推荐理由:原文给出加载方式、性能对比数据和方法论,读者可据此判断在 Mac 上用 transformers 跑 GGUF 的可行路径。
NVIDIA 推出 DSX Ready 认证计划,用于审核合作伙伴产品是否符合 NVIDIA DSX AI 工厂参考设计要求,首批类别为电池储能系统(BESS)和冷却分配单元(CDU)。
Linear 因 AI 智能体加速写代码使 CI 成为瓶颈,系统性改造后把 PR 等待时间从 6 分多钟降到 5 分多钟,单个测试的 runner 时间约减半。
推荐理由:原文给出完整的 CI 优化路径和各步骤量化收益,其他团队可对照迁移到自己的流水线。
Descript 借助 OpenRouter 和 Anthropic 的 Slack 集成 Claude Tag,把新模型评测从几小时工作加一周等待压缩到一两小时内完成,无需再占用工程师排期。
Hugging Face 发布 tokenizers v1 候选版本,单线程编码速度在十个模型族上比 v0.23 快 3 到 30 倍(Apple M4 Max,低端 t5-base,高端 gpt2),八线程扩展达线性 76%,且 token ID 与旧版完全一致。主要改动包括用 SIMD 位流切分替代正则、线程本地词缓存、免分配的合并循环和按批模型调用,候选版已在 crates.io 提供。
LangSmith 现已支持 TypeSafe AI 的 System One 模型 Jev 作为评估器,用于低成本评估开放性 Agent 行为并返回结构化反馈。
LangChain 团队测试了 TypeSafe AI 的 Jev 作为智能体评测器的表现。Jev 是不生成文本的 System One 决策模型,支持 Choice、Score 和布尔三类问题,官方称在分类任务上推理最快达 200 倍、成本最低至 1/400。
联合国系统推出 UN System Data Commons,一个基于 Google Data Commons 构建的开源 AI-ready 知识图谱平台,将分散在联合国各机构的数据整合为单一可搜索资源。
Sakana AI 正式公布公司内部的 Frontier Intelligence Group(FIG),主张智能尚未被解决,即使当前范式可通过规模实现 AGI,也仍需探索数据与能耗效率更高的另类路径。
GitHub 用 Copilot 智能体将 Copilot agent runtime 从 TypeScript 完整重写为 832,378 行生产 Rust,共 128 个 PR,于 8 月 21 日完成。
推荐理由:作者以第一手移植经历拆解了 AI 智能体团队完成大规模重写的具体策略、会话数据和教训,方法细节对类似工程迁移有直接参考价值。
Google 宣布与 Speakeasy 合作,将 Speakeasy 的 OpenAPI 客户端生成套件以 AGPLv3 开源。此前 Google 用于生成 GenAI SDK(Interactions、Agents、Webhooks API)的闭源生成器在 2026 年 5 月被收购并突然关停,促使双方迁移到开源方案。
OpenRouter 发布教程,演示如何用其 TypeScript SDK 从零构建工具调用 Agent 循环,示例使用本地天气数据可独立运行。教程覆盖停止条件设计、按 toolCallId 返回结果、指纹计数拦截重复调用、models 参数实现有序模型回退,以及 Auto Exacto 默认按工具调用成功率重排提供商;并说明 MCP 只改变工具执行位置,循环控制仍是必要的。
推荐理由:教程给出了完整的停止条件、重复检测和模型回退实现,可用作自建 tool-calling 循环的参考骨架。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次预览提交中,Qwen3-VL 吞吐量最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上最高 2.5 倍。GB300 NVL72 以 288 GPU 四机架提交实现 99% 扩展效率,软件优化较 v6.0 带来最高 1.6 倍性能提升。
IBM Research 在 ALTK-Evolve 中新增 Consistency Analyzer 和一致性指南,用于衡量并改善智能体重复执行同一任务时的稳定性。
推荐理由:原文给出 Pass^k 与 Mean@k 的区别和一种只靠单条轨迹、无需标注的稳定性诊断方法,可将智能体一致性缺口缩小约一半。
NVIDIA 与 SGLang 合作实现 NVFP4 KV cache,在 Blackwell 上以 4 比特存储 K/V,配合 FP8 分块缩放与 FP32 张量级缩放两级量化,打包数据加块缩放仅占 FP8 约 56% 存储。
Descript 发布案例研究,介绍其视频编辑智能体 Underlord 采用 OpenRouter 后,生产模型从 1 个增至 13 个(来自 4 家模型开发方),新模型评测时间从一周以上缩短到 1-2 小时,一次 Anthropic 发布从宣布到上线只用了几小时。
Anthropic 为 Claude for Small Business 推出 43 个工作流和 27 个新集成,覆盖 Shopify、Salesforce、Stripe、Zoom、Xero、Zapier 等工具,产品自 5 月上线以来安装量超过 900,000 次。
推荐理由:官方公布了新增工作流与集成数量,并给出多个客户的可验证使用结果,读者可据此评估这类 Agent 产品对小型业务的落地形态。
inclusionAI 在 Hugging Face 发布 SingProbe,一个复用 Qwen3.6-35B-A3B 隐层状态的轻量流式安全探测,逐 token 输出 8 类查询意图、不安全与幻觉风险分数,探测参数仅 4.2M。
inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-0.6B 之上的流式安全探针,复用基座模型隐藏状态在每个 token 上评估查询意图、回复不安全性和幻觉风险。
inclusionAI 发布 SingProbe,一个构建在 MiniMaxAI/MiniMax-M2.7 之上的流式护栏探针,在生成过程中复用基座模型隐藏状态,对每个 token 输出查询意图、回复不安全度和幻觉风险评分。
OpenRouter 发布教程,讲解如何用独立的 judge 模型按书面评分标准自动给 Agent 输出打分,弥补确定性测试无法检查最终回答质量的问题。
推荐理由:原文给出可复用的评测方法和 Ori Eval 具体代码,覆盖评分模式选择与 judge 校准的实操细节。
Claude API 的 Messages API 新增按需压缩对话功能,以 compact-2026-09-04 beta 头开启。发送顶层 compaction 参数后返回带签名的压缩块概括所发消息,后续请求可先发该块替代原消息,支持后台运行、保留最近轮次原文,且在支持保留 thinking 的模型上已保留轮次的 thinking 可保持有效。
推荐理由:原文给出了 compaction 的调用方式和 beta 头参数,开发者可据此评估在长对话场景里如何按需压缩上下文。
LangChain 开源其 Paid Media Agent 并复盘构建过程,该 Agent 驻留 Slack,用于管理跨五个付费渠道的广告活动。六个月内付费媒体从 0 做到占营销管道的 20%,CPL 从 6 月到 8 月下降 30%。
推荐理由:原文给出了 Agent 工程的具体设计决策和成本数据,读者可以迁移其上下文分层和权限设计方法到自己的 Agent 项目。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑超 10 亿 ChatGPT 用户、每秒 2200 万次请求。
Sakana AI 发布 Fugu Max 和 Fugu Ultra v2,用多智能体编排同时优化成本与性能。
推荐理由:原文给出具体基准成绩、定价对比和 API 升级方式,读者可据此评估编排架构在成本与性能上的实际位置。