跳到正文

#部署/工程

今日 11 条
9月24日周四
  1. inclusionAI Hugging Face models62

    inclusionAI 开源 Ling-2.5-1T:1T 总参数、63B 激活的即时模型,支持 1M 上下文

    inclusionAI 发布并开源 Ling-2.5-1T,总参数 1T、激活 63B,预训练语料扩至 29T tokens,经 YaRN 外推支持最长 1M tokens 上下文。

    推荐理由:官方模型卡给出架构、token 效率和长上下文评测细节,可帮助读者评估这款万亿参数即时模型对现有部署工作流的适配。

  2. inclusionAI Hugging Face models69

    inclusionAI 正式开源 Ling-2.6-flash:104B 总参数、7.4B 激活的混合线性 MoE 模型

    inclusionAI 正式开源 instruct 模型 Ling-2.6-flash,总参数 104B、激活 7.4B,采用 1:7 MLA + Lightning Linear 混合线性注意力与高稀疏 MoE 架构。

    推荐理由:官方给出架构细节、340 tokens/s 推理速度和 15M tokens 评测用量等数据,也坦承工具幻觉局限,读者可据此评估高频率 Agent 部署场景的适配度。

  3. Meta Engineering54

    Meta 将 Private Processing 机密计算扩展到 Meta AI 眼镜

    Meta 宣布把 Private Processing 机密计算基础设施扩展到 Meta AI 眼镜,让 AI 在云端 CVM 内处理个人上下文,连 Meta 自己也无法访问数据。系统基于 TEE 硬件隔离,采用匿名凭证加第三方 OHTTP 中继实现不可定向路由,通过 RA-TLS 远程证明核对公开透明账本,持久记忆以用户密钥加密存储在 TEE 内,并扩展 Bug Bounty 供外部研究者审计。

  4. GitHub Blog · AI & ML56

    GitHub Copilot app 如何渲染超大 Pull Request

    GitHub Copilot app 重建了 Pull Request 视图,可流畅打开含 2,200 个文件、超过一百万行变更和 400 多条内联评论的超大 PR。核心做法是把高度拆成确定性的代码几何与动态评论块两套独立体系,配合基于身份锚定的滚动校正、先流式返回结构的 pipeline,以及用生产探针和自动巡航跑 change → measure → improve 循环来定位 bug。

9月23日周三
9月22日周二
  1. OpenRouter Announcements61

    OpenRouter 解析 NVIDIA Nemotron 3.5 Lightning 如何承担智能体高频执行调用

    OpenRouter 发文解析 NVIDIA 的 Nemotron 3.5 Lightning,这是一个 30B 总参数、每 token 激活约 3B 的 MoE 开源权重模型,定位于智能体工作流中的高频执行步骤。

    推荐理由:原文梳理了模型规格、与 Ultra 的分工、各端点差异和路由方法,可帮助读者判断何时用它替代大模型执行高频调用。

  2. Google Developers Blog42

    Google Colab 纳入 Google AI 订阅计划

    Google AI 订阅用户现可直接获得 Colab 高级权益,包括优先使用更快的加速器和更强算力的机器。Google AI Ultra 订阅者还可解锁不间断后台执行和 Premium GPU 访问,长时间训练无需保持浏览器标签页开启。该权益将在未来几周内向 Colab 支持国家的 Google AI 订阅用户逐步推送,已有 Colab 订阅不受影响。

  3. OpenRouter Announcements71

    OpenRouter 推出 Batch API,批量推理约半价

    OpenRouter 推出 Batch API,提交批量请求后供应商可在 24 小时窗口内完成,per-token 价格通常为常规价的 50% 或更低,已支持 70 多个模型。

    推荐理由:官方给出了实测的批次完成时长分布和提交时段差异,便于读者判断批量推理能否接入现有工作流。

9月21日周一
  1. Hugging Face Blog57

    Hugging Face tokenizers v1 发布候选,编码速度较 v0.23 提升最多 30 倍

    Hugging Face 发布 tokenizers v1 候选版本,单线程编码速度在十个模型族上比 v0.23 快 3 到 30 倍(Apple M4 Max,低端 t5-base,高端 gpt2),八线程扩展达线性 76%,且 token ID 与旧版完全一致。主要改动包括用 SIMD 位流切分替代正则、线程本地词缓存、免分配的合并循环和按批模型调用,候选版已在 crates.io 提供。

9月20日周日
9月18日周五
9月17日周四
  1. GitHub Blog · AI & ML78

    GitHub 用 Copilot 将 Copilot agent runtime 迁移到 Rust

    GitHub 用 Copilot 智能体将 Copilot agent runtime 从 TypeScript 完整重写为 832,378 行生产 Rust,共 128 个 PR,于 8 月 21 日完成。

    推荐理由:作者以第一手移植经历拆解了 AI 智能体团队完成大规模重写的具体策略、会话数据和教训,方法细节对类似工程迁移有直接参考价值。

  2. OpenRouter Announcements67

    OpenRouter 教程:用 TypeScript SDK 构建可靠的工具调用 Agent 循环

    OpenRouter 发布教程,演示如何用其 TypeScript SDK 从零构建工具调用 Agent 循环,示例使用本地天气数据可独立运行。教程覆盖停止条件设计、按 toolCallId 返回结果、指纹计数拦截重复调用、models 参数实现有序模型回退,以及 Auto Exacto 默认按工具调用成功率重排提供商;并说明 MCP 只改变工具执行位置,循环控制仍是必要的。

    推荐理由:教程给出了完整的停止条件、重复检测和模型回退实现,可用作自建 tool-calling 循环的参考骨架。

9月16日周三
  1. Hugging Face Blog63

    IBM Research 为 ALTK-Evolve 推出 Consistency Analyzer,将智能体一致性缺口从 24.4pp 降到 12.0pp

    IBM Research 在 ALTK-Evolve 中新增 Consistency Analyzer 和一致性指南,用于衡量并改善智能体重复执行同一任务时的稳定性。

    推荐理由:原文给出 Pass^k 与 Mean@k 的区别和一种只靠单条轨迹、无需标注的稳定性诊断方法,可将智能体一致性缺口缩小约一半。

9月15日周二
  1. Claude Blog69

    Claude for Small Business 新增 43 个工作流与 27 个集成,并重启 SMB 巡回培训

    Anthropic 为 Claude for Small Business 推出 43 个工作流和 27 个新集成,覆盖 Shopify、Salesforce、Stripe、Zoom、Xero、Zapier 等工具,产品自 5 月上线以来安装量超过 900,000 次。

    推荐理由:官方公布了新增工作流与集成数量,并给出多个客户的可验证使用结果,读者可据此评估这类 Agent 产品对小型业务的落地形态。

9月14日周一
  1. Claude Platform release notes60

    Claude API Messages 支持按需压缩对话,compact-2026-09-04 beta 上线

    Claude API 的 Messages API 新增按需压缩对话功能,以 compact-2026-09-04 beta 头开启。发送顶层 compaction 参数后返回带签名的压缩块概括所发消息,后续请求可先发该块替代原消息,支持后台运行、保留最近轮次原文,且在支持保留 thinking 的模型上已保留轮次的 thinking 可保持有效。

    推荐理由:原文给出了 compaction 的调用方式和 beta 头参数,开发者可据此评估在长对话场景里如何按需压缩上下文。

9月13日周日
  1. LangChain Blog66

    LangChain 发布付费广告 Agent 并开源,分享构建经验

    LangChain 开源其 Paid Media Agent 并复盘构建过程,该 Agent 驻留 Slack,用于管理跨五个付费渠道的广告活动。六个月内付费媒体从 0 做到占营销管道的 20%,CPL 从 6 月到 8 月下降 30%。

    推荐理由:原文给出了 Agent 工程的具体设计决策和成本数据,读者可以迁移其上下文分层和权限设计方法到自己的 Agent 项目。

9月11日周五
9月10日周四