跳到正文

#部署/工程

今日 19 条
9月14日周一
  1. Claude Platform release notes60

    Claude API Messages 支持按需压缩对话,compact-2026-09-04 beta 上线

    Claude API 的 Messages API 新增按需压缩对话功能,以 compact-2026-09-04 beta 头开启。发送顶层 compaction 参数后返回带签名的压缩块概括所发消息,后续请求可先发该块替代原消息,支持后台运行、保留最近轮次原文,且在支持保留 thinking 的模型上已保留轮次的 thinking 可保持有效。

    推荐理由:原文给出了 compaction 的调用方式和 beta 头参数,开发者可据此评估在长对话场景里如何按需压缩上下文。

9月13日周日
  1. LangChain Blog66

    LangChain 发布付费广告 Agent 并开源,分享构建经验

    LangChain 开源其 Paid Media Agent 并复盘构建过程,该 Agent 驻留 Slack,用于管理跨五个付费渠道的广告活动。六个月内付费媒体从 0 做到占营销管道的 20%,CPL 从 6 月到 8 月下降 30%。

    推荐理由:原文给出了 Agent 工程的具体设计决策和成本数据,读者可以迁移其上下文分层和权限设计方法到自己的 Agent 项目。

9月11日周五
9月10日周四
  1. Mistral AI45

    Cloudera 与 Mistral 达成合作,将主权 AI 引入企业数据平台

    Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练自有模型,基于开放权重拥有数据和由此产生的智能。Cloudera 平台承载 30 exabytes 客户自管数据。

9月9日周三
  1. ByteByteGo58

    智能模型路由如何把 LLM 成本降低约 10 倍

    ByteByteGo 讲解智能模型路由,按请求难度把简单任务分给小模型、复杂任务分给强模型,算例显示 85% 请求走小模型、10% 走中等、5% 走强模型时平均成本约为全用强模型的 11%,接近 10 倍节省。文章覆盖小模型当路由器、级联先用便宜模型再校验升级、语义路由、基于真实数据的 learned routing,以及欠路由、过度路由、用户操纵路由规则等常见失败方式。

  2. OpenRouter Announcements62

    OpenRouter 推出美国区域路由,与去年上线的 EU 路由配套保障数据驻留

    OpenRouter 发布美国区域路由 us.openrouter.ai,与去年 10 月上线的 eu.openrouter.ai 配套,请求在区域内解密并只路由到区域内提供商,全程不出区。

    推荐理由:原文区分了推理级与端到端区域路由的差异,并说明区域域名、404 行为和 Guardrails 配置,读者可直接评估合规用法。

9月8日周二
  1. OpenRouter Announcements73

    OpenRouter 推出 Shell 工具、容器与 Files API

    OpenRouter 发布 openrouter:shell 服务端工具、openrouter:bash 工具和 Files API,让平台上任意支持工具调用的模型都能在托管 Linux 容器中执行命令,目前以 beta 提供。

    推荐理由:原文给出了定价、容器网络与文件管理等具体配置细节,可帮助读者评估在现有 Agent 工作流中如何复用这套服务端沙箱。

9月5日周六
  1. GitHub Blog · AI & ML67

    GitHub 推出 Project HydraFusion 多模型编排研究预览

    GitHub 发布 Project HydraFusion 研究预览,通过运行时多模型编排提供前沿级编码质量,所有 GitHub Copilot 计划用户可在 Copilot CLI 通过 /experimental 使用。

    推荐理由:原文给出三种执行模式和三项基准的质量与成本数据,读者可以据此评估多模型编排对现有编码工作流的适用性。

  2. a16z News42

    a16z 投资 Gimlet Labs:打造首个多芯片推理云

    a16z 宣布投资 Gimlet Labs,后者正在构建首个多芯片推理云,可将不同模型与工具调度到 GPU、CPU 及专用加速器上,在相同功耗下实现前沿模型最高 10 倍吞吐与交互性提升。Gimlet 通过编译器与运行时把异构硬件整合为单一算力池,对开发者仅暴露一个推理 API,客户已包括一家前沿实验室和一家超大规模云厂商。

9月4日周五
  1. Michael Truell50

    Grok Bot for Enterprise 上线,未来两周对所有 Grok 和 Cursor 企业客户免费开放。Michael Truell 称部署 Bot 如同为公司引入数千名有能力的队友,是其见过的内部采用度最高、也最强大的 AI 产品。

    引用Grok Bot@bot

    Grok Bot for Enterprise is available today. It’s free for all Grok and Cursor enterprise customers for the next two weeks. https://x.ai/news/grok-bot-for-enterprise

9月3日周四
9月2日周三
  1. Google Blog: AI53

    Google 推出 Fairwind Program,向政府和企业开放 Gemini 3.8 Flash Cyber 网络防御能力

    Google 发布 Fairwind Program,为政府和可信合作伙伴提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具,用于自主发现并修复漏洞,可在组织安全云环境内数分钟生成经验证的补丁。该计划初期面向政府、关键基础设施运营方和核心技术平台开放,已有超过 650 个合作伙伴参与;同时 Google.org 将全球网络安全资金累计提升至超过 1 亿美元。

  2. Google Developers Blog62

    Google 复盘 AI Agents Challenge 最强提交背后的 4 种工程模式

    Google for Startups AI Agents Challenge 评选结束后,官方从高分提交中总结出四种工程模式:双向 MCP、事件驱动并发、同标准降级(Gemini 3.1 Pro 503 时回退 Gemini 3.6 Flash 并共用同一校验函数)、以及模型调用前的分层路由。

    推荐理由:文章从真实参赛代码中提炼四个可复用的工程模式,覆盖工具暴露、并发、降级校验和分层路由,可直接迁移到自己的智能体项目。

  3. Hugging Face Blog52

    Allen AI 发布 BenchMIRT:在题目层面审计 LLM 基准实际测量的能力

    Allen AI 发布 BenchMIRT,一种基于多维 IRT 的方法,用于在单个题目层面审计 LLM 基准实际测量的能力。方法基于 100 个 LLM 在 16 个基准、超 34K 题目上的结果训练,未事先告知标签即独立恢复出安全与通用推理两个维度;分析发现 BBQ 和 WMDP 与通用推理的关联强于安全,HarmBench 的版权题也更接近推理。

9月1日周二
8月29日周六
  1. LMSYS Blog60

    SGLang 发布 SSD Expert Pack,在消费级硬件上运行 DeepSeek-V4-Flash 和 Kimi-K3

    SGLang 将 SSD-LLaMA 的核心思路引入 MoE 推理,把放不进 VRAM 和内存的路由专家权重放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O、pinned 暂存和 GPU 缓存,只加载 router 选中的专家。

    推荐理由:原文给出完整机制说明和单卡实测数据,读者可以据此评估 NVMe SSD 承载超大 MoE 模型的可行性。

8月28日周五
8月27日周四
  1. Linear Now64

    Linear 用 1000+ 个 PR 将 React 应用从 styled-components 迁移到 StyleX

    Linear 宣布完成从 styled-components 到 StyleX 的迁移,历时逾 1000 个 PR。迁移动机包括 styled-components 进入维护模式、React 18 并发渲染下的性能回归,以及团队希望为 Agent 参与代码库建立更清晰的样式边界。

    推荐理由:Linear 团队亲历者复盘超千个 PR 的迁移过程,给出可迁移的确定性工具加 Agent 加人工判断的方法和降险步骤。

8月26日周三
  1. Google Developers Blog35

    Google Cloud 在 Cloud TPU 上为 vLLM 带来企业级长上下文多模态嵌入推理

    Google Cloud 将原生 TPU 支持集成进 vLLM,用于在 Cloud TPU 上服务 Qwen3-Embedding 系列嵌入模型,支持 4K+ token 文本与 15K+ token 多模态输入的长上下文。团队针对 TPU 做了词表 padding、懒加载初始化与 StepPool 长上下文等优化,并以余弦相似度验证数值一致性,文本目标阈值 ≥0.999、多模态 ≥0.995。

8月25日周二
  1. OpenRouter Announcements70

    OpenRouter 发布选型教程:如何用 MCP 服务器在编辑器内选最合适的 AI 模型

    OpenRouter 发布模型选型教程,提出六步框架:定义任务、用实时使用数据和第三方基准筛选候选、对比各提供商价格与延迟、用自己的提示词测试、按每次完成任务的成本而非每 token 成本衡量,再决定或改用 openrouter/auto-beta 按请求路由。

    推荐理由:OpenRouter 官方给出以成本每完成任务为核心的选型框架,并用自家 MCP 服务器让整个评测流程在编辑器内完成。

  2. Hugging Face Blog69

    Gradio 推出 gr.Workflow:把 AI 管线变成可拖拽、可部署的节点图

    Hugging Face 在 Gradio 中内置 gr.Workflow,将 AI 应用管线描述为带类型的节点图,在同一画布上提供可运行节点、可视化中间结果、REST API 和一键部署到 Hugging Face Spaces。

    推荐理由:官方介绍了 gr.Workflow 的节点图机制和多条可复制的示例工作流,读者可以据此评估它能否替代手工拼装 Python 管线。

8月24日周一
  1. Import AI47

    Import AI 470:机器不应享有权利;SPADE 自动化环境生成;Hawkeye 构建更优 GPU kernel

    METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,AI 研究本身则无可测量加速。多校团队提出 SPADE 自博弈框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。

8月21日周五
  1. Hugging Face Blog64

    Hugging Face 解析 Papers with Code 搜索背后的 Inference Endpoints、Jobs 与 Buckets 架构

    Hugging Face 介绍 Papers with Code 混合搜索架构:PostgreSQL 全文检索加 pgvector 语义检索,经 RRF 融合,用 Qwen/Qwen3-Embedding-0.6B 生成 256 维向量,已覆盖超 110,000 篇 arXiv 论文。

    推荐理由:作者复盘了自己上线论文混合搜索的架构与教训,读者可以借鉴冷启动回退、embedding 契约和 Matryoshka 维度权衡这些可迁移做法。

  2. Hugging Face Blog65

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理吞吐最高提升 3.2x

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型 checkpoint,通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18x,端侧最高 2.87x。

    推荐理由:官方为 LFM2.5 三款模型发布 DSpark 草稿模型,给出从 H100 到 MacBook 的实测加速数据和开源接入方式。