跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 61–80 条 · 共 85 条
8月6日周四
  1. OpenRouter Announcements61

    OpenRouter 讲解如何治理团队 AI 支出的 6 项控制

    OpenRouter 官方详解治理团队 AI 支出的 6 项控制:per-key 信用限额、guardrails、workspace 预算、presets、组织角色和 Activity 仪表盘,分别覆盖花多少、花在哪和谁在花。

    推荐理由:官方详解 6 项团队支出控制的功能边界和叠加规则,读者可按团队规模选择最省成本的控制组合。

7月30日周四
  1. Cursor Blog66

    Cursor 团队讲解如何搭建云端智能体开发环境

    Cursor 团队分享如何为云端智能体搭建开发环境,让智能体能在其单体仓库中运行和测试代码。做法包括用 Dockerfile 统一 Ubuntu VM 环境、构建 anydev CLI 简化智能体操作、通过 Cursor Cloud MCP 和 Cloud Doctor 实现环境自愈与持续优化。云端智能体编写 PR 的占比从去年 12 月的约十分之一升至今日的超过一半。

    推荐理由:Cursor 团队分享了自家云端智能体环境的搭建细节,含 anydev CLI 和 Cloud Doctor 等可借鉴做法。

  2. Microsoft AI News61

    Microsoft 阐述按 token 效率优化前沿性能曲线的策略并盘点 MAI Flash 模型成果

    Microsoft 提出行业下一个焦点是 token 效率,主张通过联合优化模型、harness 和 RL 环境为具体产品调校模型,而非所有任务都用前沿通用模型。

    推荐理由:Microsoft 官方阐述 token 效率策略,用多款 MAI Flash 模型的实际成本数据说明如何按任务匹配模型规模。

7月27日周一
  1. LMSYS Blog78

    SGLang 与 Miles 为 Kimi K3 提供 Day-0 支持

    SGLang 和 Miles 发布对 Kimi K3 的 Day-0 支持,分别覆盖推理与 RL 训练。K3 为 2.8T 参数的 3 万亿参数级首个开源模型,采用 69 层 KDA 线性注意力与 24 层 MLA 的混合架构和 1M token 上下文窗口。

    推荐理由:原文由 SGLang 团队自述 Day-0 支持的实现细节,给出内存管理、投机解码与并行策略的具体方案和实测数字,可迁移到异构注意力架构的部署。

7月22日周三
  1. Sierra Blog64

    Sierra 复盘 MCP Gateway 建设:AI 优先工程组织的七条经验

    Sierra 分享为内部 agent 搭建 MCP Gateway 的七条经验,包括抓住所有权减少协调、用 mcp-gateway.md 提升编码 agent 一次成功率、多阶段流程防止跨客户数据访问,以及优先用 gh CLI 等 agent 熟悉的工具。目前 89% 的 Sierra 员工通过它连接 45 个服务,近三分之二提交来自社区。

    推荐理由:Sierra 工程师复盘 MCP Gateway 建设全程,给出协作机制、权限审计和工具取舍七条可迁移经验。

7月21日周二
  1. OpenRouter Announcements64

    OpenRouter 解析提示词缓存与粘性路由如何降低 Agent 多轮成本

    OpenRouter 发布教程讲解提示词缓存与粘性路由如何降低 Agent 多轮成本。缓存读取为输入价格的 0.1x 到 0.5x,Anthropic 缓存写入为 1.25x(5 分钟 TTL)或 2.0x(1 小时 TTL),未被复用的单次写入比不缓存更贵。

    推荐理由:原文给出各厂商缓存读写倍率、session_id 粘性路由用法和缓存未命中排查方法,读者可以直接照做降低 Agent 多轮成本。

7月16日周四
  1. Sierra Blog64

    Sierra 推出内部云 Agent 平台 Pinecone

    Sierra 发布内部云 Agent 平台 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、共享和自动化云端智能体会话。每个会话约一秒内获得带代码仓库、构建缓存和开发服务的隔离环境,并提供多人协作、自动盯 PR、定时自动化、可复用 Skills 和多会话 Projects 等能力。

    推荐理由:Sierra 官方复盘自研内部云 Agent 的架构与经验,读者可以从中了解企业如何沉淀员工工作智慧并组织智能体协作。

7月15日周三
7月10日周五
  1. Sierra Blog66

    Sierra 全员推行 Agent Pinecone 的五条经验

    Sierra 于今年 1 月成立六人 AI 加速团队,将多个角色专属 Agent 合并为统一 Agent Pinecone,内置在 Claude Code 和 Codex 之上。

    推荐理由:原文给出 Sierra 内部推行统一 Agent 的具体做法与教训,单 Agent 架构、持久化上下文和以产出物衡量价值等经验可迁移到其他公司。

6月23日周二
  1. Mistral AI69

    Mistral 发布 Mistral OCR 4:支持边界框、块分类和置信度分数

    Mistral 发布 Mistral OCR 4,除提取文本外还返回边界框、块类型分类(标题、表格、公式、签名等)和逐页逐词的内联置信度分数,支持 170 种语言、10 个语言组。

    推荐理由:官方说明了新模型的结构化输出能力、基准得分及其已知评分缺陷,并给出 API 与 Document AI 的选择规则,便于读者判断适用场景。

5月29日周五
  1. Sierra Blog68

    Sierra 工程师复盘如何独自用 AI 编码智能体在 4 个月内完成产品本地化

    Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体独自完成产品本地化,耗时不到 4 个月,而他在 Slack 参与的同类项目需 10 人团队 9 到 12 个月。他经历 IDE 智能体、云端智能体、批量调用 Claude 脚本三轮迭代,并发现技能文档过长会超出上下文窗口反而推高错误率,最终把工作重心从执行迁移转向设计反馈循环。

    推荐理由:作者复盘个人用 AI 编码智能体完成本地化的完整工作流,提炼出批处理脚本、反馈循环与上下文管理等可迁移方法。

5月19日周二
5月11日周一
  1. Claude Platform release notes66

    Claude Platform 上线 AWS,支持 AWS 计费与 IAM 认证

    Anthropic 推出 Claude Platform on AWS,Claude API 现可通过 AWS 原生端点访问,使用 AWS 计费和 IAM 认证。可用能力包括完整 Messages API、Files API、Message Batches API、Claude Managed Agents、Agent Skills、代码执行和工具使用。

    推荐理由:官方宣布 Claude API 可经 AWS 原生端点访问,支持 IAM 认证与计费,读者可据此评估迁移或接入路径。

5月4日周一
  1. Runway News66

    Runway 发布 Characters,单张图片生成 24fps 实时对话视频智能体

    Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。

    推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。

4月25日周六
  1. LMSYS Blog73

    SGLang 与 Miles 实现 DeepSeek-V4 (1.6T Pro, 284B Flash) Day-0 推理与 RL 训练支持

    SGLang 与 Miles 团队宣布在发布当天为 DeepSeek-V4 (1.6T Pro, 284B Flash) 提供推理与 RL 训练的开源支持,针对其混合稀疏注意力、mHC 和 FP4 专家权重架构做了专项适配。

    推荐理由:原文给出 ShadowRadix、HiSparse 等具体优化机制和基准数字,读者可以了解混合稀疏注意力架构对推理与 RL 训练系统的实际工程要求。

4月23日周四
  1. Claude Blog66

    Claude Managed Agents 内置记忆功能开启公开测试

    Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。

    推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。

3月12日周四
  1. Google Research62

    Google 在 Flood Hub 上线 AI 城市山洪预报,可提前 24 小时预测风险

    Google Research 宣布在 Flood Hub 上推出城市山洪预报,借助基于 Gemini 的 Groundsource 方法从新闻报告中提取历史山洪数据,用 LSTM 模型提前 24 小时预测城市山洪风险。

    推荐理由:原文给出 Flash Flood 预报的技术路线和与 NWS 的对比指标,读者可以了解 AI 预警如何弥补全球南方的预警缺口。

3月11日周三
  1. Mistral AI63

    Mistral 基于 Vibe 构建自动编写 Rails RSpec 测试的智能体

    Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。

    推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。

  2. LMSYS Blog61

    SGLang 支持 NVIDIA Nemotron 3 Super,面向高效多智能体系统

    SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。

    推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。