跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

当前仅显示精选新闻
231条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 121–140 条 · 共 231 条
8月17日周一
  1. Mistral AI67

    Mistral 发布 Mistral Small v24.09,并推出免费层与全线降价

    Mistral 发布 22B 参数的 Mistral Small v24.09,同时上线 la Plateforme 免费层并对全系模型降价。Mistral Small 与 Codestral 的输入输出价格均降 80%,Mistral Nemo 降 50%,Mistral Large 降 33%,更新后 Mistral Large 2 被称最具成本效益的前沿模型。

    推荐理由:原文列出各模型具体降价幅度与免费层入口,读者可据此评估调用成本与自部署条件。

  2. Mistral AI74

    Mistral AI 发布 24B 参数 Mistral Small 3,Apache 2.0 开源

    Mistral AI 发布 24B 参数的 Mistral Small 3,以 Apache 2.0 许可同时放出预训练和指令微调 checkpoint。官方称其指令版与 Llama 3.3 70B instruct 相当,同硬件下速度超过 3 倍,MMLU 准确率超 81%,延迟 150 tokens/s。

    推荐理由:官方给出了 24B 模型的对标结果与本地部署门槛,读者可据此判断它在开源替代中的位置。

  3. OpenRouter Announcements62

    OpenRouter 推出 Activity 仪表盘与 Analytics API,按 Agent、模型和请求分析 AI 用量

    OpenRouter 发布 Activity 仪表盘和 Analytics API,可按 Agent、模型、用户和请求维度查看支出、token 用量、缓存命中率和延迟等指标。

    推荐理由:原文给出仪表盘各项功能、Analytics API 端点和内部降本案例,读者可以据此评估如何排查自家 Agent 用量成本。

8月16日周日
  1. LangChain Blog62

    LangChain 的 Managed Deep Agents 进入公开测试

    LangChain 宣布 Managed Deep Agents 进入公开测试,开发者可用 Python 或 TypeScript 编写 Deep Agent 并本地测试,再用 mda deploy 一条命令部署到 LangSmith 托管运行时。

    推荐理由:原文列出托管运行时接管的持久化、沙箱与记忆等基础设施,并说明用户仍可控制的部分,便于判断是否把原型迁到生产。

  2. LangChain Blog71

    LangChain 实测 Switchyard 路由:仅 7% 的 agent 调用需要前沿模型

    LangChain 用自家 145 个多步任务的 Deep Agents 评测套件测试 NVIDIA 开源路由库 Switchyard,只有 7% 的模型调用被送到 Claude Opus 4.8,其余 93% 由 30B 的 Nemotron 3.5 Lightning 处理。

    推荐理由:用同一套 agent 评测套件对比单模型与路由方案,并给出判断是否值得上路由的成本公式。

  3. LangChain Blog60

    LangChain 解释什么是 AI 智能体,并给出自治程度六级划分

    LangChain 在博客中把 AI 智能体定义为使用大语言模型决定应用控制流的系统,自治程度取决于模型掌握多少控制流。文章用六级图谱区分工作流与智能体,从手写代码、单次 LLM 调用、链式调用一直到能自行构建并记忆工具的完全自主智能体,并指出模型控制权越多,对可观测性、评测、记忆、权限和安全执行的要求越高。

    推荐理由:文章给出以控制流归属划分智能体的定义和六级自治图谱,并列出落地生产所需的基础设施与评测方法。

8月13日周四
  1. 机器之心 · 微信公众号80

    DeepSeek 开源智能体框架 Harness,主打一切皆插件

    DeepSeek 开源了开发者预览版智能体框架 DeepSeek Harness,它是一套用来构建、运行和扩展智能体的 SDK 与应用框架,默认可连接 DeepSeek 模型,开源地址在 GitHub。

    推荐理由:作者以提前内测的第三方身份跑通游戏与 3D 动画案例,展示了这套插件化智能体框架的组装方式与能力边界。

  2. Cursor Blog65

    Cursor 推出 builds,云端智能体启动最高快 3 倍

    Cursor 推出 builds 功能,在后台预先准备可直接使用的开发环境副本,让云端智能体启动最高快 3 倍;Cursor 内部环境启动快了 10 倍,首个 token 生成快了 3 倍。builds 默认每小时创建一次,智能体始终基于最新的成功构建启动,构建失败时继续沿用上一次成功构建,工作不中断。8 月 17 日起,所有新建和现有环境将默认使用 builds,且不额外收费。

    推荐理由:Cursor 公布云端智能体启动变快 3 倍的后台预构建机制,并说明迁移与调试方式。

8月12日周三
  1. Meta Engineering62

    WhatsApp 推出端侧运行的 Scam Alert 反诈骗功能

    WhatsApp 推出可选功能 Scam Alert,在设备端用机器学习模型对非联系人消息做诈骗分类,消息内容不上传、不自动上报。模型版本经 Cloudflare 签名并发布到第三方 append-only 透明账本,遥测经基于 TEE 的机密联邦分析管线以差分隐私聚合方式回传,用户可在应用内查看 Scam Alert Activity 日志,功能正在 Beta 小范围推送。

    推荐理由:原文给出了 Scam Alert 的端侧架构与可验证机制细节,安全研究者可以据此评估其在端到端加密下的实现。

  2. OpenRouter Announcements65

    OpenRouter 上线实时网络搜索基准:比较引擎、深度与模型的取舍

    OpenRouter 发布实时网络搜索基准榜单,覆盖 BrowseComp、DeepSearchQA、WideSearch 和 HLE 四套评测,比较模型、引擎(Exa、Parallel、Perplexity 及 OpenAI、Anthropic、Google 原生搜索)、搜索方法与预算的组合。

    推荐理由:原文用四套实时榜单量化搜索预算、引擎与模型对质量和成本的影响,还给出可直接套用的参数配置方法。

  3. LMSYS Blog65

    SGLang 与 Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持

    SGLang 与 Miles 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B,采用 69 层 GDN 线性注意力与 23 层 GQA 全注意力 3:1 交错的混合架构,MoE 含 512 专家 top-10 路由。

    推荐理由:SGLang 团队详解 Qwen3.8 混合注意力架构的推理支持方案,给出内核优化、并行布局与实测吞吐数字,可作部署参考。

8月10日周一
  1. Linear Now60

    Linear 官方解析 Linear Agent 的构建方法:用边界而非固定路径控制 Agent

    Linear 官方详解 Linear Agent 的构建思路:不为 Agent 设计固定路径,而是通过系统提示词、工具设计、对 Linear 产品的语义建模、system skills 按需加载和自研 harness 来划定边界。

    推荐理由:Linear 官方复盘 Agent 的设计取舍,涉及系统提示词、工具设计、system skills 和自研 harness,方法可迁移到类似 Agent 构建。