跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

当前仅显示精选新闻
228条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 1–20 条 · 共 228 条
10月5日周一
  1. OpenRouter Announcements70

    OpenRouter 对比四家 AI Agent 服务端代码执行工具并实测自家 openrouter:shell

    OpenRouter 发布对比文章,介绍 OpenAI、Anthropic、Google 与 OpenRouter 四家服务端代码执行工具的沙箱能力、限制与成本,并介绍自家 openrouter:shell 和 openrouter:bash 两款 beta 工具,可为 Responses 和 Messages API 上的任意模型运行命令。

    推荐理由:作者亲自实测并横向对比四家托管代码执行工具的能力、延迟与计费,还给出何时仍需自建沙箱的边界判断,方法可迁移。

10月4日周日
  1. AYi66

    作者拆解 Anthropic 官方条款与 9 月威胁情报报告,指出今年上半年共封禁 1140 万个账号(去年下半年为 145 万),39.8 万次申诉仅 4.2 万次成功,成功率约十分之一。

    引用AYi@AYi_AInotes

    https://x.com/i/article/2106425943061413888

    推荐理由:作者基于 Anthropic 官方条款与 9 月威胁情报报告,把封号归因从指纹玄学转到多维交叉打分,并给出可执行的四层防线做法。

  2. Hugging Face Blog61

    Microsoft 与 Hugging Face 发布 ThinkingBox,以数据库终态评测 Agent 真实成效

    Microsoft 与 Hugging Face 发布 ThinkingBox 沙箱和 ThinkingBox-Bench 基准,通过 507 个有状态业务工作流、每个任务独立运行 20 次,用可执行检查评分 Agent 留下的终端数据库状态和副作用,而非工具调用或最终回复。

    推荐理由:原文给出基于数据库终态评分和多轮一致性指标的结果,读者可以据此重新审视现有 agent 评测只看 pass@1 的做法。

10月3日周六
  1. Z Finance · 微信公众号68

    Databricks CEO Ali Ghodsi 对谈:RSI 并未发生,前沿训练正变得更慢、更贵、更难

    Z Finance 编译 Databricks CEO Ali Ghodsi 与 Sarah Wang、Martin Casado 的对谈,Ghodsi 认为递归自我改进(RSI)尚未发生,判断它需要四个条件同时成立:下一代模型资源更少、训练时间更短、能力持续提高且可重复。

    推荐理由:对话给出了判断 RSI 是否发生的四条件框架,并用现实训练成本和资源数据反驳了自我改进已成真的说法。

  2. OpenRouter Announcements61

    OpenRouter 发布 Model Router Benchmarks 页面,横向对比多个模型路由器

    OpenRouter 推出 Model Router Benchmarks 页面,对 Auto Router、Fugu、Jev Router 等路由器在质量、速度和成本三个维度上跑分对比,Router Index 默认按质量 60%、时间 20%、成本 20% 加权出 0 到 10 的综合分。

    推荐理由:原文给出路由器的分类方式和质量、速度、成本的加权评分方法,读者可以据此判断何时值得用路由器替代单一模型。

  3. AWS Machine Learning Blog62

    AWS 用 Amazon Quick 和 Adjudicated Query 模式实现数万租约的合规扫描

    AWS 发布 Adjudicated Query 设计模式,用 Amazon Quick 聊天界面搭配确定性规则引擎扫描 50,000 份租约的合规性,模型只负责翻译问题和叙述结果,判定由规则引擎完成。

    推荐理由:文章给出了用规则引擎加受限 MCP 接口保证合规扫描完整性的设计模式,并分析了大语言模型在查询层与交付层各自的越界风险。

10月2日周五
  1. AWS Machine Learning Blog60

    AWS 实操教程:在 Amazon Bedrock AgentCore Runtime Instances 上搭建三智能体音乐制作流水线

    AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。

    推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。

  2. OpenRouter Announcements64

    OpenRouter 详解六大 Agent 框架的工具调用 Schema 处理,并提出在 API 层统一格式

    OpenRouter 比较了 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Claude Agent SDK、Microsoft Agent Framework 和 Google ADK 如何定义工具 Schema 并在不同提供商的 wire format 之间做翻译。

    推荐理由:原文逐一拆解六大框架的工具调用格式翻译位置,并给出在 API 层统一格式的可行做法,便于开发者选型前对齐自己的技术栈。

10月1日周四
  1. 量子位 · 微信公众号67

    乌兰察布获12.5GW数据中心容量承诺,作者实地走访草原上的算力之城

    量子位作者实地走访内蒙古乌兰察布,当地截至今年6月已获约12.5GW数据中心容量承诺,超过OpenAI Stargate的10GW初始承诺,但2025年已投运容量约1.2GW、利用率约66%。文章分析其依托0.35元/度电价、风光资源、冷凉气候和到北京240公里区位吸引华为、阿里、快手、远景等落地,并提示规划容量向实际Token产出转化仍面临审批、接电、利用率和租金等考验。

    推荐理由:作者实地走访乌兰察布算力园区,把12.5GW规划承诺与现场落地进度对照,读者可据此理解容量数字与实际运行的距离。

  2. 机器之心 · 微信公众号74

    美国企业转向开放权重模型,中国开放模型吃到企业降本红利

    机器之心援引《金融时报》报道,美国企业开始把 AI 任务从 OpenAI、Anthropic 闭源模型迁移到开放权重模型上,中国公司 DeepSeek、智谱成为重要受益方。

    推荐理由:文章基于金融时报报道和调用数据,梳理美国企业用开放模型替代闭源 API 的成本与数据主权考量。

  3. OpenRouter Announcements67

    OpenRouter 指南:用置信度阈值实现便宜模型到强模型的升级路由

    OpenRouter 发布教程,讲解基于置信度的升级路由:让便宜模型通过结构化输出返回 0 到 1 的置信度字段,低于阈值时把请求转给更强模型。教程强调分数只是自报排序而非校准概率,阈值须按自己流量的分错误率设定,示例中阈值 0.7 升级 14% 的请求,把保留答案的错误率从约 10% 降到约 4%。

    推荐理由:原文给出用结构化输出实现置信度分级的完整流程,含阈值校准示例和常见误区,方法可直接迁移到自己的流量。

  4. LangChain Blog70

    LangChain 如何在 harness 中构建模型路由器,Open SWE 单线程中位成本降 64%

    LangChain 为其开源编码 Agent Open SWE 构建了模型路由器,在 973 条线程的 A/B 测试中,相比始终使用 GPT-6 Astra,中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率无显著差异(29.2% vs 27.3%,p=0.49)。

    推荐理由:作者用自身 Open SWE 的 A/B 数据说明路由放在 harness 内的理由和成本收益,方法可迁移到其他多任务 Agent。

9月30日周三
  1. 机器之心 · 微信公众号72

    DeepSeek 开源面向华为昇腾的基础组件,DeepGEMM、DeepEP、TileLang 等计算与通信工具同步发布

    9 月 30 日 DeepSeek 宣布开源面向华为昇腾平台的基础设施组件,包括 TileLang 编译工具、DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect,分别覆盖矩阵运算、跨设备通信、向量计算与访存、稀疏注意力和数据筛选,与其英伟达平台组件一一对应。

    推荐理由:原文梳理了 DeepSeek 开源昇腾计算与通信组件的构成和性能数据,开发者可以据此评估在国产算力上复用这些基础工具的空间。

  2. DeepSeek · 微信公众号71

    DeepSeek 开源面向华为昇腾平台的基础设施组件

    DeepSeek 正式开源面向华为昇腾算力平台的基础设施组件,包括 TileLang 编译工具、DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect,与此前英伟达平台组件一一对应。

    推荐理由:原文给出各组件与英伟达版本的一一对应关系和昇腾 950 128 卡超节点合作细节,可帮助读者评估昇腾软件生态的可用程度。