跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

当前仅显示精选新闻
231条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 61–80 条 · 共 231 条
9月10日周四
9月9日周三
  1. Claude Blog63

    Claude 平台用提示词缓存、反模式清理与 effort 校准降低成本并提升性能

    Anthropic 在 Claude Blog 给出 Claude Platform 的成本优化指南,称通过提高提示词缓存命中率、清理升级前沿模型时的提示词反模式以及按任务校准 effort,可在不牺牲性能的前提下降低 API 成本。

    推荐理由:原文给出缓存、指令清理与 effort 校准三条降本杠杆及对应命令,读者可对照自身调用成本自查。

  2. OpenRouter Announcements62

    OpenRouter 推出美国区域路由,与去年上线的 EU 路由配套保障数据驻留

    OpenRouter 发布美国区域路由 us.openrouter.ai,与去年 10 月上线的 eu.openrouter.ai 配套,请求在区域内解密并只路由到区域内提供商,全程不出区。

    推荐理由:原文区分了推理级与端到端区域路由的差异,并说明区域域名、404 行为和 Guardrails 配置,读者可直接评估合规用法。

9月8日周二
  1. OpenRouter Announcements73

    OpenRouter 推出 Shell 工具、容器与 Files API

    OpenRouter 发布 openrouter:shell 服务端工具、openrouter:bash 工具和 Files API,让平台上任意支持工具调用的模型都能在托管 Linux 容器中执行命令,目前以 beta 提供。

    推荐理由:原文给出了定价、容器网络与文件管理等具体配置细节,可帮助读者评估在现有 Agent 工作流中如何复用这套服务端沙箱。

9月7日周一
  1. @thexpin65

    据 Bloomberg 报道,DeepSeek 计划在内蒙古数据中心用华为昇腾 950DT 运行模型,部署规模取决于芯片供应,这些芯片目前不计划用于训练。华为据称已投入 $20B+ 囤积内存并自行完成封装,950DT 年产量估计在 200K 至 400K–500K 之间,阿里和字节跳动也在争取供应。阿里、腾讯和字节跳动还通过第三方租用 Nvidia B 系列芯片,反映出算力依然紧缺。

    推荐理由:转述 Bloomberg 的报道呈现国产算力供应与部署选择的现状,读者可据此了解算力紧缺对模型运行的影响。

9月5日周六
  1. @rohanpaul_ai69

    据 Bloomberg 报道,DeepSeek 计划在内蒙古吉瓦级数据中心部署 16 万颗华为 950DT 芯片,若建成将是已知最大的华为 AI 集群之一。华为 950DT 面向解码推理与训练,配备 144GB 内存、4TB/s 内存带宽和 2TB/s 互联带宽,按华为路线图定于 2026 年 Q4。报道称这批芯片只能填满该吉瓦级站点的一部分,DeepSeek 其余加速器组合尚未明确。

    推荐理由:报道给出 16 万颗芯片的规模与 950DT 的规格与排期,可据此观察国产算力承接推理负载的进度。

9月4日周五
9月3日周四
  1. @SemiAnalysis_66

    OpenAI 与 Nvidia 8 GW Portsmouth 项目涉及的 DOE 联邦土地成为关注焦点,2026 年 3 月的动工在 DOE 的 Portsmouth 场址进行,该地前身是铀浓缩厂。4 月租出的首批土地明确指定用于数据中心建设。配图还标注了 DOE 土地、从 Oklo Power 收购的土地以及周边私人农场的位置。

    推荐理由:推文用一张土地权属图拆解了 8 GW 项目中 DOE 土地与私人地块的边界,让读者看清联邦土地在数据中心建设中的实际角色。

9月2日周三
  1. Cursor Blog72

    Cursor 发布自托管机器,云端智能体可在自有基础设施上运行

    Cursor 发布自托管机器功能,云端智能体可以运行在团队自管的机器资源池上,智能体循环、推理与规划仍留在 Cursor 云端。工具执行则转移到自有环境中的机器:安装 Cursor CLI 并运行 agent worker start 建立通往 Cursor 云端的出站 HTTPS 长连接,Cursor 从不主动向用户网络发起连接。

    推荐理由:自托管机器把工具执行环境交回团队自有基础设施,推理与编排仍留在 Cursor 云端,读者可据此判断适用边界。

  2. Google Developers Blog62

    Google 复盘 AI Agents Challenge 最强提交背后的 4 种工程模式

    Google for Startups AI Agents Challenge 评选结束后,官方从高分提交中总结出四种工程模式:双向 MCP、事件驱动并发、同标准降级(Gemini 3.1 Pro 503 时回退 Gemini 3.6 Flash 并共用同一校验函数)、以及模型调用前的分层路由。

    推荐理由:文章从真实参赛代码中提炼四个可复用的工程模式,覆盖工具暴露、并发、降级校验和分层路由,可直接迁移到自己的智能体项目。

9月1日周二
  1. @TencentHunyuan72

    腾讯混元称 Hy4 preview 在 AI 研究中自行发现推理瓶颈,通过算子融合与通信优化把端到端吞吐提升 31.8%,且在不同上下文长度和并发下保持稳定。该模型此前以 770B 总参数、49B 激活参数、1M 上下文发布,主打生产力与开源前沿,并给出博客、HuggingFace 和 GitHub 入口。

    引用@TencentHunyuan@TencentHunyuan

    🚀 Hy4 preview is here. 770B, 49B active, 1M context. Built for productivity. Open source frontier. Consistent affordable price. Use it. Tell us what breaks. More on Hy blog:https://t.co/rbl1IWRk3C HuggingFace:https://t.co/mE9wevH5XR Github:https://t.co/pyl9zckpoL https://t.co/4iW6gSuZKr

    推荐理由:官方给出模型自主定位推理瓶颈并完成优化的具体数字,可供观察自我优化在推理侧的落地方式。