跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

当前仅显示精选新闻
231条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 101–120 条 · 共 231 条
8月23日周日
  1. @rohanpaul_ai66

    英伟达已告知部分大客户,其 AI 芯片服务器在许多情况下涨价约 17%,内存涨价推高了 Grace Blackwell 与 Vera Rubin 系统的价格。Vera Rubin NVL72 单机架含 20.7TB HBM4 和 54TB LPDDR5X,TrendForce 预计 DRAM 供应到 2027 年持续偏紧,17% 的涨幅可能让 1GW 建设成本至少增加 $5B。

    推荐理由:内存涨价正传导到整机报价,读者可据此理解 AI 服务器资本开支与数据中心交付节奏的关联。

8月21日周五
  1. Claude Blog69

    Anthropic 发布 AI-Native SDLC 手册,梳理 Claude 在六个研发阶段的落地方式

    Anthropic 发布 AI-Native SDLC playbook,把软件开发流程拆成 Plan、Design、Build、Test、Deploy、Maintain 六个阶段,逐阶段给出具体做法、治理考量与度量指标。

    推荐理由:Anthropic 公开其内部把 Claude 嵌入研发六个阶段的做法,含各阶段产物与治理门槛,便于团队对照改造自身流程。

  2. @frxiaobei74

    Stripe 宣布收购 OpenRouter。OpenRouter 目前是最大的 AI 市场与网关,每天处理超过 10 万亿 token、覆盖 400 多个模型。作者认为支付与模型调用在路径选择、失败重试、风控和结算上解决的是同类问题,若 token 成为 AI 公司最核心的货币,模型路由会变成未来智能调用的清算层,而模型本身正逐渐变成可替换的原材料。

    引用@OpenRouter@OpenRouter

    OpenRouter is joining Stripe. We started OpenRouter with a simple mission: intelligence should be multi-model. Today, we are the largest AI marketplace & gateway, processing 10T+ tokens daily on 400+ models. Joining @Stripe gives us the opportunity to accelerate that mission. https://t.co/21T5zZWfDM

    推荐理由:作者把 Stripe 的支付清算经验与模型路由做类比,读者可据此理解路由层为何被视为基础设施。

  3. Hugging Face Blog64

    Hugging Face 解析 Papers with Code 搜索背后的 Inference Endpoints、Jobs 与 Buckets 架构

    Hugging Face 介绍 Papers with Code 混合搜索架构:PostgreSQL 全文检索加 pgvector 语义检索,经 RRF 融合,用 Qwen/Qwen3-Embedding-0.6B 生成 256 维向量,已覆盖超 110,000 篇 arXiv 论文。

    推荐理由:作者复盘了自己上线论文混合搜索的架构与教训,读者可以借鉴冷启动回退、embedding 契约和 Matryoshka 维度权衡这些可迁移做法。

  4. Hugging Face Blog65

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理吞吐最高提升 3.2x

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpark 草稿模型 checkpoint,通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18x,端侧最高 2.87x。

    推荐理由:官方为 LFM2.5 三款模型发布 DSpark 草稿模型,给出从 H100 到 MacBook 的实测加速数据和开源接入方式。

8月20日周四
  1. Artificial Intelligence News81

    Stripe 同意收购 OpenRouter,AI 模型路由持续扩张

    Stripe 同意收购 AI 模型路由平台 OpenRouter,把模型选择与路由并入其 AI 用量与按 token 计费业务。OpenRouter 支持 80 多家供应商的 400 多个模型,通过单一 API 转发请求,并按任务复杂度、价格、速度与可靠性选择模型及其供应商端点。

    推荐理由:收购把模型路由接入支付与计费体系,读者可据此观察多模型环境下成本与结算方式的变化。

  2. @omarsar066

    Elvis Saravia 介绍了 TrueFoundry 发布的开源 agent harness TrueForge,他获得早期访问并在本地运行了数天。TrueForge 负责工具调用循环、上下文管理、子智能体协调和沙箱代码执行,支持 OpenAI、Anthropic、Google 模型以及 Kimi、GLM、DeepSeek 等开源权重模型,模型路由是可配置项。

    原始视频预览图;未保存可播放视频URL

    推荐理由:作者给出同一基准下的成本对比和多模型路由配置,便于判断自托管 agent harness 的实际取舍。

8月18日周二
  1. 量子位 · 微信公众号81

    英伟达为OpenAI数据中心提供担保,锁定20年芯片收入

    英伟达与KKR、阿波罗等投资机构签约,由机构出资5000亿美元建设数据中心,英伟达提供部分租金与残值担保,以锁定长期芯片订单。首个项目位于美国俄亥俄州朴茨茅斯的PORTS-Pike园区,租户为OpenAI,供电规模4.25吉瓦,采用英伟达DSX全栈AI工厂平台。

    推荐理由:原文拆解英伟达为OpenAI数据中心提供担保的商业逻辑,读者可借此看清算力融资如何锁定长期芯片订单。

8月17日周一
  1. @testingcatalog77

    OpenAI 计划在 PORTS-Pike Technology Campus 锁定 8 吉瓦 IT 容量,合作方包括 SB Energy、NVIDIA 和美国能源部。首轮社区投资合计 8000 万美元,其中 OpenAI 出资 4000 万美元。OpenAI 还将向约 844,000 名符合条件的俄亥俄州学生提供最高 8400 万美元的 Codex 额度。

    推荐理由:OpenAI 在俄亥俄州的数据中心协议给出了项目规模,以及面向学生提供 Codex 额度的具体安排。

  2. AI寒武纪 · 微信公众号79

    英伟达与SB Energy锁定俄亥俄州园区资源,OpenAI将入驻首期4.25吉瓦AI工厂

    英伟达宣布与SB Energy合作,在美国俄亥俄州PORTS-Pike园区锁定土地、电力和厂房资源,建设由OpenAI租用、全面采用英伟达DSX AI工厂平台的AI工厂,首期部署最多提供4.25吉瓦容量。

    推荐理由:英伟达把芯片供应链的锁定打法复制到土地与电力,读者可看到算力扩张的瓶颈正转向基建资源。

  3. IT Home78

    黄仁勋称 OpenAI 承诺 2030 年前部署约 12GW 英伟达算力

    黄仁勋 8 月 17 日通过英伟达官方博客表示,OpenAI 已承诺在 2030 年前大规模部署英伟达 AI 基础设施,现有和计划中的部署合计约 12GW 算力,对应约 6,000 亿美元业务机会。

    推荐理由:黄仁勋披露 OpenAI 到 2030 年的算力部署承诺与对应收入量级,可看到英伟达锁定 AI 工厂土地电力资源的思路。

  4. NVIDIA Blog79

    英伟达与 SB Energy 合作锁定 PORTS-Pike 产能,OpenAI 将入驻

    英伟达与 SB Energy 合作,在俄亥俄州 PORTS-Pike 科技园区锁定 LPS 产能用于承载英伟达算力,OpenAI 将作为租户入驻。初期部署预计提供 4.25 吉瓦 AI 工厂容量,英伟达为其中约 4 吉瓦的 LPS 基础设施提供 20 年期担保,担保随数据中心在 2028 至 2030 年分阶段投用生效。

    推荐理由:文中给出英伟达为 PORTS-Pike 站点担保的具体范围与分期时间,读者可据此理解 AI 基建融资的结构。