跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

当前仅显示精选新闻
231条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 161–180 条 · 共 231 条
7月15日周三
7月13日周一
  1. IT Home80

    Meta 宣布扩建路易斯安那州数据中心至 5GW,总投资超 500 亿美元

    Meta 官方宣布将位于路易斯安那州里奇兰教区的数据中心算力规模扩大至 5GW,项目投入超过 500 亿美元,用于各项基础设施建设和劳动力培训计划。Meta 承诺该数据中心的能源、水资源及相关基础设施费用全部由其承担,并额外投资超 10 亿美元改善当地道路、供水及污水处理系统。Meta 近期还与安特吉公司达成协议,为七座新建天然气发电厂、三个电网级储能电池、核电增容项目及其他外购电力提供资金支持。

    推荐理由:Meta 将路易斯安那州数据中心扩至 5GW 并投入超 500 亿美元,自建天然气与储能供电的配套值得关注。

7月10日周五
7月8日周三
  1. Hugging Face Blog64

    Hugging Face:vLLM 的 transformers 后端达到原生实现速度

    Hugging Face 宣布 vLLM 的 transformers modeling backend 现在在多种 LLM 架构上达到甚至超过 vLLM 手写原生实现的速度,模型作者无需移植即可获得原生推理性能。

    推荐理由:官方给出三种 Qwen3 规模下的对比数据和方法,读者可以据此评估是否直接用 transformers 后端替代手写 vLLM 实现。

7月7日周二
  1. Hugging Face Blog61

    Microsoft Foundry Managed Compute 上线 Hugging Face 精选模型集

    Microsoft 在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集,精选开源权重模型每周更新,可一键部署到 Azure 预置的 GPU 托管平台。

    推荐理由:官方详解 Hugging Face 模型进入 Foundry Managed Compute 的策展流程、支持运行时和部署方式,读者可以据此评估企业侧部署开源模型的实际路径。

  2. Tomer Tunguz78

    AI 公司 12 个月向前向部署工程投入 97.5 亿美元

    AI 公司在 12 个月内向前向部署工程(FDE)投入 97.5 亿美元,相当于 Accenture 年度服务成本的约五分之一。文中归纳出三种模式,Microsoft 与 Amazon 用既有编制组建团队,OpenAI 与 Anthropic 成立由外部私募支持的独立实体,Google Cloud 则投入 7.5 亿美元做合作伙伴基金。

    推荐理由:文中把 FDE 投入拆成三种结构模式,读者可借融资与人员数字判断这套模式为何被各实验室采用。

  3. Hugging Face Blog63

    Hugging Face 与 SkyPilot 推出 store: hf,跨云读取 Hub 数据免出流费

    Hugging Face 与 SkyPilot 联合推出 store: hf 后端,用一个 hf:// URL 和现有 HF_TOKEN 即可将 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,任务可调度到 20+ 云、Kubernetes 和本地集群。

    推荐理由:原文给出具体价格对比和三云基准数字,读者可以据此评估零出流存储对跨云训练成本的实际影响。

6月29日周一
6月27日周六
  1. Simon Willison77

    OpenAI 预览 GPT-5.6 系列 Sol、Terra、Luna 三款模型

    OpenAI 开始有限预览 GPT-5.6 系列三款模型,分别是旗舰 Sol、面向日常工作的均衡模型 Terra 和快速低价的 Luna。Terra 性能与 GPT-5.5 相当但价格便宜 2 倍,三款按每 1M tokens 计费,Sol 为 5 美元输入 / 30 美元输出,Terra 为 2.50 / 15,Luna 为 1 / 6。

    推荐理由:三档模型分别对应旗舰、日常与低价定位,正文列出每百万 token 定价与缓存计费变化,读者可据此估算使用成本。

6月26日周五
  1. Hugging Face Blog67

    在 HF Jobs 上用一条命令运行 vLLM 服务器

    在 HF Jobs 上用一条命令即可运行 vLLM,获得私有、按秒计费的 OpenAI 兼容端点。端点通过 HF token 鉴权,可用 curl 或 Python OpenAI 客户端调用;文章还给出 SSH 调试、Gradio 对话和作为 Pi 编码智能体后端的配置,并对比 HF Jobs 与 Inference Endpoints 的适用场景。

    推荐理由:用一条命令在 HF Jobs 上部署 vLLM 端点,并给出从查询到接入编码智能体的完整配置路径。

6月24日周三
  1. AI寒武纪 · 微信公众号81

    OpenAI与博通联合发布自研AI推理芯片Jalapeño,计划2026年底开始吉瓦级部署

    OpenAI与博通联合发布自研AI推理芯片Jalapeño,这是OpenAI第一颗自研智能处理器,从最初设计到制造流片用时九个月。工程样品已在实验室以量产目标频率和功耗稳定运行ML工作负载,其中包括GPT-5.3-Codex-Spark,早期测试显示其每瓦性能将大幅优于当前最先进水平。Jalapeño计划于2026年底开始初步部署,并与微软等合作伙伴共同推进吉瓦级数据中心。

    推荐理由:原文交代了OpenAI自研推理芯片的架构取向、合作分工与部署节奏,读者可据此理解其全栈基础设施布局。

6月23日周二
  1. Mistral AI69

    Mistral 发布 Mistral OCR 4:支持边界框、块分类和置信度分数

    Mistral 发布 Mistral OCR 4,除提取文本外还返回边界框、块类型分类(标题、表格、公式、签名等)和逐页逐词的内联置信度分数,支持 170 种语言、10 个语言组。

    推荐理由:官方说明了新模型的结构化输出能力、基准得分及其已知评分缺陷,并给出 API 与 Document AI 的选择规则,便于读者判断适用场景。

  2. Hugging Face Blog65

    huggingface_hub 如何用 AI 起草、人工把关实现每周发版

    huggingface_hub 将发布周期从每 4 到 6 周一次缩短到每周一次,用 GitHub Actions 编排整个流程,由开源权重模型起草 release notes 和 Slack 公告,再由人工审核后发布。

    推荐理由:原文公开了发版工作流的信任校验循环,读者可据此把模型起草加确定性校验的方法迁移到自己的项目。

6月22日周一
6月18日周四
  1. IT Home78

    华为昇腾 0 Day 支持智谱 GLM-5.2 模型,提供全面推理优化

    昇腾 0 Day 支持智谱 GLM-5.2,为编程与长程任务提供全面推理优化,A3 系列产品已支持单双机及大 EP 推理部署。官方围绕 MoE 大融合算子、通信与计算融合、多 Token 预测、高并发调度、智能缓存以及 PD 分离与 Prefix Cache 等关键技术做推理优化。GLM-5.2 于 6 月 17 日上线并开源,已在 Day 0 完成与华为昇腾等国产算力平台的推理适配。

    推荐理由:原文列出昇腾针对 GLM-5.2 的多项推理优化技术,读者可了解国产算力平台适配长上下文模型的工程路径。

  2. Claude Blog64

    Anthropic 说明 Claude Code 中 CLAUDE.md、skills、hooks 与 subagents 的适用场景

    Anthropic 在 Claude Blog 发文对比 Claude Code 中 CLAUDE.md、rules、skills、subagents、hooks 和 output styles 的加载时机与上下文成本,并给出各自适用的指令类型。

    推荐理由:文章按加载时机与上下文成本逐项对比 CLAUDE.md、rules、skills、subagents 和 hooks,给出指令该放哪里的判断依据。

6月17日周三
  1. IT Home80

    摩尔线程在 MTT S5000 上完成智谱 GLM-5.2 的 Day-0 适配

    智谱上线并开源 GLM-5.2,在全球百万用户参与盲测的前端开发评估系统 Code Arena 上取得全球可用模型第一;摩尔线程同日宣布在 AI 训推一体全功能 GPU 智算卡 MTT S5000 上完成 Day-0 极速适配。

    推荐理由:材料给出国产 GPU 对 GLM-5.2 的 Day-0 适配细节,可观察长上下文推理的软硬件协同路径。

6月10日周三
6月9日周二
  1. Hugging Face Blog60

    如何把 GitHub CI 迁移到 Hugging Face Jobs

    Hugging Face 发布教程,介绍如何把 GitHub Actions 的 CI 任务迁移到 Hugging Face Jobs 上运行。作者为 Trackio 搭建的方案只需把 runs-on 改成 hf-jobs-* 标签,CPU CI 耗时从 GitHub 托管的 1m40s 降到 1m10s,GPU 测试在 t4-small 上 45 秒跑完、成本不到 1 美分。

    推荐理由:文中给出从 GitHub Actions 迁移到 HF Jobs 的完整步骤和实测耗时对比,可供需要 GPU CI 的 ML 项目参考。