SGLang 与 Miles 为 Thinking Machines Lab 975B 多模态模型 Inkling 提供 Day-0 支持
SGLang 与 Miles 团队同 Thinking Machines Lab 合作,为 975B 参数、上下文最长 1M tokens 的多模态模型 Inkling 提供 Day-0 支持。
推荐理由:原文给出 Inkling 架构细节、SGLang 各项优化后的具体吞吐数字,以及 Miles 侧完整 RL 训练方案,工程参考价值具体。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
当前仅显示精选新闻SGLang 与 Miles 团队同 Thinking Machines Lab 合作,为 975B 参数、上下文最长 1M tokens 的多模态模型 Inkling 提供 Day-0 支持。
推荐理由:原文给出 Inkling 架构细节、SGLang 各项优化后的具体吞吐数字,以及 Miles 侧完整 RL 训练方案,工程参考价值具体。
Meta 官方宣布将位于路易斯安那州里奇兰教区的数据中心算力规模扩大至 5GW,项目投入超过 500 亿美元,用于各项基础设施建设和劳动力培训计划。Meta 承诺该数据中心的能源、水资源及相关基础设施费用全部由其承担,并额外投资超 10 亿美元改善当地道路、供水及污水处理系统。Meta 近期还与安特吉公司达成协议,为七座新建天然气发电厂、三个电网级储能电池、核电增容项目及其他外购电力提供资金支持。
推荐理由:Meta 将路易斯安那州数据中心扩至 5GW 并投入超 500 亿美元,自建天然气与储能供电的配套值得关注。
Sierra 于今年 1 月成立六人 AI 加速团队,将多个角色专属 Agent 合并为统一 Agent Pinecone,内置在 Claude Code 和 Codex 之上。
推荐理由:原文给出 Sierra 内部推行统一 Agent 的具体做法与教训,单 Agent 架构、持久化上下文和以产出物衡量价值等经验可迁移到其他公司。
Hugging Face 宣布 vLLM 的 transformers modeling backend 现在在多种 LLM 架构上达到甚至超过 vLLM 手写原生实现的速度,模型作者无需移植即可获得原生推理性能。
推荐理由:官方给出三种 Qwen3 规模下的对比数据和方法,读者可以据此评估是否直接用 transformers 后端替代手写 vLLM 实现。
Microsoft 在 Build 2026 宣布 Foundry Managed Compute 及 Hugging Face 模型集,精选开源权重模型每周更新,可一键部署到 Azure 预置的 GPU 托管平台。
推荐理由:官方详解 Hugging Face 模型进入 Foundry Managed Compute 的策展流程、支持运行时和部署方式,读者可以据此评估企业侧部署开源模型的实际路径。
AI 公司在 12 个月内向前向部署工程(FDE)投入 97.5 亿美元,相当于 Accenture 年度服务成本的约五分之一。文中归纳出三种模式,Microsoft 与 Amazon 用既有编制组建团队,OpenAI 与 Anthropic 成立由外部私募支持的独立实体,Google Cloud 则投入 7.5 亿美元做合作伙伴基金。
推荐理由:文中把 FDE 投入拆成三种结构模式,读者可借融资与人员数字判断这套模式为何被各实验室采用。
Hugging Face 与 SkyPilot 联合推出 store: hf 后端,用一个 hf:// URL 和现有 HF_TOKEN 即可将 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,任务可调度到 20+ 云、Kubernetes 和本地集群。
推荐理由:原文给出具体价格对比和三云基准数字,读者可以据此评估零出流存储对跨云训练成本的实际影响。
Anthropic 宣布 Claude 模型在 Microsoft Foundry 正式可用,托管于 Azure,由 Anthropic 负责推理并作为数据处理方。
推荐理由:原文给出 Azure 原生托管与 Anthropic 托管两种运行方式及首批可用模型,读者可据此判断企业部署如何选择。
OpenAI 开始有限预览 GPT-5.6 系列三款模型,分别是旗舰 Sol、面向日常工作的均衡模型 Terra 和快速低价的 Luna。Terra 性能与 GPT-5.5 相当但价格便宜 2 倍,三款按每 1M tokens 计费,Sol 为 5 美元输入 / 30 美元输出,Terra 为 2.50 / 15,Luna 为 1 / 6。
推荐理由:三档模型分别对应旗舰、日常与低价定位,正文列出每百万 token 定价与缓存计费变化,读者可据此估算使用成本。
在 HF Jobs 上用一条命令即可运行 vLLM,获得私有、按秒计费的 OpenAI 兼容端点。端点通过 HF token 鉴权,可用 curl 或 Python OpenAI 客户端调用;文章还给出 SSH 调试、Gradio 对话和作为 Pi 编码智能体后端的配置,并对比 HF Jobs 与 Inference Endpoints 的适用场景。
推荐理由:用一条命令在 HF Jobs 上部署 vLLM 端点,并给出从查询到接入编码智能体的完整配置路径。
OpenAI与博通联合发布自研AI推理芯片Jalapeño,这是OpenAI第一颗自研智能处理器,从最初设计到制造流片用时九个月。工程样品已在实验室以量产目标频率和功耗稳定运行ML工作负载,其中包括GPT-5.3-Codex-Spark,早期测试显示其每瓦性能将大幅优于当前最先进水平。Jalapeño计划于2026年底开始初步部署,并与微软等合作伙伴共同推进吉瓦级数据中心。
推荐理由:原文交代了OpenAI自研推理芯片的架构取向、合作分工与部署节奏,读者可据此理解其全栈基础设施布局。
OpenAI 发布首颗自研 AI 芯片 Jalapeño,由 OpenAI 与 Broadcom 联合发布,专门用于大模型推理加速而非训练,并兼容所有 LLM。
推荐理由:芯片由 OpenAI 与 Broadcom 联合设计并给出 2026 年底部署时间和多代路线图,可用于观察自研算力的推进节奏。
Mistral 发布 Mistral OCR 4,除提取文本外还返回边界框、块类型分类(标题、表格、公式、签名等)和逐页逐词的内联置信度分数,支持 170 种语言、10 个语言组。
推荐理由:官方说明了新模型的结构化输出能力、基准得分及其已知评分缺陷,并给出 API 与 Document AI 的选择规则,便于读者判断适用场景。
huggingface_hub 将发布周期从每 4 到 6 周一次缩短到每周一次,用 GitHub Actions 编排整个流程,由开源权重模型起草 release notes 和 Slack 公告,再由人工审核后发布。
推荐理由:原文公开了发版工作流的信任校验循环,读者可据此把模型起草加确定性校验的方法迁移到自己的项目。
PaddleOCR 发布 PP-OCRv6 通用 OCR 模型家族,提供 tiny、small、medium 三档,参数从 1.5M 到 34.5M,其中 medium 在官方多场景基准上达到 86.2% 检测 Hmean 和 83.2% 识别准确率。
推荐理由:PP-OCRv6 给出三档参数与多后端入口,读者可据此比较轻量 OCR 在各自部署场景中的取舍。
昇腾 0 Day 支持智谱 GLM-5.2,为编程与长程任务提供全面推理优化,A3 系列产品已支持单双机及大 EP 推理部署。官方围绕 MoE 大融合算子、通信与计算融合、多 Token 预测、高并发调度、智能缓存以及 PD 分离与 Prefix Cache 等关键技术做推理优化。GLM-5.2 于 6 月 17 日上线并开源,已在 Day 0 完成与华为昇腾等国产算力平台的推理适配。
推荐理由:原文列出昇腾针对 GLM-5.2 的多项推理优化技术,读者可了解国产算力平台适配长上下文模型的工程路径。
Anthropic 在 Claude Blog 发文对比 Claude Code 中 CLAUDE.md、rules、skills、subagents、hooks 和 output styles 的加载时机与上下文成本,并给出各自适用的指令类型。
推荐理由:文章按加载时机与上下文成本逐项对比 CLAUDE.md、rules、skills、subagents 和 hooks,给出指令该放哪里的判断依据。
智谱上线并开源 GLM-5.2,在全球百万用户参与盲测的前端开发评估系统 Code Arena 上取得全球可用模型第一;摩尔线程同日宣布在 AI 训推一体全功能 GPU 智算卡 MTT S5000 上完成 Day-0 极速适配。
推荐理由:材料给出国产 GPU 对 GLM-5.2 的 Day-0 适配细节,可观察长上下文推理的软硬件协同路径。
Anthropic 发布 Claude Managed Agents,一套用于构建和部署生产级智能体的可组合 API,把调用 Claude 的 harness 与执行代码的沙箱解耦,用 session 连接两者。
推荐理由:Anthropic 在文中给出大脑与执行沙箱解耦的架构和时延数据,读者可据此判断托管智能体的落地方式。
Hugging Face 发布教程,介绍如何把 GitHub Actions 的 CI 任务迁移到 Hugging Face Jobs 上运行。作者为 Trackio 搭建的方案只需把 runs-on 改成 hf-jobs-* 标签,CPU CI 耗时从 GitHub 托管的 1m40s 降到 1m10s,GPU 测试在 t4-small 上 45 秒跑完、成本不到 1 美分。
推荐理由:文中给出从 GitHub Actions 迁移到 HF Jobs 的完整步骤和实测耗时对比,可供需要 GPU CI 的 ML 项目参考。