跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

当前仅显示精选新闻
231条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 81–100 条 · 共 231 条
8月31日周一
8月30日周日
8月29日周六
  1. AI前线 · 微信公众号82

    Meta 的 OT 项目被叫停:AI Agent 未能取代员工,事故增四成、工程师救火多七成

    Meta 代号 OT 的组织转型计划曾设想用 AI Agent 接管数千人的日常工作,部分团队削减 60% 人力,但第一轮裁员后内部代码变更同比增长 220% 而真正触达用户的变更仅增 36%,AI Agent 造成的重大技术和安全事故较上一年增加 40%,员工处理这些问题的时间增加多达 70%,扎克伯格在 5 月 19 日晚取消了原定 11 月的第二轮裁员。

    推荐理由:Meta 内部用 Agent 替代员工的转型计划,给出了事故率上升四成、救火时间增加七成等具体量化后果,可供评估 Agent 落地边界。

  2. LMSYS Blog60

    SGLang 发布 SSD Expert Pack,在消费级硬件上运行 DeepSeek-V4-Flash 和 Kimi-K3

    SGLang 将 SSD-LLaMA 的核心思路引入 MoE 推理,把放不进 VRAM 和内存的路由专家权重放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O、pinned 暂存和 GPU 缓存,只加载 router 选中的专家。

    推荐理由:原文给出完整机制说明和单卡实测数据,读者可以据此评估 NVMe SSD 承载超大 MoE 模型的可行性。

8月28日周五
  1. @kimmonismus71

    GLM-5.3 已在 Hugging Face 正式上线,作者列出了在本地运行该模型的硬件门槛。FP8 需 10–12× H100 或 8× H200;4-bit/NVFP4 约 390–430GB,可用一台 512GB Mac Studio 或 4× DGX Spark;激进 2-bit 约 230–250GB,一台 256GB Mac Studio 或 2× DGX Spark,但有质量和上下文方面的权衡。首批 GGUF 和 NVFP4 量化已开始出现。

    引用@kimmonismus@kimmonismus

    Quick reminder: in 4 hours you will be able to download and run sota AI. If you have enough compute ofc. What a time to be alive. https://t.co/T6bs1VnVG1

    推荐理由:GLM-5.3 上线后给出了各量化档位的显存与硬件门槛,可供本地部署选型参考。

  2. AGI Hunt · 微信公众号79

    阿里千问开源 Qwen3.8-Flash-Next,6B 激活在 9 项基准中 8 项超过 Opus 4.6 Max

    阿里千问于 8 月 26 日晚开源 Qwen3.8-Flash-Next 权重,生产版 Qwen3.8-Flash 同步上线千问 AI 平台 API,官方称这套 Next 架构是 Qwen4 系列的雏形。

    推荐理由:作者在 Qoder 中实测了这款每 token 仅激活 6B 的 MoE 模型,并拆解其稀疏注意力与外挂 N-gram 表的设计取舍。

8月27日周四
  1. 量子位 · 微信公众号77

    阿里开源 Qwen3.8-Flash-Next 权重,125B MoE 外加 51B N-gram 嵌入,4090 可跑满血版

    阿里开源 Qwen3.8-Flash-Next 全部权重,这是 Qwen4 新架构的早期预览版,采用 125B 参数 MoE 配 6B 激活参数,并附加 51B 的 N-gram Embedding 参数。

    推荐理由:原文给出了新架构的权重配置与 N-gram 嵌入设计细节,可据此了解消费级硬件部署百亿级 MoE 的路径。

  2. Linear Now64

    Linear 用 1000+ 个 PR 将 React 应用从 styled-components 迁移到 StyleX

    Linear 宣布完成从 styled-components 到 StyleX 的迁移,历时逾 1000 个 PR。迁移动机包括 styled-components 进入维护模式、React 18 并发渲染下的性能回归,以及团队希望为 Agent 参与代码库建立更清晰的样式边界。

    推荐理由:Linear 团队亲历者复盘超千个 PR 的迁移过程,给出可迁移的确定性工具加 Agent 加人工判断的方法和降险步骤。

  3. 数字生命卡兹克 · 微信公众号77

    智谱发布 GLM-5.3-Flash,320B MoE 原生多模态模型

    智谱发布 GLM-5.3-Flash,即一周来在 OpenRouter 和 OpenCode 上匿名测试的 OX Alpha。该模型总参数 320B、每次激活 18B,是 GLM-5 系列首个原生多模态模型,支持图像、视频和文本输入,原生上下文 100 万,使用 30 万亿 Token 多模态数据预训练。

    推荐理由:模型定价与国产卡推理规模是这篇实测里最值得看的两点,读者可据此判断日常任务的模型选择。

8月26日周三
  1. 机器之心 · 微信公众号77

    阿里发布 Qwen3.8-Flash,同步开源 Qwen3.8-Flash-Next

    阿里发布 Qwen3.8-Flash,并在 Hugging Face 与 ModelScope 开放同一模型的 Qwen3.8-Flash-Next 权重,主模型 125B 参数、每 token 仅激活 6B,千问 AI 平台定价为每百万 token 输入 1 元、输出 3 元。

    推荐理由:文章拆解了 Qwen3.8-Flash 在注意力、残差与嵌入上的四处架构改动,并把它放进每任务成本的行业对比框架里。

  2. AI前线 · 微信公众号77

    OpenAI 公布自研推理芯片 Jalapeño 实测结果,多项指标超过英伟达 GB300

    OpenAI 公布自研推理芯片 Jalapeño 的实测结果,在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上,峰值每瓦吞吐量达到对比系统的 1.5 至 1.9 倍,端到端延迟优于对手 1.7 至 3.6 倍。

    推荐理由:OpenAI 公布自研推理芯片的实测对标数据,可看到模型公司自研算力对现有 GPU 与软件生态的实际冲击。

  3. 量子位 · 微信公众号80

    OpenAI 公开自研芯片小辣椒,SemiAnalysis 实测其能效与时延优于 Blackwell

    OpenAI 在 Hot Chips 2026 大会上公开自研推理芯片小辣椒,SemiAnalysis 受邀到其实验室用 InferenceX 实测,结论是这颗第一代芯片在多个开源模型上击败了能测到的英伟达、AMD 和谷歌芯片。

    推荐理由:文章给出 SemiAnalysis 现场实测的能效与时延数据,并交代了单 token 预测等对比口径的限制。

  4. IT Home76

    OpenAI 自研芯片 Jalapeño 性能数据公布,DeepSeek R1 每瓦吞吐量为 GB300 的 1.7 倍

    OpenAI 于 8 月 25 日发布博文展示其自研 AI 推理芯片 Jalapeño,并用 SemiAnalysis 的 InferenceX 基准测试了 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三款模型。

    推荐理由:官方基准显示 Jalapeño 的推理能效比 GB300 高约 1.5 至 1.7 倍,可据此观察自研 ASIC 对算力成本结构的影响。

  5. @kimmonismus71

    OpenAI 在关于 Jalapeño 芯片的博客中披露,GPT-Astra 用 Codex 编写并优化底层 kernel,两个月内把三个原本不在计划内的开源权重模型带到该芯片上的高性能。在选定的 attention 和 MoE 模块上,AI 生成的实现比现有人工专家代码快 1.5–1.8 倍,这些数字只适用于选定模块而非完整模型。引用的推文还提到,Jalapeño 在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 上实现 1.5–1.9 倍每瓦 AI 吞吐与 1.7–3.6 倍更低的端到端延迟,OpenAI 计划 2026 年底开始部署。

    引用@kimmonismus@kimmonismus

    Holy: OpenAI says its first custom inference chip is already beating Nvidia GB200 and GB300 systems on speed and efficiency. Across GPT‑OSS 120B, DeepSeek R1 670B, and Kimi K2.5 1T, Jalapeño delivered 1.5–1.9× more AI work per watt at peak throughput and 1.7–3.6× lower end-to-end latency in OpenAI’s own InferenceX testing! For highly interactive workloads, OpenAI reports 2.1–4.1× higher performance. The chip is rated at 700 watts, but remained at or below 550 watts during the tested workloads. OpenAI plans to begin deploying Jalapeño by the end of 2026. Gen 2 is already deep in development, with Gen 3 taking shape. Probably thats why Tibo said that in 1-2 years 750token/s will be the default

    推荐理由:原文给出 GPT-Astra 用 Codex 生成 kernel 的具体加速数据,读者可据此了解 AI 编写底层算子的表现。

8月25日周二
  1. OpenRouter Announcements70

    OpenRouter 发布选型教程:如何用 MCP 服务器在编辑器内选最合适的 AI 模型

    OpenRouter 发布模型选型教程,提出六步框架:定义任务、用实时使用数据和第三方基准筛选候选、对比各提供商价格与延迟、用自己的提示词测试、按每次完成任务的成本而非每 token 成本衡量,再决定或改用 openrouter/auto-beta 按请求路由。

    推荐理由:OpenRouter 官方给出以成本每完成任务为核心的选型框架,并用自家 MCP 服务器让整个评测流程在编辑器内完成。

  2. Hugging Face Blog69

    Gradio 推出 gr.Workflow:把 AI 管线变成可拖拽、可部署的节点图

    Hugging Face 在 Gradio 中内置 gr.Workflow,将 AI 应用管线描述为带类型的节点图,在同一画布上提供可运行节点、可视化中间结果、REST API 和一键部署到 Hugging Face Spaces。

    推荐理由:官方介绍了 gr.Workflow 的节点图机制和多条可复制的示例工作流,读者可以据此评估它能否替代手工拼装 Python 管线。

8月23日周日
  1. @rohanpaul_ai70

    美国 AI 数据中心建设引发的争议升级,地方官员因相关决定收到死亡威胁,Emporia, Kansas 将两场委员会会议改为线上并取消公众评论,Grayslake, Illinois 在社交媒体出现暴力言论后取消了延长公众评论的会议。到 8 月初,全美生效的临时或永久性地方数据中心禁令已超过 500 项,6 月底这一数字为 300 多项。作者引用的一则内容提到,共和党参议院竞选机构在给 AI 公司的私下备忘录中称,数据中心引发的公众愤怒可能影响其保住俄亥俄州一个重要席位。

    引用@rohanpaul_ai@rohanpaul_ai

    Republicans now see AI data centers as an electoral liability. In a private memo to leading AI firms, the Senate Republican campaign arm says public anger over U.S. data centers is threatening the party’s chances of keeping an important Ohio seat. It says Democrats have made data centers a major part of their effort to defeat Sen. Jon Husted (R-OH), and that strategy appears to be working with public. "If voters' perceptions of data centers are not fixed quickly, the campaign against them will expand far beyond Ohio." Republicans fear data-center backlash in Ohio could spread into a nationwide AI infrastructure constraint.

    推荐理由:作者汇总了美国地方层面针对数据中心的具体处置与禁令数量变化,可看到 AI 基建落地正面对社区与政治阻力。