跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

当前仅显示精选新闻
231条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 181–200 条 · 共 231 条
6月6日周六
  1. @googleaidevs71

    Google 发布 Gemma 4 QAT 检查点,可在消费级 GPU 和移动设备上本地运行且质量损失很小。其中 GGUF(Q4_0)检查点覆盖各尺寸与 drafter 模型以追求本地性能,定制移动方案通过混合精度把 Gemma 4 压缩到 1GB 以内,包含针对性 2-bit 解码层、优化 KV cache 和静态激活。

    推荐理由:文章列出 Gemma 4 QAT 的 GGUF 与移动端两种量化方案,可用于判断本地部署的体积与质量取舍。

6月4日周四
  1. @kimmonismus81

    NVIDIA 发布 Nemotron 3 Ultra,一款完全开源的 550B MoE 模型,激活参数 55B,权重、训练数据与完整配方全部公开。该模型采用混合 Mamba-Attention MoE 架构,NVIDIA 称其在长输出智能体任务上的吞吐量约为同类开源模型的 6 倍,同时保持相同准确率。

    引用NVIDIA AI (@NVIDIAAI)@NVIDIAAI

    Today we're shipping Nemotron 3 Ultra. A 550B MoE frontier-intelligence open model built for long-running agents. It delivers 5x faster inference and lowers the cost of complex agentic tasks by up to 30% versus other open frontier models. Video

    推荐理由:原文给出 550B 开源模型的权重、训练数据与完整配方,并说明其在长任务智能体上的吞吐表现,读者可据此判断开源前沿模型的可复现程度。

  2. @MiniMax_AI69

    MiniMax 官方宣布 M3 在 1M token 下解码速度提升 15.6 倍,并感谢 Fireworks AI 为其提供推理支持,用户可直接试用。其引用的 Fireworks AI 内容显示,M3 采用 MiniMax Sparse Attention(MSA),模型权重发布后也将在 Fireworks 社区提供。

    引用Fireworks AI (@FireworksAI_HQ)@FireworksAI_HQ

    MiniMax M3 arrives with MiniMax Sparse Attention (MSA), 15.6x faster decoding at 1M tokens. We're partnering with @MiniMax_AI to power the inference behind this week's launch. Head to minimax.io to take it for a spin. Once the model weights are released, M3 will be available to the Fireworks community.

    推荐理由:官方给出 M3 在 1M token 下解码提速 15.6 倍,读者可据此判断其长上下文推理的工程取向。

  3. LMSYS Blog60

    Higgs Audio v3 TTS 上线 SGLang-Omni,支持实时流式语音与控制标签

    Boson AI 与 SGLang-Omni 团队宣布在 SGLang-Omni 上提供 Higgs Audio v3 TTS 的端到端服务。模型约 4B 参数,基于 Qwen3-4B,支持流式合成和 100 种语言的个位数 WER/CER,零样本克隆在 Seed-TTS 上 WER/CER 为 1.11%。

    推荐理由:原文给出多级推理架构、控制标签目录和基准延迟数据,开发者可据此评估把 TTS 接入语音 Agent 的可行性。

6月3日周三
  1. @SkylerMiao766

    MiniMax M3 带来稀疏注意力、1M 上下文和多模态能力,Together 承担了让它跑得更快的服务端工作。作者提到这是与 Together 团队的一次合作。

    引用Together AI (@togethercompute)@togethercompute

    x.com/i/article/206189124776…

    推荐理由:M3 同时列出稀疏注意力、1M 上下文与多模态三项能力,并点出 Together 承担了让它跑得更快的服务端工作。

  2. @berryxia70

    OpenAI 发布 Codex Python SDK,通过 pip install openai-codex 安装后,开发者可在 Python 代码中启动线程、运行 turn、实时流式输出进度、恢复会话、传图片并精细控制 sandbox 访问权限。

    引用Vaibhav (VB) Srivastav (@reach_vb)@reach_vb

    We just released the Codex Python SDK 🔥 You can now embed Codex directly into your Python apps and workflows! > Start threads > Run turns > Stream progress > Resume sessions > Pass images > Control sandbox access All whilst reusing your existing Codex auth. pip install openai-codex Go build with it!!

    推荐理由:SDK 把 Codex 从浏览器里的 IDE 变成可嵌进脚本的可编程基础设施,并复用现有认证。

6月2日周二
  1. @MiniMax_AI69

    MiniMax M3 已在 Vercel AI Gateway 上线,这是 MiniMax 首个长上下文模型,支持 1M token 上下文和多模态输入。上线首周提供 50% 折扣,模型标识为 minimax/minimax-m3。

    引用Vercel Developers (@vercel_dev)@vercel_dev

    MiniMax M3 is available on AI Gateway. MiniMax's first long-context model, with support for multimodal inputs. 50% off for the next week. 𝚖𝚘𝚍𝚎𝚕: '𝚖𝚒𝚗𝚒𝚖𝚊𝚡/𝚖𝚒𝚗𝚒𝚖𝚊𝚡-𝚖𝟹' vercel.com/changelog/minimax…

    推荐理由:MiniMax M3 通过 Vercel AI Gateway 开放调用,1M token 上下文与多模态输入是其主要能力变化。

  2. @kimmonismus67

    NVIDIA 发布 DGX Station for Windows 桌面级 AI 超算,搭载 GB300 Grace Blackwell Ultra 桌面超级芯片,最高 748GB 一致内存、20 petaflops FP4 算力,可本地运行最高 1 万亿参数模型,Q4 出货。

    引用NVIDIA Newsroom (@nvidianewsroom)@nvidianewsroom

    Introducing NVIDIA DGX Station for Windows, the world's most powerful deskside AI supercomputer with Windows powered by NVIDIA GB300. ✅ Run frontier AI models with up to 1 trillion parameters locally ✅ Build and run secure AI agents on Windows with NVIDIA OpenShell ✅ Built by @ASUS, @Dell, @GIGABYTE, @HP, @msigaming, and @Supermicro #NVIDIAGTC nvda.ws/3RIkjpc

    推荐理由:原文列出 GB300 桌面超级芯片的完整规格与出货时间,可据此判断本地运行前沿模型与智能体的硬件门槛。

6月1日周一
  1. OpenAI News61

    OpenAI 前沿模型与 Codex 上线 AWS

    OpenAI 前沿模型与 Codex 现已在 AWS 正式可用,企业可通过其已在使用的 AWS 环境、管控与采购流程接入 OpenAI 构建应用。客户可以在 AWS 上开始使用 OpenAI,从而更快从评估推进到生产环境。

    推荐理由:OpenAI 前沿模型与 Codex 接入 AWS,企业可在既有云环境与采购流程中调用,评估到上线的路径缩短。

5月29日周五
  1. Hugging Face Blog62

    PyTorch 性能分析(一):torch.profiler 入门指南

    Hugging Face 博客发布 PyTorch profiling 系列第一篇,以矩阵乘法加加法为例讲解 torch.profiler 的用法。文章说明 profiler 会导出统计表格和 Perfetto 时序 trace 两类产物,并演示如何用 warmup 消除冷启动开销、区分 CPU 与 GPU lane 以及读懂嵌套的调度链,最后附上速查表。

    推荐理由:面向初学者的 torch.profiler 阅读指南,用两个矩阵算子串起从 CPU 调度到 CUDA 内核的完整链路,并附上速查表。

  2. Sierra Blog68

    Sierra 工程师复盘如何独自用 AI 编码智能体在 4 个月内完成产品本地化

    Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体独自完成产品本地化,耗时不到 4 个月,而他在 Slack 参与的同类项目需 10 人团队 9 到 12 个月。他经历 IDE 智能体、云端智能体、批量调用 Claude 脚本三轮迭代,并发现技能文档过长会超出上下文窗口反而推高错误率,最终把工作重心从执行迁移转向设计反馈循环。

    推荐理由:作者复盘个人用 AI 编码智能体完成本地化的完整工作流,提炼出批处理脚本、反馈循环与上下文管理等可迁移方法。

5月27日周三
  1. @berryxia67

    OpenRouter 宣布完成1.13亿美元B轮融资,由CapitalG领投,a16z、Menlo Ventures、NVIDIA的NVentures、ServiceNow、MongoDB、Snowflake、Databricks等跟投;过去半年其每周token处理量从5T增至25T。作者介绍,其统一API可切换500多个模型,其中50多个免费,并提供私有聊天与可探索数据。

    引用OpenRouter (@OpenRouter)@OpenRouter

    Today we’re announcing our $113M Series B led by @CapitalGVC. Over the last 6 months, weekly volume on OpenRouter grew from 5T to 25T tokens as AI rapidly shifts from experimentation into production. We’re excited for what comes next.

    推荐理由:OpenRouter 的 B 轮融资与 token 增长数据,为观察多模型基础设施在生产环境中的需求变化提供参照。

  2. inclusionAI Hugging Face models68

    inclusionAI 发布 LLaDA2.0-Uni,统一多模态理解与生成的扩散 MoE 大模型

    inclusionAI 发布基于 MoE 的扩散大语言模型 LLaDA2.0-Uni,在单一模型中统一多模态理解与生成,支持文生图、图像理解、图像编辑以及交错生成与推理。

    推荐理由:模型把多模态理解与生成统一进扩散 LLM 框架,并公开 8 步解码与加速方案,读者可据此判断部署门槛。

  3. Hugging Face Blog66

    TRL 推出 Delta Weight Sync,异步 RL 每步权重传输从 1.2GB 降至 20-35MB

    Hugging Face 在 TRL 中实现 Delta Weight Sync,只把 RL 相邻优化步骤间真正变化的 bf16 权重编码为稀疏 safetensors 文件,上传到 Hugging Face Bucket 后由 vLLM 拉取。

    推荐理由:TRL 通过稀疏增量同步把异步 RL 每步权重传输量压缩约两个数量级,并允许 trainer 与推理集群分离部署。

  4. MiniMax Blog62

    MiniMax Agent 升级为 Mavis 并推出 Agent Team 多智能体协作

    MiniMax 发布 Agent 整体升级并更名 Mavis,推出 Agent Teams,支持桌面端并行运行多角色 Agent 协作完成长任务,并将 TokenPlan 与 Agent Plan 合并为统一订阅,Agent 与 API 共享 Credits。

    推荐理由:官方详解 Agent Team 的角色分工、状态机设计和上下文成本等工程取舍,读者可以据此理解多智能体产品化的关键问题。

  5. @kimmonismus76

    小米 MiMo-V2.5 系列 API 定价永久下调,最高较此前降低 99%,并统一所有上下文长度的定价。MiMo Token 套餐在同价下可用 token 增加 5–8 倍,现有用户的 Token Plan credits 将全部重置,MiMo-V2.5-TTS 限期免费,新价格于 5 月 26 日 6:00 PM PDT 生效。作者 @kimmonismus 指出 MiMo 2.5 Pro 现在与 DeepSeek V4 Pro 价格相同。

    引用Xiaomi MiMo (@XiaomiMiMo)@XiaomiMiMo

    🚀 Better inference efficiency, lower costs, broader access. MiMo-V2.5 Series API pricing is now permanently reduced — by up to 99% compared to previous pricing. ✨ Unified pricing across all context lengths. MiMo Token Plans have also been upgraded: • 5–8× more usable tokens at the same price • Simpler and more transparent billing rules 🎁 As a thank-you to current users, all current Token Plan credits will be fully reset. 🎧 MiMo-V2.5-TTS remains free for a limited time. ⏰ Effective May 26 at 6:00 PM PDT. These improvements are powered by continued inference optimization and serving efficiency upgrades across the MiMo stack. 🛠️ We’ll also publish a detailed technical blog on the inference optimizations later — stay tuned.

    推荐理由:原文列出 API 价格最高降 99% 与 Token 套餐升级,读者可借此观察推理成本下探对模型选型的影响。

5月26日周二
5月20日周三
  1. 微信公众号(账号未识别)85

    Anthropic 发布 Claude Managed Agents,提供云托管 Agent 编排 API

    Anthropic 发布 Claude Managed Agents,一套用于构建和部署云托管 AI Agent 的可组合 API,核心是经调优的 Harness 编排引擎。架构上将 Session、Harness、Sandbox 三层解耦,凭证不进入沙箱,官方称 p50 TTFT 下降约 60%。定价为标准 token 费率加每 Session 活跃运行时间 $0.08/小时,空闲时间不计费。

    推荐理由:文章拆解了 Managed Agents 的 Harness 解耦架构与计费方式,可据此理解 Anthropic 转向 Agent 基础设施的路径。