推荐理由:文章列出 Gemma 4 QAT 的 GGUF 与移动端两种量化方案,可用于判断本地部署的体积与质量取舍。
部署工程
全部主题把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
当前仅显示精选新闻最新精选
第 181–200 条 · 共 231 条@googleaidevs@googleaidevs精选AI 评分7171
@kimmonismus@kimmonismus精选AI 评分8181 

引用NVIDIA AI (@NVIDIAAI)@NVIDIAAIToday we're shipping Nemotron 3 Ultra. A 550B MoE frontier-intelligence open model built for long-running agents. It delivers 5x faster inference and lowers the cost of complex agentic tasks by up to 30% versus other open frontier models. Video
推荐理由:原文给出 550B 开源模型的权重、训练数据与完整配方,并说明其在长任务智能体上的吞吐表现,读者可据此判断开源前沿模型的可复现程度。
@MiniMax_AI@minimax_ai精选AI 评分6969 引用Fireworks AI (@FireworksAI_HQ)@FireworksAI_HQMiniMax M3 arrives with MiniMax Sparse Attention (MSA), 15.6x faster decoding at 1M tokens. We're partnering with @MiniMax_AI to power the inference behind this week's launch. Head to minimax.io to take it for a spin. Once the model weights are released, M3 will be available to the Fireworks community.
推荐理由:官方给出 M3 在 1M token 下解码提速 15.6 倍,读者可据此判断其长上下文推理的工程取向。
@googleaidevs@googleaidevs精选AI 评分7878 推荐理由:内容列出了 Gemma 4 的下载渠道与兼容工具链,便于判断本地部署和微调的可选路径。
LMSYS Blog精选AI 评分6060 Higgs Audio v3 TTS 上线 SGLang-Omni,支持实时流式语音与控制标签
Boson AI 与 SGLang-Omni 团队宣布在 SGLang-Omni 上提供 Higgs Audio v3 TTS 的端到端服务。模型约 4B 参数,基于 Qwen3-4B,支持流式合成和 100 种语言的个位数 WER/CER,零样本克隆在 Seed-TTS 上 WER/CER 为 1.11%。
推荐理由:原文给出多级推理架构、控制标签目录和基准延迟数据,开发者可据此评估把 TTS 接入语音 Agent 的可行性。
@SkylerMiao7@skylermiao7精选AI 评分6666 MiniMax M3 带来稀疏注意力、1M 上下文和多模态能力,Together 承担了让它跑得更快的服务端工作。作者提到这是与 Together 团队的一次合作。
引用Together AI (@togethercompute)@togethercomputex.com/i/article/206189124776…
推荐理由:M3 同时列出稀疏注意力、1M 上下文与多模态三项能力,并点出 Together 承担了让它跑得更快的服务端工作。
@berryxia@berryxia精选AI 评分7070 引用Vaibhav (VB) Srivastav (@reach_vb)@reach_vbWe just released the Codex Python SDK 🔥 You can now embed Codex directly into your Python apps and workflows! > Start threads > Run turns > Stream progress > Resume sessions > Pass images > Control sandbox access All whilst reusing your existing Codex auth. pip install openai-codex Go build with it!!
推荐理由:SDK 把 Codex 从浏览器里的 IDE 变成可嵌进脚本的可编程基础设施,并复用现有认证。
@MiniMax_AI@minimax_ai精选AI 评分6969 引用Vercel Developers (@vercel_dev)@vercel_devMiniMax M3 is available on AI Gateway. MiniMax's first long-context model, with support for multimodal inputs. 50% off for the next week. 𝚖𝚘𝚍𝚎𝚕: '𝚖𝚒𝚗𝚒𝚖𝚊𝚡/𝚖𝚒𝚗𝚒𝚖𝚊𝚡-𝚖𝟹' vercel.com/changelog/minimax…
推荐理由:MiniMax M3 通过 Vercel AI Gateway 开放调用,1M token 上下文与多模态输入是其主要能力变化。
@kimmonismus@kimmonismus精选AI 评分6767 

引用NVIDIA Newsroom (@nvidianewsroom)@nvidianewsroomIntroducing NVIDIA DGX Station for Windows, the world's most powerful deskside AI supercomputer with Windows powered by NVIDIA GB300. ✅ Run frontier AI models with up to 1 trillion parameters locally ✅ Build and run secure AI agents on Windows with NVIDIA OpenShell ✅ Built by @ASUS, @Dell, @GIGABYTE, @HP, @msigaming, and @Supermicro #NVIDIAGTC nvda.ws/3RIkjpc
推荐理由:原文列出 GB300 桌面超级芯片的完整规格与出货时间,可据此判断本地运行前沿模型与智能体的硬件门槛。
OpenAI News精选AI 评分6161 OpenAI 前沿模型与 Codex 上线 AWS
OpenAI 前沿模型与 Codex 现已在 AWS 正式可用,企业可通过其已在使用的 AWS 环境、管控与采购流程接入 OpenAI 构建应用。客户可以在 AWS 上开始使用 OpenAI,从而更快从评估推进到生产环境。
推荐理由:OpenAI 前沿模型与 Codex 接入 AWS,企业可在既有云环境与采购流程中调用,评估到上线的路径缩短。
Hugging Face Blog精选AI 评分6262 PyTorch 性能分析(一):torch.profiler 入门指南
Hugging Face 博客发布 PyTorch profiling 系列第一篇,以矩阵乘法加加法为例讲解 torch.profiler 的用法。文章说明 profiler 会导出统计表格和 Perfetto 时序 trace 两类产物,并演示如何用 warmup 消除冷启动开销、区分 CPU 与 GPU lane 以及读懂嵌套的调度链,最后附上速查表。
推荐理由:面向初学者的 torch.profiler 阅读指南,用两个矩阵算子串起从 CPU 调度到 CUDA 内核的完整链路,并附上速查表。
Sierra Blog精选AI 评分6868 Sierra 工程师复盘如何独自用 AI 编码智能体在 4 个月内完成产品本地化
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体独自完成产品本地化,耗时不到 4 个月,而他在 Slack 参与的同类项目需 10 人团队 9 到 12 个月。他经历 IDE 智能体、云端智能体、批量调用 Claude 脚本三轮迭代,并发现技能文档过长会超出上下文窗口反而推高错误率,最终把工作重心从执行迁移转向设计反馈循环。
推荐理由:作者复盘个人用 AI 编码智能体完成本地化的完整工作流,提炼出批处理脚本、反馈循环与上下文管理等可迁移方法。
@berryxia@berryxia精选AI 评分6767
引用OpenRouter (@OpenRouter)@OpenRouterToday we’re announcing our $113M Series B led by @CapitalGVC. Over the last 6 months, weekly volume on OpenRouter grew from 5T to 25T tokens as AI rapidly shifts from experimentation into production. We’re excited for what comes next.
推荐理由:OpenRouter 的 B 轮融资与 token 增长数据,为观察多模型基础设施在生产环境中的需求变化提供参照。
@kimmonismus@kimmonismus精选AI 评分7777 DeepSeek 将 V4-Pro 降价 75% 的举措永久化,小米 MiMo 则把 V2.5 价格最高下调 99%,即日生效。



推荐理由:文章把两家公司的降价归因到注意力架构的改动,读者可据此理解长上下文推理成本为何能结构性下降。
inclusionAI Hugging Face models精选AI 评分6868 inclusionAI 发布 LLaDA2.0-Uni,统一多模态理解与生成的扩散 MoE 大模型
inclusionAI 发布基于 MoE 的扩散大语言模型 LLaDA2.0-Uni,在单一模型中统一多模态理解与生成,支持文生图、图像理解、图像编辑以及交错生成与推理。
推荐理由:模型把多模态理解与生成统一进扩散 LLM 框架,并公开 8 步解码与加速方案,读者可据此判断部署门槛。
Hugging Face Blog精选AI 评分6666 TRL 推出 Delta Weight Sync,异步 RL 每步权重传输从 1.2GB 降至 20-35MB
Hugging Face 在 TRL 中实现 Delta Weight Sync,只把 RL 相邻优化步骤间真正变化的 bf16 权重编码为稀疏 safetensors 文件,上传到 Hugging Face Bucket 后由 vLLM 拉取。
推荐理由:TRL 通过稀疏增量同步把异步 RL 每步权重传输量压缩约两个数量级,并允许 trainer 与推理集群分离部署。
MiniMax Blog精选AI 评分6262 MiniMax Agent 升级为 Mavis 并推出 Agent Team 多智能体协作
MiniMax 发布 Agent 整体升级并更名 Mavis,推出 Agent Teams,支持桌面端并行运行多角色 Agent 协作完成长任务,并将 TokenPlan 与 Agent Plan 合并为统一订阅,Agent 与 API 共享 Credits。
推荐理由:官方详解 Agent Team 的角色分工、状态机设计和上下文成本等工程取舍,读者可以据此理解多智能体产品化的关键问题。
@kimmonismus@kimmonismus精选AI 评分7676
引用Xiaomi MiMo (@XiaomiMiMo)@XiaomiMiMo🚀 Better inference efficiency, lower costs, broader access. MiMo-V2.5 Series API pricing is now permanently reduced — by up to 99% compared to previous pricing. ✨ Unified pricing across all context lengths. MiMo Token Plans have also been upgraded: • 5–8× more usable tokens at the same price • Simpler and more transparent billing rules 🎁 As a thank-you to current users, all current Token Plan credits will be fully reset. 🎧 MiMo-V2.5-TTS remains free for a limited time. ⏰ Effective May 26 at 6:00 PM PDT. These improvements are powered by continued inference optimization and serving efficiency upgrades across the MiMo stack. 🛠️ We’ll also publish a detailed technical blog on the inference optimizations later — stay tuned.
推荐理由:原文列出 API 价格最高降 99% 与 Token 套餐升级,读者可借此观察推理成本下探对模型选型的影响。
Claude Blog精选AI 评分6161 Claude Managed Agents 新增自托管沙箱与 MCP 隧道
Claude Managed Agents 现在可在用户自行掌控的沙箱中运行,并连接私有 MCP 服务器。
推荐理由:官方说明了两项新能力的执行边界与网络接入方式,读者可据此判断企业私有环境下运行智能体的可行路径。
微信公众号(账号未识别)精选AI 评分8585 Anthropic 发布 Claude Managed Agents,提供云托管 Agent 编排 API
Anthropic 发布 Claude Managed Agents,一套用于构建和部署云托管 AI Agent 的可组合 API,核心是经调优的 Harness 编排引擎。架构上将 Session、Harness、Sandbox 三层解耦,凭证不进入沙箱,官方称 p50 TTFT 下降约 60%。定价为标准 token 费率加每 Session 活跃运行时间 $0.08/小时,空闲时间不计费。
推荐理由:文章拆解了 Managed Agents 的 Harness 解耦架构与计费方式,可据此理解 Anthropic 转向 Agent 基础设施的路径。