跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

133条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 121–133 条 · 共 133 条
4月27日周一
4月25日周六
  1. LMSYS Blog73

    SGLang 与 Miles 实现 DeepSeek-V4 (1.6T Pro, 284B Flash) Day-0 推理与 RL 训练支持

    SGLang 与 Miles 团队宣布在发布当天为 DeepSeek-V4 (1.6T Pro, 284B Flash) 提供推理与 RL 训练的开源支持,针对其混合稀疏注意力、mHC 和 FP4 专家权重架构做了专项适配。

    推荐理由:原文给出 ShadowRadix、HiSparse 等具体优化机制和基准数字,读者可以了解混合稀疏注意力架构对推理与 RL 训练系统的实际工程要求。

4月23日周四
  1. Claude Blog66

    Claude Managed Agents 内置记忆功能开启公开测试

    Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。

    推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。

4月22日周三
4月20日周一
3月12日周四
  1. Google Research62

    Google 在 Flood Hub 上线 AI 城市山洪预报,可提前 24 小时预测风险

    Google Research 宣布在 Flood Hub 上推出城市山洪预报,借助基于 Gemini 的 Groundsource 方法从新闻报告中提取历史山洪数据,用 LSTM 模型提前 24 小时预测城市山洪风险。

    推荐理由:原文给出 Flash Flood 预报的技术路线和与 NWS 的对比指标,读者可以了解 AI 预警如何弥补全球南方的预警缺口。

3月11日周三
  1. Mistral AI63

    Mistral 基于 Vibe 构建自动编写 Rails RSpec 测试的智能体

    Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。

    推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。

  2. LMSYS Blog61

    SGLang 支持 NVIDIA Nemotron 3 Super,面向高效多智能体系统

    SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。

    推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。

1月16日周五
  1. LMSYS Blog63

    SGLang-Diffusion 两个月迭代:推理速度最高提升 2.5 倍并集成 ComfyUI

    SGLang-Diffusion 团队发布发布两个月进展总结,当前版本(docker 镜像 lmsysorg/sglang:dev-pr-17247)比 2025 年 11 月初始版最快提升 2.5 倍,在 NVIDIA GPU 上比其他方案最高快 5 倍。

    推荐理由:官方复盘两个月迭代成果,涵盖新模型支持、LoRA 与 ComfyUI 集成等具体改进,读者可评估是否迁移现有扩散推理工作流。

12月19日周五
  1. LMSYS Blog61

    SGLang 发布扩散大语言模型框架并 Day-0 支持 LLaDA 2.0

    Ant Group DeepXPU 团队与 SGLang 团队在 SGLang 中实现扩散大语言模型(dLLM)框架,Day-0 支持 LLaDA 2.0。方案复用现有 Chunked-Prefill 机制,无需改动 SGLang 核心架构,支持自定义扩散解码算法、流式输出、张量并行和 CUDA graph 优化。

    推荐理由:原文给出基于 Chunked-Prefill 实现 dLLM 支持的设计细节和实测吞吐数据,读者可据此评估 SGLang 上扩散模型的推理可行性。

12月17日周三
  1. LMSYS Blog62

    LMSYS 发布 Mini-SGLang:5k 行代码的高性能 LLM 推理引擎

    LMSYS 推出源自 SGLang 的轻量级推理框架 Mini-SGLang,代码仅 5k 行 Python,保留 Radix Attention、Chunked Prefill、Overlap Scheduling、Tensor Parallelism 等核心优化,并提供 OpenAI 兼容 API 和开箱即用的 Llama-3、Qwen-3 支持。

    推荐理由:官方介绍这款仅 5k 行代码的推理引擎保留了哪些关键优化,以及如何用它学习和做研究原型。

5月7日周三
8月2日周五