跳到正文

#部署/工程

今日 19 条
3月31日周二
  1. Mistral AI57

    Mistral AI 发布 Spaces CLI,面向人类与 Agent 双重用户

    Mistral AI 发布面向人类开发者和编码 Agent 的 CLI 工具 Spaces。核心设计包括每个交互式输入都提供等价 flag 和 -y 无头模式、生成 context. 与 AGENTS.md 供 Agent 读取项目上下文、插件化的模块注册表,并将状态显式化以避免 CWD 等隐式假设;文中 Agent 从单个提示词到完成部署耗时不到 10 分钟。

3月18日周三
  1. Mistral AI47

    Mistral AI 推出 Forge:面向企业构建前沿级定制模型

    Mistral AI 推出 Forge,一套让企业基于自有专有知识训练前沿级 AI 模型的系统,支持预训练、后训练与强化学习全流程。Forge 同时支持 dense 与 MoE 架构,并可处理多模态输入,模型可在企业自有基础设施内训练与治理。该平台以智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数并生成合成数据。

3月17日周二
3月12日周四
  1. Google Research62

    Google 在 Flood Hub 上线 AI 城市山洪预报,可提前 24 小时预测风险

    Google Research 宣布在 Flood Hub 上推出城市山洪预报,借助基于 Gemini 的 Groundsource 方法从新闻报告中提取历史山洪数据,用 LSTM 模型提前 24 小时预测城市山洪风险。

    推荐理由:原文给出 Flash Flood 预报的技术路线和与 NWS 的对比指标,读者可以了解 AI 预警如何弥补全球南方的预警缺口。

3月11日周三
  1. Mistral AI63

    Mistral 基于 Vibe 构建自动编写 Rails RSpec 测试的智能体

    Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。

    推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。

  2. LMSYS Blog61

    SGLang 支持 NVIDIA Nemotron 3 Super,面向高效多智能体系统

    SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。

    推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。

2月20日周五
2月19日周四
2月16日周一
  1. LMSYS Blog47

    SGLang-Diffusion 如何为生产级视频生成做深度优化

    SGLang-Diffusion 公布面向生产级视频生成的进阶优化,覆盖并行策略、VAE、服务稳定性与 I/O。序列并行从帧级改为 token 级分片,在 8×H100 上把填充开销从 3 帧(14.3%)降到 0,all-to-all 通信量降至 0.875×。同时为 Wan-VAE 实现按高度分片的并行编解码,并修复 Cache-DiT 在多请求服务下的缓存污染与崩溃问题。

2月14日周六
2月11日周三
1月26日周一
1月22日周四
1月21日周三
1月16日周五
  1. LMSYS Blog63

    SGLang-Diffusion 两个月迭代:推理速度最高提升 2.5 倍并集成 ComfyUI

    SGLang-Diffusion 团队发布发布两个月进展总结,当前版本(docker 镜像 lmsysorg/sglang:dev-pr-17247)比 2025 年 11 月初始版最快提升 2.5 倍,在 NVIDIA GPU 上比其他方案最高快 5 倍。

    推荐理由:官方复盘两个月迭代成果,涵盖新模型支持、LoRA 与 ComfyUI 集成等具体改进,读者可评估是否迁移现有扩散推理工作流。

1月15日周四
  1. LMSYS Blog48

    SGLang 流水线并行如何扩展至百万级 Token 上下文

    SGLang 推出高度优化的流水线并行(PP)实现,融合分块流水线并行、异步 P2P 通信与动态分块机制,专为超长上下文推理设计。在 H20 集群上以 PP4 TP8 部署 DeepSeek-V3.1、分块预填充设为 12K 时,预填充吞吐达 TP8 的 3.31 倍,比 TP32 方案高出 30.5%,同时 TTFT 最多降低 67.9%,强扩展效率保持 82.8%。

1月12日周一
12月23日周二
12月19日周五
  1. LMSYS Blog61

    SGLang 发布扩散大语言模型框架并 Day-0 支持 LLaDA 2.0

    Ant Group DeepXPU 团队与 SGLang 团队在 SGLang 中实现扩散大语言模型(dLLM)框架,Day-0 支持 LLaDA 2.0。方案复用现有 Chunked-Prefill 机制,无需改动 SGLang 核心架构,支持自定义扩散解码算法、流式输出、张量并行和 CUDA graph 优化。

    推荐理由:原文给出基于 Chunked-Prefill 实现 dLLM 支持的设计细节和实测吞吐数据,读者可据此评估 SGLang 上扩散模型的推理可行性。

12月17日周三
  1. LMSYS Blog62

    LMSYS 发布 Mini-SGLang:5k 行代码的高性能 LLM 推理引擎

    LMSYS 推出源自 SGLang 的轻量级推理框架 Mini-SGLang,代码仅 5k 行 Python,保留 Radix Attention、Chunked Prefill、Overlap Scheduling、Tensor Parallelism 等核心优化,并提供 OpenAI 兼容 API 和开箱即用的 Llama-3、Qwen-3 支持。

    推荐理由:官方介绍这款仅 5k 行代码的推理引擎保留了哪些关键优化,以及如何用它学习和做研究原型。

10月24日周五
8月1日周五
7月30日周三
6月11日周三
6月4日周三
5月7日周三
8月2日周五
11月29日周三
  1. Linear Now47

    Linear 如何用 AI 检测相似 issue

    Linear 将 Similar Issues 匹配功能推向全部工作空间,用 LLM 生成向量嵌入并在 issue 创建、Triage 和支持集成中提示重复或相关 issue。该功能基于 PostgreSQL 的 pgvector 存储与检索向量,按 workspace ID 分成数百个分区并分别建索引,以支撑数千万条 issue 的余弦相似度查询。