跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

当前仅显示精选新闻
280条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 261–280 条 · 共 280 条
4月9日周四
  1. LlamaIndex:产品、工程与评测66

    LlamaIndex 发布 LlamaParse 与 LiteParse Agent 技能,为智能体提供文档理解能力

    LlamaIndex 为 LlamaParse 和 LiteParse 推出可安装的 Agent 技能,支持 Claude Code、OpenClaw、OpenCode 等运行时,通过 npx skills add run-llama/llamaparse-agent-skills 安装。

    推荐理由:原文面向 Agent 解析复杂文档的痛点,给出 LlamaParse 与 LiteParse 两套技能的分工思路和可安装入口,便于迁移到自有工作流。

4月8日周三
  1. Factory 研究 / 产品64

    Factory 发布桌面应用,为 Droids 提供原生多智能体界面

    Factory 发布桌面应用,作为运行 Droids 的原生界面,今日登陆 macOS 和 Windows,包含在现有订阅中。支持多智能体会话、持久化 Droid Computers(含 Cloud Computers 和 BYO Machine)、通过 Ollama 或 vLLM 运行本地模型、电脑操作、VS Code 集成、MCP/技能/钩子插件生态及移动端。

    推荐理由:原文给出多智能体会话、持久化 Droid Computer、本地模型与电脑操作等能力细节,读者可据此评估它对现有工作流的影响。

3月26日周四
  1. Cohere 产品与研究博客64

    Cohere 发布开源语音识别模型 Transcribe,登顶 HuggingFace Open ASR Leaderboard

    Cohere 发布开源 ASR 模型 Cohere Transcribe,在 HuggingFace Open ASR Leaderboard 以平均 WER 5.42% 排名第一,超过 Whisper Large v3、ElevenLabs Scribe v2 和 Qwen3-ASR-1.7B。

    推荐理由:原文给出 Open ASR Leaderboard 排名、WER 数据和部署方式,读者可以据此评估其相对 Whisper 等方案的实用价值。

3月24日周二
  1. PromptArmor:Threat Intelligence69

    PromptArmor 披露 Snowflake Cortex Code 沙箱逃逸漏洞,恶意命令可绕过人工审批执行

    PromptArmor 披露 Snowflake Cortex Code CLI 的命令验证漏洞,攻击者可借助 README 中的间接提示词注入,通过 process substitution 表达式绕过人工审批并设置 dangerously_disable_sandbox 逃逸沙箱,下载执行恶意脚本,利用缓存 token 对 Snowflake 进行数据窃取、删表等操作。

    推荐理由:原文完整复现了从提示词注入到沙箱绕过和凭证窃取的攻击链,并给出修复版本和官方通告入口,便于读者核对自身配置。

3月16日周一
  1. Manus Blog69

    Manus 发布桌面应用 "我的电脑",可操作本地文件与应用

    Manus 发布 Manus 2.0 桌面应用的核心功能 "我的电脑",将此前完全运行在云端的 Manus 带到本地电脑,通过在终端执行命令行指令读写本地文件并控制本地应用。

    推荐理由:官方介绍了桌面端让 Manus 通过本地终端操作文件与应用的机制,并保留逐条命令审批的控制设计,可了解其工作流变化。

3月12日周四
  1. Google Research62

    Google 在 Flood Hub 上线 AI 城市山洪预报,可提前 24 小时预测风险

    Google Research 宣布在 Flood Hub 上推出城市山洪预报,借助基于 Gemini 的 Groundsource 方法从新闻报告中提取历史山洪数据,用 LSTM 模型提前 24 小时预测城市山洪风险。

    推荐理由:原文给出 Flash Flood 预报的技术路线和与 NWS 的对比指标,读者可以了解 AI 预警如何弥补全球南方的预警缺口。

3月11日周三
  1. Mistral AI63

    Mistral 基于 Vibe 构建自动编写 Rails RSpec 测试的智能体

    Mistral 构建了一个自主智能体,读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行,基于开源编码助手 Vibe 搭建,通过 AGENTS.md、分类 skills 文件和 RuboCop、SimpleCov 自定义工具实现。

    推荐理由:原文完整给出了用 Vibe 搭建 Rails 测试智能体的方法,AGENTS.md、skills 和自纠工具的做法可迁移复用。

  2. LMSYS Blog61

    SGLang 支持 NVIDIA Nemotron 3 Super,面向高效多智能体系统

    SGLang 宣布 Day 0 支持 NVIDIA Nemotron 3 Super。该模型为 120B 参数混合 MoE,每次前向仅激活 12B 参数,采用混合 Transformer-Mamba 架构,支持 1M token 上下文、多 token 预测和思考预算,相比上一代 Nemotron Super 1.5 吞吐提升至 5 倍。

    推荐理由:原文给出模型架构、吞吐与准确率对比和 SGLang 部署命令,读者可以据此评估在多智能体工作流中的实际可用性。

1月21日周三
  1. Replit Blog63

    Replit 介绍 Replit Agent 的决策时引导方法,提升长轨迹可靠性

    Replit 发布博文,介绍其为 Replit Agent 设计的决策时引导(decision-time guidance)机制,用轻量多标签分类器在关键决策点注入简短情境化指令,替代静态系统提示词,将可控引导从 4–5 条静态提醒扩展到数百条。

    推荐理由:Replit 自述其 Agent 的决策时引导机制,包含注入位置对比实验和缓存成本数据,方法对同类 Agent 工程有可迁移性。

1月16日周五
  1. LMSYS Blog63

    SGLang-Diffusion 两个月迭代:推理速度最高提升 2.5 倍并集成 ComfyUI

    SGLang-Diffusion 团队发布发布两个月进展总结,当前版本(docker 镜像 lmsysorg/sglang:dev-pr-17247)比 2025 年 11 月初始版最快提升 2.5 倍,在 NVIDIA GPU 上比其他方案最高快 5 倍。

    推荐理由:官方复盘两个月迭代成果,涵盖新模型支持、LoRA 与 ComfyUI 集成等具体改进,读者可评估是否迁移现有扩散推理工作流。

12月19日周五
  1. LMSYS Blog61

    SGLang 发布扩散大语言模型框架并 Day-0 支持 LLaDA 2.0

    Ant Group DeepXPU 团队与 SGLang 团队在 SGLang 中实现扩散大语言模型(dLLM)框架,Day-0 支持 LLaDA 2.0。方案复用现有 Chunked-Prefill 机制,无需改动 SGLang 核心架构,支持自定义扩散解码算法、流式输出、张量并行和 CUDA graph 优化。

    推荐理由:原文给出基于 Chunked-Prefill 实现 dLLM 支持的设计细节和实测吞吐数据,读者可据此评估 SGLang 上扩散模型的推理可行性。

12月17日周三
  1. LMSYS Blog62

    LMSYS 发布 Mini-SGLang:5k 行代码的高性能 LLM 推理引擎

    LMSYS 推出源自 SGLang 的轻量级推理框架 Mini-SGLang,代码仅 5k 行 Python,保留 Radix Attention、Chunked Prefill、Overlap Scheduling、Tensor Parallelism 等核心优化,并提供 OpenAI 兼容 API 和开箱即用的 Llama-3、Qwen-3 支持。

    推荐理由:官方介绍这款仅 5k 行代码的推理引擎保留了哪些关键优化,以及如何用它学习和做研究原型。

11月20日周四
  1. PromptArmor:Threat Intelligence79

    PromptArmor 演示 Google Antigravity 经间接提示词注入外泄用户凭证与代码

    PromptArmor 发布对 Google Antigravity 的安全分析,演示通过藏在网页指南中的间接提示词注入操纵 Gemini 调用浏览器子代理,将用户 IDE 中的凭证和代码外泄到攻击者控制的 webhook.site 地址。

    推荐理由:原文完整拆解了从间接提示词注入到浏览器子代理外泄凭证的攻击链,并指出默认白名单和设置可被绕过,具备可验证的技术细节。

10月27日周一
  1. MiniMax Blog74

    MiniMax 开源并发布面向 Agent 与编码的 MiniMax M2

    MiniMax 开源并发布面向 Agent 和编码场景的模型 MiniMax M2,API 定价为每百万输入 tokens $0.30/¥2.1、输出 $1.20/¥8.4,为 Claude 4.5 Sonnet 的 8%,推理速度接近其两倍,TPS 约 100。

    推荐理由:官方给出了 M2 的定价、推理速度、基准成绩与部署方式,读者可据此评估其在 Agent 工作流中的成本与性能权衡。

9月29日周一
  1. Thinking Machines Lab Blog66

    Thinking Machines Lab 发表 LoRA Without Regret:LoRA 在多数后训练场景可追平全量微调

    Thinking Machines Lab 发布 John Schulman 署名的研究,发现在满足两个条件时 LoRA 的样本效率与最终性能与全量微调相当:一是应用于全部权重层尤其是 MLP/MoE 层,二是不受容量限制即数据集规模不超过 LoRA 参数容量。

    推荐理由:原文系统实验给出 LoRA 追平全量微调的两个条件和最优学习率为其 10 倍等可操作结论,可直接指导微调选型。

9月10日周三
  1. Thinking Machines Lab Blog77

    Thinking Machines Lab 解析 LLM 推理不确定性根源并发布批不变内核

    Thinking Machines Lab 发文指出,LLM 推理不确定性的主因不是并发与浮点加法,而是服务器负载变化导致批大小改变,使缺乏批不变性的内核产生不同数值结果。

    推荐理由:原文指出 LLM 推理不确定性的真正来源是批大小变化破坏了批不变性,并给出可实现确定性推理的内核方案与代码。

9月5日周五
  1. Factory 研究 / 产品68

    Factory 讲解如何用 Linter 约束 Agent 代码生成

    Factory 发布实践文章,主张把架构、边界和规范编码为 lint 规则,让 LLM Agent 在代码生成循环中获得自动反馈并自我修正,将“lint green”作为完成标准。文章给出可检索性、代码组织、架构边界、安全、测试、可观测性等规则类别,介绍 lint 驱动的大规模迁移方法,并说明 AGENTS.md 负责“为什么”,linting 提供机器可执行的保证。

    推荐理由:文章给出把架构规范编码为 lint 规则的完整类别清单和落地流程,可直接迁移到自己团队的 Agent 开发工作流。

5月28日周三
5月7日周三
8月2日周五