跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

当前仅显示精选新闻
231条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 201–220 条 · 共 231 条
5月20日周三
  1. @berryxia65

    NVIDIA 研究员 Yukang Chen 开源了 LongLive 2.0,一套端到端长视频生成基础设施,训练与推理都以 FP4 量化和并行加速为核心。该方案在 5B 模型上达到 45.7 FPS,并支持真实视频训练、few-step 蒸馏、多 shot 训练与推理、序列并行、NVFP4 KV cache 和异步 VAE 解码部署。

    引用Yukang Chen (@yukangchen_)@yukangchen_

    🚀 Excited to release LongLive 2.0! 🎬 An end-to-end infrastructure for long video generation, with FP4 and parallelism at the core of both training and inference. ⚡45.7 FPS generation speed on 5B model⚡ ✨ LongLive 2.0 supports real-video training, few-step distillation, multi-shot training/inference, sequence-parallel acceleration, NVFP4 KV cache, and async VAE decoding deployment. 🧩 To our knowledge, this is the first open-source 4-bit long video generation infra that covers both training and inference. 🙌 Welcome to check it out, try it, and share feedback! 🔗 Code: github.com/NVlabs/LongLive 📰 Paper: huggingface.co/papers/2605.1… 🎥 Demo: nvlabs.github.io/LongLive/Lo… #LongVideoGeneration #VideoGeneration #Realtime #AIInfra #EfficientAI #FP4 #Parallel #NVIDIA Video

    推荐理由:开源方案把 FP4 量化与并行加速同时用在训练和推理,读者可据此了解长视频实时生成的技术路线。

5月19日周二
5月15日周五
  1. Hugging Face Blog63

    IBM 发布 Granite Embedding Multilingual R2 多语言嵌入模型,支持 32K 上下文

    IBM 发布两个 Apache 2.0 多语言嵌入模型 granite-embedding-97m-multilingual-r2 和 granite-embedding-311m-multilingual-r2,基于 ModernBERT,覆盖 200+ 语言、32K token 上下文,并支持 9 种编程语言的代码检索。

    推荐理由:两个模型以 Apache 2.0 覆盖 200+ 语言和 32K 上下文,读者可对照基准表判断小模型在多语言检索上的实际取舍。

5月14日周四
  1. @berryxia72

    Unsloth 创始人 Daniel Han 发布 Qwen3.6 实验版 MTP GGUF,27B 模型单 GPU 生成速度达 140 tokens/s,35B-A3B 版本达 220 tokens/s。

    引用Daniel Han (@danielhanchen)@danielhanchen

    We released experimental MTP Qwen3.6 Unsloth GGUFs! Qwen3.6 27B MTP now runs at 140 tokens/s. Qwen3.6 35B-A3B MTP gets 220 tokens/s generation on a single GPU. Qwen3.6 27B and 35B-A3B have >1.4x speed-up over the original GGUFs without any change in accuracy. Guide + GGUFs + Benchmarks: unsloth.ai/docs/models/qwen3… In terms of average speedup, we see a 1.4x for dense models at draft tokens = 2 and for the MoE around 1.15 to 1.2x. We do not recommend more than 2 draft tokens because the acceptance rate drops precipitously from 83% to 50% with 4 draft tokens, and the forward passes for MTP become less beneficial. Use `--spec-type mtp --spec-draft-n-max 2` Thanks to Aman for github.com/ggml-org/llama.cp…!

    推荐理由:原文给出单 GPU 实测速度、加速比与 draft tokens 甜点,可据此判断本地 30B 级模型的部署空间。

  2. Claude Blog64

    Claude Code 在大型代码库中如何运作:最佳实践与上手路径

    Anthropic 发文说明 Claude Code 在大型代码库中的运作方式与落地实践,指出围绕模型的扩展层对实际表现的影响不亚于模型本身。文章列出五类扩展点,即 CLAUDE.md 文件、hooks、skills、plugins、MCP servers,并补充 LSP 集成和 subagents 两项能力,强调按分层顺序搭建。

    推荐理由:文章拆解 Claude Code 在大代码库中的扩展层与配置模式,可作为团队规模化落地的参考路径。

5月13日周三
  1. @AYi_AInotes66

    阿易 AI Notes 汇总了近期 AI 科技圈的十余起安全事件,包括 Linux 系统被 CopyFail 破解、Linux 内核脏碎片漏洞、Windows Bitlocker 被 YellowKey 破解,以及超过 300 个 JS 和 Python 软件包因 GitHub Action 缓存投毒被入侵。

    引用AYi (@AYi_AInotes)@AYi_AInotes

    Damn!所有AI开发者,立刻停下你手里的npm install🤯 现在正在爆发有史以来最恐怖的供应链攻击, 代号Mini Shai-Hulud, 已经波及TanStack全家桶、Mistral AI、UiPath等170多个npm和PyPI包, 全是你们天天装的工具链, 周下载量加起来超过一个亿, 已经不是传统的维护者账号被盗了, 而是整个GitHub Actions CI管道被直接劫持, 合法的官方项目,自己发布了带毒的版本, 还带完整的SLSA 3级可信证明, 所有传统的签名验证全失效, 最狠的是它的持久化机制, 它不会只藏在node_modules里, 它会直接修改你的~/.claude/settings.json和~/.vscode/tasks.json, 就算你npm uninstall删光所有包, 只要你下次打开Claude或者VS Code, 它就会自动重新执行, 如果你敢撤销被盗的token, 它会直接删光你整个home目录, 而且它是蠕虫, 偷到一个项目的CI密钥,就会自动感染下一个, 现在还在指数级扩散, 以前我们说别用latest,别用^, 现在就算你pin死了版本, 只要那个版本是6分钟窗口期内发布的, 就是带毒的, 越依赖AI Agent自动装包的人, 这次中招的概率越高, 因为你的Agent根本不会帮你检查lockfile, 现在立刻做这三件事, 第一,冻结所有包安装, 第二,跑npx supply-chain-attack全盘自查, 第三,全量旋转你所有的云密钥、GitHub token和SSH key, 一个都别漏。 #网络安全 #npm #AI开发者

    推荐理由:这条汇总列出近期十余起安全漏洞与供应链投毒事件,可用于快速了解 AI 开发者工具链当前面临的风险面。

  2. Claude Blog72

    Claude 计算机与浏览器使用的最佳实践

    Anthropic 发布 Claude 计算机与浏览器使用的最佳实践,并同步开源一份封装这些做法的演示实现。文中指出 Claude 4.6 家族的 API 图像上限为长边 1568 像素、总像素 1.15MP,Opus 4.7 为 2576 像素与 3.75MP,建议截图先降采样到 1280x720(Opus 4.7 可用 1080p),并把文本指令放在图片之前。

    推荐理由:文中给出的截图缩放、坐标换算与上下文管理做法,可直接用于排查并改善计算机操作的点击精度与成本。

5月12日周二
  1. @gdb73

    OpenAI 宣布成立 OpenAI Deployment Company,帮助企业构建和部署 AI,把前沿 AI 落地到生产环境并产生业务价值,该公司由 OpenAI 多数持股和控制。公司起步配置 150 名 Forward Deployed Engineers 和 Deployment Specialists,并由 19 家投资机构、咨询公司和系统集成商提供 $4 billion 初始投资。

    引用OpenAI (@OpenAI)@OpenAI

    Today we’re launching the OpenAI Deployment Company to help businesses build and deploy AI. It's majority-owned and controlled by OpenAI. It brings together 19 leading investment firms, consultancies, and system integrators to help organizations deploy frontier AI to production for business impact. openai.com/index/openai-laun…

    推荐理由:OpenAI 以 $4 billion 和 19 家合作方组建 AI 部署公司,读者可了解前沿模型落地企业的资本与组织方式。

5月11日周一
  1. @OpenRouter65

    OpenRouter 推出实验性免费编码路由 Pareto Code,在请求中设置 min_coding_score 后,可路由到满足该门槛的最便宜编程模型,模型排名来自 ArtificialAnlys。按其展示的实时 Pareto 前沿,DeepSeek V4 Pro 居首,其后为 GPT 5.4 Mini 和 Gemini 3.1 Pro。

    引用OpenRouter (@OpenRouter)@OpenRouter

    Introducing Pareto Code: a new, free, experimental coding router Set `min_coding_score` in your request and route to the cheapest code-capable model that clears your bar, ranked by @ArtificialAnlys. See the Pareto frontier shifting in real time👇

    推荐理由:原文给出按编程分数门槛路由到最便宜模型的做法,读者可据此了解低成本编码模型的选型方式。

  2. @frxiaobei68

    OpenAI 成立 Deployment Company,由 OpenAI 持多数股权并控股,联合 19 家投资机构、咨询公司和系统集成商,帮助企业将前沿 AI 部署到生产环境。作者认为这一结构让 PE 被投企业成为天然客户池,并对比 Anthropic 此前与高盛、Blackstone 成立的类似合资公司,规模为 15 亿对 100 亿,判断单纯靠 API 卖模型已接近天花板。

    引用OpenAI (@OpenAI)@OpenAI

    Today we’re launching the OpenAI Deployment Company to help businesses build and deploy AI. It's majority-owned and controlled by OpenAI. It brings together 19 leading investment firms, consultancies, and system integrators to help organizations deploy frontier AI to production for business impact. openai.com/index/openai-laun…

    推荐理由:作者对比 OpenAI 与 Anthropic 的合资落地路径,并判断单纯靠 API 卖模型已接近天花板。

  3. Claude Platform release notes66

    Claude Platform 上线 AWS,支持 AWS 计费与 IAM 认证

    Anthropic 推出 Claude Platform on AWS,Claude API 现可通过 AWS 原生端点访问,使用 AWS 计费和 IAM 认证。可用能力包括完整 Messages API、Files API、Message Batches API、Claude Managed Agents、Agent Skills、代码执行和工具使用。

    推荐理由:官方宣布 Claude API 可经 AWS 原生端点访问,支持 IAM 认证与计费,读者可据此评估迁移或接入路径。

5月6日周三
5月4日周一
  1. Runway News66

    Runway 发布 Characters,单张图片生成 24fps 实时对话视频智能体

    Runway 发布 Characters,基于 GWM-1 将单张参考图转为可实时对话的视频角色,无需微调,支持写实人像、卡通和吉祥物等风格。模型每帧有效耗时 37 毫秒,用户停止说话到角色开口的服务端延迟 1.75 秒;通过扩散变换器与 VAE 解码器流水线并行、KV-cache 管理、CUDA Graphs 和 Triton 核优化实现 24fps 实时生成。

    推荐理由:官方技术博客拆解了实时管线的关键数字和系统优化,读者可以据此理解单图驱动的对话视频智能体的实现路径。

4月30日周四
  1. Claude Blog64

    构建 Claude Code 的经验:提示词缓存决定一切

    Claude Code 团队发文总结围绕提示词缓存构建智能体的工程经验,核心是提示词缓存按前缀匹配,前缀中任何改动都会使其后的缓存失效,因此要把静态内容放前面、动态内容放后面。

    推荐理由:Claude Code 团队公开了围绕提示词缓存设计智能体的具体取舍,可迁移到自建 Agent 的提示词组织与工具管理。

4月28日周二
4月27日周一
4月25日周六
  1. LMSYS Blog73

    SGLang 与 Miles 实现 DeepSeek-V4 (1.6T Pro, 284B Flash) Day-0 推理与 RL 训练支持

    SGLang 与 Miles 团队宣布在发布当天为 DeepSeek-V4 (1.6T Pro, 284B Flash) 提供推理与 RL 训练的开源支持,针对其混合稀疏注意力、mHC 和 FP4 专家权重架构做了专项适配。

    推荐理由:原文给出 ShadowRadix、HiSparse 等具体优化机制和基准数字,读者可以了解混合稀疏注意力架构对推理与 RL 训练系统的实际工程要求。