OpenRouter 解析 NVIDIA Nemotron 3.5 Lightning 如何承担智能体高频执行调用
OpenRouter 发文解析 NVIDIA 的 Nemotron 3.5 Lightning,这是一个 30B 总参数、每 token 激活约 3B 的 MoE 开源权重模型,定位于智能体工作流中的高频执行步骤。
推荐理由:原文梳理了模型规格、与 Ultra 的分工、各端点差异和路由方法,可帮助读者判断何时用它替代大模型执行高频调用。
OpenRouter 发文解析 NVIDIA 的 Nemotron 3.5 Lightning,这是一个 30B 总参数、每 token 激活约 3B 的 MoE 开源权重模型,定位于智能体工作流中的高频执行步骤。
推荐理由:原文梳理了模型规格、与 Ultra 的分工、各端点差异和路由方法,可帮助读者判断何时用它替代大模型执行高频调用。
LangChain 博客介绍 Included Health 与 Abridge 如何用 LangSmith 将稀缺的临床专家评审转化为可复用资产,包括标注数据集、校准评估器和自动化发布门禁。
压缩器通过降低音频中最响部分的音量、再用补偿增益提升整体电平,从而缩小动态范围,让安静细节在混音中更清晰。Suno Studio 的压缩器插件提供阈值、压缩比、启动与释放等参数,并配有实时动态曲线表,适合处理上传或录制的原始音频。Studio 为浏览器端 DAW,随 Suno Premier 订阅免费提供。
Linear 因 AI 智能体加速写代码使 CI 成为瓶颈,系统性改造后把 PR 等待时间从 6 分多钟降到 5 分多钟,单个测试的 runner 时间约减半。
推荐理由:原文给出完整的 CI 优化路径和各步骤量化收益,其他团队可对照迁移到自己的流水线。
Descript 借助 OpenRouter 和 Anthropic 的 Slack 集成 Claude Tag,把新模型评测从几小时工作加一周等待压缩到一两小时内完成,无需再占用工程师排期。
GitHub 用 Copilot 智能体将 Copilot agent runtime 从 TypeScript 完整重写为 832,378 行生产 Rust,共 128 个 PR,于 8 月 21 日完成。
推荐理由:作者以第一手移植经历拆解了 AI 智能体团队完成大规模重写的具体策略、会话数据和教训,方法细节对类似工程迁移有直接参考价值。
OpenRouter 发布教程,演示如何用其 TypeScript SDK 从零构建工具调用 Agent 循环,示例使用本地天气数据可独立运行。教程覆盖停止条件设计、按 toolCallId 返回结果、指纹计数拦截重复调用、models 参数实现有序模型回退,以及 Auto Exacto 默认按工具调用成功率重排提供商;并说明 MCP 只改变工具执行位置,循环控制仍是必要的。
推荐理由:教程给出了完整的停止条件、重复检测和模型回退实现,可用作自建 tool-calling 循环的参考骨架。
OpenAI 介绍如何用 ChatGPT Work 和 Codex 的分析功能,帮助团队了解 AI 使用量与支出、识别培训需求,并把 AI 采用情况与业务成果关联起来。
OpenRouter 逐一梳理 DeepSeek V4 家族的输入模态:仅 deepseek/deepseek-v4.1-flash 和 deepseek/deepseek-v4-flash-vision-exp 接受图像,其余 V4 Pro 0813、V4 Flash 0731、两个 0423 checkpoint 和 Flash latest alias 均为纯文本。
IBM Research 在 ALTK-Evolve 中新增 Consistency Analyzer 和一致性指南,用于衡量并改善智能体重复执行同一任务时的稳定性。
推荐理由:原文给出 Pass^k 与 Mean@k 的区别和一种只靠单条轨迹、无需标注的稳定性诊断方法,可将智能体一致性缺口缩小约一半。
NVIDIA 与 SGLang 合作实现 NVFP4 KV cache,在 Blackwell 上以 4 比特存储 K/V,配合 FP8 分块缩放与 FP32 张量级缩放两级量化,打包数据加块缩放仅占 FP8 约 56% 存储。
Descript 发布案例研究,介绍其视频编辑智能体 Underlord 采用 OpenRouter 后,生产模型从 1 个增至 13 个(来自 4 家模型开发方),新模型评测时间从一周以上缩短到 1-2 小时,一次 Anthropic 发布从宣布到上线只用了几小时。
Google Developers Blog 发布零信任 Agent 系列第二篇,将安全检查从构建时移到 Gemini Enterprise Agent Platform 的运行时。
OpenRouter 发布教程,讲解如何用独立的 judge 模型按书面评分标准自动给 Agent 输出打分,弥补确定性测试无法检查最终回答质量的问题。
推荐理由:原文给出可复用的评测方法和 Ori Eval 具体代码,覆盖评分模式选择与 judge 校准的实操细节。
LangChain 开源其 Paid Media Agent 并复盘构建过程,该 Agent 驻留 Slack,用于管理跨五个付费渠道的广告活动。六个月内付费媒体从 0 做到占营销管道的 20%,CPL 从 6 月到 8 月下降 30%。
推荐理由:原文给出了 Agent 工程的具体设计决策和成本数据,读者可以迁移其上下文分层和权限设计方法到自己的 Agent 项目。
GitHub 日本与韩国营销负责人 Tomoko Tanaka 撰文分享如何不写代码,用 GitHub Copilot 把活动运营从策划到会后跟进全流程自动化。
推荐理由:作者以自身营销流程为例,展示如何用 runbook 加 Copilot 在 GitHub 上搭建自动化,方法可迁移到其他重复性工作。
匿名混合现实艺术家 VOIDZ 借助 Runway 的 Seedance 2.0,将原本受限于 10 到 15 秒的 3D 制作流程,扩展成 95 秒纪录片《Ends Meat》。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑超 10 亿 ChatGPT 用户、每秒 2200 万次请求。
Google 推出 autofinetune,将自主研究循环用于 LLM 后训练,基于 Tunix、Gemma 和 Cloud TPU,由 Antigravity CLI 与 Gemini Flash 3.7 编排。
OpenRouter 通过 OpenAI 兼容的 POST /api/v1/audio/speech 端点提供文本转语音,一个 API key 即可以相同请求结构调用 Mistral Voxtral Mini TTS、xAI Grok Voice TTS 1.0、Microsoft MAI-Voice-2 等多家模型。
OpenRouter 发文解释零数据保留(ZDR):AI 提供商处理完提示词并返回响应后不再存储,但数据仍会到达提供商并由模型处理。在 OpenRouter 上可通过账户设置、guardrails 或请求中的 provider.zdr 字段强制启用 ZDR,该策略仅覆盖提供商侧推理留存,应用日志、插件工具及响应缓存需另行控制。
GitHub Copilot app 新增内置 diff、终端和浏览器面板,让新手不用离开应用即可审查 agent 改动、运行命令并预览界面。
César de la Fuente 的实验室利用 Codex 和 ChatGPT 在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
Google Search 的 AI 功能可帮跑者备战比赛:AI Mode 配合 Canvas 工具生成个性化训练计划,连接 YouTube Music 账号后还能定制跑步歌单。选购装备时,Search 依托超过 600 亿条商品信息的 Shopping Graph 提供推荐、库存对比和本地可用性。
OpenRouter 发布 Presets 使用教程,介绍如何把模型选择、系统提示词、provider 路由和采样参数存为一个命名且有版本的配置,并在任意 API 请求中通过 "model": "@preset/名称" 引用。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过各 Job 挂载的 Storage Bucket 传输,无需 NCCL。
Google DeepMind 与 Primordial Soup 合作制作纪录短片《Love, Rendered》,用 AI 重建 Burt 和 Ethelle Shatz 结婚 70 多年来未被拍摄记录的初遇记忆。
Mistral 帮助一家欧洲能源运营商将 40 万行油藏模拟器代码库中的 40,000 行 Fortran 77 核心功能迁移到 C++,该代码无测试套件且文档分散。
推荐理由:原文复盘了完整迁移过程和三条可迁移经验,读者可以借鉴其验证优先与结构化工作流的落地方法。
针对 AI 编程智能体评测,Google 提出用行为评测替代 Terminal-Bench、DeepSWE 等端到端基准的复合分数,直接断言工具调用等中间执行步骤。
OpenRouter 发布教程,演示如何通过 API 向 google/gemini-3.1-flash-image(Nano Banana 2)发送源图和编辑指令,在代码中完成图片编辑。
MIT 研究人员使用 GPT-5.6 Sol 配合 Codex,自主运行量子计算实验、分析结果并校准量子比特。该案例展示了 GPT-5.6 Sol 在量子计算实验流程中的自动化能力。
Meta 推出 ZGateway,作为统一 ZippyDB 客户端流量的无状态代理层,可承载超过 10 亿次/秒的操作,目前承担约 40% 的 ZippyDB 流量,预计将增长至 60% 以上,平均用例仅增加约 6% 计算开销。
GitHub 官方博客发布面向新手的教程,介绍如何在 GitHub Copilot app 中同时运行多个 agent 会话。每个会话可运行在独立的 Git worktree 上互不干扰,各自保留上下文,用户通过 sessions 视图追踪进度,教程以 tailspin-toys 仓库演示了并行添加功能、无障碍审查和运行测试的做法。
推荐理由:官方教程讲清了并行 agent 会话如何借助 Git worktree 隔离运行,读者可以照着示例直接上手尝试。
Hugging Face 发布一份完整教程,用 TRL 库的 GRPO 微调 LiquidAI/LFM2.5-350M 提升结构化输出合规性,在 IFStruct benchmark 上从 22.6% 提升到 29.7%。
推荐理由:原文给出完整可复现的 GRPO 微调流程和前后对比数据,读者可以照着用免费 GPU 把小模型的结构化输出提升约 7 个百分点。
Hugging Face 博客用 TRL 和 OpenEnv 开放复现 Surya Narreddi 让语言模型写 p5.brush JavaScript 画水彩的方法,训练 Qwen/Qwen3.5-35B-A3B,参考池、RL 环境、训练脚本和模型全部公开,一条命令即可在 HF 上端到端运行。
Meta 工程团队构建了一个作为组织第二大脑的 AI 智能体,通过结构化知识体系、可组合 recipes 推理层和自动自我改进循环,把专家反馈编译为无需模型重训练的验证更新。系统将 200+ 知识文件按密度与使用频率划分、以 YAML 依赖图组织,六周内把单项评估时间从数天降到数分钟,每轮次 token 消耗减少约 80%,改进周期零回归。
Google for Startups AI Agents Challenge 评选结束后,官方从高分提交中总结出四种工程模式:双向 MCP、事件驱动并发、同标准降级(Gemini 3.1 Pro 503 时回退 Gemini 3.6 Flash 并共用同一校验函数)、以及模型调用前的分层路由。
推荐理由:文章从真实参赛代码中提炼四个可复用的工程模式,覆盖工具暴露、并发、降级校验和分层路由,可直接迁移到自己的智能体项目。
LMSYS 团队发布 Infer-forge,一套围绕 SGLang 独立构建、未开源的推理工程系统,公开其 Harness、Loop、Graph 三层方法论,供团队用 AI 编码工具自行搭建。
Google 开发者博客介绍深度学习在天体粒子物理中的应用:Pierre Auger 天文台用 1500 多个探测器站覆盖 3000 平方公里,IceCube 以约 1 立方公里南极冰探测中微子,这些观测设施的空间分布传感器记录波形数据,结构类似图像,适合用深度学习分析。文章聚焦深度学习如何提升仪器灵敏度、发现隐藏模式并搜寻信号异常。
Linear 宣布完成从 styled-components 到 StyleX 的迁移,历时逾 1000 个 PR。迁移动机包括 styled-components 进入维护模式、React 18 并发渲染下的性能回归,以及团队希望为 Agent 参与代码库建立更清晰的样式边界。
推荐理由:Linear 团队亲历者复盘超千个 PR 的迁移过程,给出可迁移的确定性工具加 Agent 加人工判断的方法和降险步骤。