用 TRL 和 GRPO 微调 LFM2.5-350M,100 步提升 IFStruct 结构化输出成绩
Hugging Face 发布一份完整教程,用 TRL 库的 GRPO 微调 LiquidAI/LFM2.5-350M 提升结构化输出合规性,在 IFStruct benchmark 上从 22.6% 提升到 29.7%。
推荐理由:原文给出完整可复现的 GRPO 微调流程和前后对比数据,读者可以照着用免费 GPU 把小模型的结构化输出提升约 7 个百分点。
Hugging Face 发布一份完整教程,用 TRL 库的 GRPO 微调 LiquidAI/LFM2.5-350M 提升结构化输出合规性,在 IFStruct benchmark 上从 22.6% 提升到 29.7%。
推荐理由:原文给出完整可复现的 GRPO 微调流程和前后对比数据,读者可以照着用免费 GPU 把小模型的结构化输出提升约 7 个百分点。
Hugging Face 博客用 TRL 和 OpenEnv 开放复现 Surya Narreddi 让语言模型写 p5.brush JavaScript 画水彩的方法,训练 Qwen/Qwen3.5-35B-A3B,参考池、RL 环境、训练脚本和模型全部公开,一条命令即可在 HF 上端到端运行。
Meta 工程团队构建了一个作为组织第二大脑的 AI 智能体,通过结构化知识体系、可组合 recipes 推理层和自动自我改进循环,把专家反馈编译为无需模型重训练的验证更新。系统将 200+ 知识文件按密度与使用频率划分、以 YAML 依赖图组织,六周内把单项评估时间从数天降到数分钟,每轮次 token 消耗减少约 80%,改进周期零回归。
Google for Startups AI Agents Challenge 评选结束后,官方从高分提交中总结出四种工程模式:双向 MCP、事件驱动并发、同标准降级(Gemini 3.1 Pro 503 时回退 Gemini 3.6 Flash 并共用同一校验函数)、以及模型调用前的分层路由。
推荐理由:文章从真实参赛代码中提炼四个可复用的工程模式,覆盖工具暴露、并发、降级校验和分层路由,可直接迁移到自己的智能体项目。
随着智能体编程的发展,软件工程基础发生了哪些变化?这是我们针对软件工程基础的 AI 工程技能图谱。https://x.com/i/article/2093384274372419585
SGLang 将 SSD-LLaMA 的核心思路引入 MoE 推理,把放不进 VRAM 和内存的路由专家权重放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O、pinned 暂存和 GPU 缓存,只加载 router 选中的专家。
推荐理由:原文给出完整机制说明和单卡实测数据,读者可以据此评估 NVMe SSD 承载超大 MoE 模型的可行性。
LMSYS 团队发布 Infer-forge,一套围绕 SGLang 独立构建、未开源的推理工程系统,公开其 Harness、Loop、Graph 三层方法论,供团队用 AI 编码工具自行搭建。
Google 开发者博客介绍深度学习在天体粒子物理中的应用:Pierre Auger 天文台用 1500 多个探测器站覆盖 3000 平方公里,IceCube 以约 1 立方公里南极冰探测中微子,这些观测设施的空间分布传感器记录波形数据,结构类似图像,适合用深度学习分析。文章聚焦深度学习如何提升仪器灵敏度、发现隐藏模式并搜寻信号异常。
Linear 宣布完成从 styled-components 到 StyleX 的迁移,历时逾 1000 个 PR。迁移动机包括 styled-components 进入维护模式、React 18 并发渲染下的性能回归,以及团队希望为 Agent 参与代码库建立更清晰的样式边界。
推荐理由:Linear 团队亲历者复盘超千个 PR 的迁移过程,给出可迁移的确定性工具加 Agent 加人工判断的方法和降险步骤。
Hugging Face 发布 Sentence Transformers v6.0 教程,介绍第四种模型类型 MultiVectorEncoder 的完整训练方法,支持 ColBERT 风格的 late interaction 检索微调与从零训练。
推荐理由:作者用实测对比给出多向量模型微调的完整配方,包括起点选择、损失函数和索引压缩的量化取舍。
Google Search 推出 5 种家居装饰用法:AI Mode 可上传房间照片,按墙面宽度推荐沙发并生成摆放效果图;Google Lens 拍照识别复古单品并找同款;Circle to Search 在 Pixel 和三星 Galaxy S26 上圈选视频或社交帖中的壁纸找相似款。
OpenRouter 发布视频生成 API 教程,通过 POST /api/v1/videos 提交任务、轮询状态、下载 MP4,同一集成可用 Seedance 2.0、Veo 3.1、Wan 2.7,切换模型只需改 model 标识符。
推荐理由:OpenRouter 官方教程给出完整的异步视频生成集成代码,包括轮询、失败状态处理和换模型时需注意的参数差异,可直接迁移到自己的项目。
OpenRouter 发布模型选型教程,提出六步框架:定义任务、用实时使用数据和第三方基准筛选候选、对比各提供商价格与延迟、用自己的提示词测试、按每次完成任务的成本而非每 token 成本衡量,再决定或改用 openrouter/auto-beta 按请求路由。
推荐理由:OpenRouter 官方给出以成本每完成任务为核心的选型框架,并用自家 MCP 服务器让整个评测流程在编辑器内完成。
Google 在 ADK 中推出原生实时(live)评测能力,可用模拟用户以音频形式与语音 Agent 对话并对口头回复打分。
Hugging Face 介绍 Papers with Code 混合搜索架构:PostgreSQL 全文检索加 pgvector 语义检索,经 RRF 融合,用 Qwen/Qwen3-Embedding-0.6B 生成 256 维向量,已覆盖超 110,000 篇 arXiv 论文。
推荐理由:作者复盘了自己上线论文混合搜索的架构与教训,读者可以借鉴冷启动回退、embedding 契约和 Matryoshka 维度权衡这些可迁移做法。
RadixArk SGLang 团队与蚂蚁 Ling 基础设施团队将 Ling-3.0-flash 在 4 张 Blackwell GPU 上的单请求解码从 288 tok/s 提升到 606 tok/s,mean TPOT 从 3.33 ms 降到 1.53 ms。
Miles 是结合 SGLang 做 rollout 生成、Megatron-LM 做训练的高性能强化学习框架,其 disaggregated 架构下 rollout 数据需从推理侧传到训练侧。
LMSYS 针对 1.6 万亿参数 MoE 模型 DeepSeek-V4-Pro,在无原生 FP4 支持的 H20 GPU 上给出场景化服务方案。
Cursor 推出 Git 托管平台 Origin,其底层是自研存储系统 Continuity,以 S3 中的预写日志作为唯一事实来源,在推送完全持久化前不作确认,实现所有推送线性化和读取完全一致。
OpenRouter 发布 Image Generation API 代码教程,通过 POST /api/v1/images 用统一请求格式和一个 key 调用多家支持的图像模型。
Google 开源了一个基于 Agent Development Kit 和 Gemini 的零信任客服退款智能体参考实现,展示单条提示词注入即可触发越权退款和环境变量泄露。
推荐理由:原文用可运行的开源示例拆解智能体三层零信任防护,读者可以照着在自己的 ADK 工作流里落地签名、沙箱和网关。
SGLang 重构 CUDA Graph 支持,围绕统一的 runner/backend 接口让不同捕获策略可跨执行路径复用,并推出其原创的 Breakable CUDA Graph(BCG)服务技术。
OpenRouter 发布视觉输入教程,讲解通过 Chat Completions API 向支持视觉的模型发送图片,请求体只需在 content 数组中加入 text 和 image_url 两部分,切换模型仅改 model 字段。
Sierra 提出在智能体时代以"纵深防御"保障 AI 行为边界,让每条客户消息在回复前经过内容、规则与政策、监督模型、确定性守卫等多层检查,单条消息可触发多达六项校验。Sierra 的智能体基于目标与护栏构建,可自主推理而非沿预设流程执行。运行时之外还包括持续评估、持续监控与上线前 Simulations 压力测试。
HeyGen 与 Google Cloud 合作,把其 18B 参数以上的数字人视频扩散模型 Avatar IV 移植到八芯片 Trillium(v6e)主机上,速度达到首个可用版本的 1.86 倍。
OpenRouter 发布工具调用指南,展示同一套循环代码只需更换 model 字符串,即可在 Claude、GPT 和开源权重模型上运行。
Nathan Lambert 宣布其由 Manning 出版的后训练教材《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》开始发售,8 月 19 日前用代码 PBLambert 在 Manning 可享五折。
Linear 官方详解 Linear Agent 的构建思路:不为 Agent 设计固定路径,而是通过系统提示词、工具设计、对 Linear 产品的语义建模、system skills 按需加载和自研 harness 来划定边界。
推荐理由:Linear 官方复盘 Agent 的设计取舍,涉及系统提示词、工具设计、system skills 和自研 harness,方法可迁移到类似 Agent 构建。
OpenRouter 发布团队支出管控设置教程,按顺序配置五项控制:创建组织共享信用池、用 presets 固定各工作流的模型与提供商、通过 Management API 为每个 API key 设置 credit 上限和 daily/weekly/monthly 重置。
OpenRouter 官方详解治理团队 AI 支出的 6 项控制:per-key 信用限额、guardrails、workspace 预算、presets、组织角色和 Activity 仪表盘,分别覆盖花多少、花在哪和谁在花。
推荐理由:官方详解 6 项团队支出控制的功能边界和叠加规则,读者可按团队规模选择最省成本的控制组合。
Chime 用 Runway 完成最新全国电视广告的结尾画面,将 85 位以上真实会员照片生成稳定、可播出的动态网格画面。执行制片人 Shayla Love 称,这一原本需要 80 多人实拍、成本约为传统方式 5 倍的场景,靠传统拍摄几乎无法落地。团队还计划把 Runway 用于概念分镜和品牌图片生成。
Suno 官方博客呼吁创作者把作品从私人曲库中发布出来,认为发布不完美或实验性的作品同样值得。文章给出三个理由:触达 Suno 数百万听众、通过真实反馈了解作品哪些部分能打动人、以及被其他创作者 remix 并获得灵感。
Cursor 团队分享如何为云端智能体搭建开发环境,让智能体能在其单体仓库中运行和测试代码。做法包括用 Dockerfile 统一 Ubuntu VM 环境、构建 anydev CLI 简化智能体操作、通过 Cursor Cloud MCP 和 Cloud Doctor 实现环境自愈与持续优化。云端智能体编写 PR 的占比从去年 12 月的约十分之一升至今日的超过一半。
推荐理由:Cursor 团队分享了自家云端智能体环境的搭建细节,含 anydev CLI 和 Cloud Doctor 等可借鉴做法。
OpenRouter 发布官方教程,介绍专用包 langchain-openrouter(PyPI)和 @langchain/openrouter(npm)在 LangChain 中接入 400+ 模型、70+ 提供商的当前做法。
Miles 为 MoE 专家实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8 与逐 token NVFP4,覆盖 rollout、前向传播、权重梯度与数据梯度 GEMM,并支持检查点转换、Megatron 训练、SGLang rollout 与在线权重更新的细粒度精度控制。
OpenRouter 发布指南,讲解如何评估同一模型在不同服务商端点的表现差异,核心指标为延迟(首 token 时间)、吞吐(输出 tokens/秒)、可用性和量化精度,并建议用 p90/p99 而非平均值读数。