Sentence Transformers 教程:用 MultiVectorEncoder 训练与微调多向量嵌入模型
Hugging Face 发布 Sentence Transformers v6.0 教程,介绍第四种模型类型 MultiVectorEncoder 的完整训练方法,支持 ColBERT 风格的 late interaction 检索微调与从零训练。
推荐理由:作者用实测对比给出多向量模型微调的完整配方,包括起点选择、损失函数和索引压缩的量化取舍。
Hugging Face 发布 Sentence Transformers v6.0 教程,介绍第四种模型类型 MultiVectorEncoder 的完整训练方法,支持 ColBERT 风格的 late interaction 检索微调与从零训练。
推荐理由:作者用实测对比给出多向量模型微调的完整配方,包括起点选择、损失函数和索引压缩的量化取舍。
Google Search 推出 5 种家居装饰用法:AI Mode 可上传房间照片,按墙面宽度推荐沙发并生成摆放效果图;Google Lens 拍照识别复古单品并找同款;Circle to Search 在 Pixel 和三星 Galaxy S26 上圈选视频或社交帖中的壁纸找相似款。
OpenRouter 发布视频生成 API 教程,通过 POST /api/v1/videos 提交任务、轮询状态、下载 MP4,同一集成可用 Seedance 2.0、Veo 3.1、Wan 2.7,切换模型只需改 model 标识符。
推荐理由:OpenRouter 官方教程给出完整的异步视频生成集成代码,包括轮询、失败状态处理和换模型时需注意的参数差异,可直接迁移到自己的项目。
OpenRouter 发布模型选型教程,提出六步框架:定义任务、用实时使用数据和第三方基准筛选候选、对比各提供商价格与延迟、用自己的提示词测试、按每次完成任务的成本而非每 token 成本衡量,再决定或改用 openrouter/auto-beta 按请求路由。
推荐理由:OpenRouter 官方给出以成本每完成任务为核心的选型框架,并用自家 MCP 服务器让整个评测流程在编辑器内完成。
Google 在 ADK 中推出原生实时(live)评测能力,可用模拟用户以音频形式与语音 Agent 对话并对口头回复打分。
Hugging Face 介绍 Papers with Code 混合搜索架构:PostgreSQL 全文检索加 pgvector 语义检索,经 RRF 融合,用 Qwen/Qwen3-Embedding-0.6B 生成 256 维向量,已覆盖超 110,000 篇 arXiv 论文。
推荐理由:作者复盘了自己上线论文混合搜索的架构与教训,读者可以借鉴冷启动回退、embedding 契约和 Matryoshka 维度权衡这些可迁移做法。
RadixArk SGLang 团队与蚂蚁 Ling 基础设施团队将 Ling-3.0-flash 在 4 张 Blackwell GPU 上的单请求解码从 288 tok/s 提升到 606 tok/s,mean TPOT 从 3.33 ms 降到 1.53 ms。
Miles 是结合 SGLang 做 rollout 生成、Megatron-LM 做训练的高性能强化学习框架,其 disaggregated 架构下 rollout 数据需从推理侧传到训练侧。
LMSYS 针对 1.6 万亿参数 MoE 模型 DeepSeek-V4-Pro,在无原生 FP4 支持的 H20 GPU 上给出场景化服务方案。
OpenRouter 发布 Image Generation API 代码教程,通过 POST /api/v1/images 用统一请求格式和一个 key 调用多家支持的图像模型。
Google 开源了一个基于 Agent Development Kit 和 Gemini 的零信任客服退款智能体参考实现,展示单条提示词注入即可触发越权退款和环境变量泄露。
推荐理由:原文用可运行的开源示例拆解智能体三层零信任防护,读者可以照着在自己的 ADK 工作流里落地签名、沙箱和网关。
SGLang 重构 CUDA Graph 支持,围绕统一的 runner/backend 接口让不同捕获策略可跨执行路径复用,并推出其原创的 Breakable CUDA Graph(BCG)服务技术。
OpenRouter 发布视觉输入教程,讲解通过 Chat Completions API 向支持视觉的模型发送图片,请求体只需在 content 数组中加入 text 和 image_url 两部分,切换模型仅改 model 字段。
Sierra 提出在智能体时代以"纵深防御"保障 AI 行为边界,让每条客户消息在回复前经过内容、规则与政策、监督模型、确定性守卫等多层检查,单条消息可触发多达六项校验。Sierra 的智能体基于目标与护栏构建,可自主推理而非沿预设流程执行。运行时之外还包括持续评估、持续监控与上线前 Simulations 压力测试。
HeyGen 与 Google Cloud 合作,把其 18B 参数以上的数字人视频扩散模型 Avatar IV 移植到八芯片 Trillium(v6e)主机上,速度达到首个可用版本的 1.86 倍。
OpenRouter 发布工具调用指南,展示同一套循环代码只需更换 model 字符串,即可在 Claude、GPT 和开源权重模型上运行。
Linear 官方详解 Linear Agent 的构建思路:不为 Agent 设计固定路径,而是通过系统提示词、工具设计、对 Linear 产品的语义建模、system skills 按需加载和自研 harness 来划定边界。
推荐理由:Linear 官方复盘 Agent 的设计取舍,涉及系统提示词、工具设计、system skills 和自研 harness,方法可迁移到类似 Agent 构建。
OpenRouter 发布团队支出管控设置教程,按顺序配置五项控制:创建组织共享信用池、用 presets 固定各工作流的模型与提供商、通过 Management API 为每个 API key 设置 credit 上限和 daily/weekly/monthly 重置。
OpenRouter 官方详解治理团队 AI 支出的 6 项控制:per-key 信用限额、guardrails、workspace 预算、presets、组织角色和 Activity 仪表盘,分别覆盖花多少、花在哪和谁在花。
推荐理由:官方详解 6 项团队支出控制的功能边界和叠加规则,读者可按团队规模选择最省成本的控制组合。
Chime 用 Runway 完成最新全国电视广告的结尾画面,将 85 位以上真实会员照片生成稳定、可播出的动态网格画面。执行制片人 Shayla Love 称,这一原本需要 80 多人实拍、成本约为传统方式 5 倍的场景,靠传统拍摄几乎无法落地。团队还计划把 Runway 用于概念分镜和品牌图片生成。
Suno 官方博客呼吁创作者把作品从私人曲库中发布出来,认为发布不完美或实验性的作品同样值得。文章给出三个理由:触达 Suno 数百万听众、通过真实反馈了解作品哪些部分能打动人、以及被其他创作者 remix 并获得灵感。
Cursor 团队分享如何为云端智能体搭建开发环境,让智能体能在其单体仓库中运行和测试代码。做法包括用 Dockerfile 统一 Ubuntu VM 环境、构建 anydev CLI 简化智能体操作、通过 Cursor Cloud MCP 和 Cloud Doctor 实现环境自愈与持续优化。云端智能体编写 PR 的占比从去年 12 月的约十分之一升至今日的超过一半。
推荐理由:Cursor 团队分享了自家云端智能体环境的搭建细节,含 anydev CLI 和 Cloud Doctor 等可借鉴做法。
OpenRouter 发布官方教程,介绍专用包 langchain-openrouter(PyPI)和 @langchain/openrouter(npm)在 LangChain 中接入 400+ 模型、70+ 提供商的当前做法。
Miles 为 MoE 专家实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8 与逐 token NVFP4,覆盖 rollout、前向传播、权重梯度与数据梯度 GEMM,并支持检查点转换、Megatron 训练、SGLang rollout 与在线权重更新的细粒度精度控制。
OpenRouter 发布指南,讲解如何评估同一模型在不同服务商端点的表现差异,核心指标为延迟(首 token 时间)、吞吐(输出 tokens/秒)、可用性和量化精度,并建议用 p90/p99 而非平均值读数。
SGLang 在 issue #15194 中提出量化栈重构方案,将原本由单一类承担的量化路径拆分为 Quant Config、Linear/MoE Method、Scheme、Kernel 四层,使 checkpoint 格式解析与硬件后端执行解耦。
OpenRouter 发布图像生成教程,讲解如何为 POST /api/v1/images 选择模型并修复常见 API 报错。选型建议按任务(文生图、参考图编辑、矢量输出、可读文字)、参数支持、价格依次决定;GET /api/v1/images/models 列出各模型的 supported_parameters。
Sierra 分享为内部 agent 搭建 MCP Gateway 的七条经验,包括抓住所有权减少协调、用 mcp-gateway.md 提升编码 agent 一次成功率、多阶段流程防止跨客户数据访问,以及优先用 gh CLI 等 agent 熟悉的工具。目前 89% 的 Sierra 员工通过它连接 45 个服务,近三分之二提交来自社区。
推荐理由:Sierra 工程师复盘 MCP Gateway 建设全程,给出协作机制、权限审计和工具取舍七条可迁移经验。
OpenRouter 发布教程讲解提示词缓存与粘性路由如何降低 Agent 多轮成本。缓存读取为输入价格的 0.1x 到 0.5x,Anthropic 缓存写入为 1.25x(5 分钟 TTL)或 2.0x(1 小时 TTL),未被复用的单次写入比不缓存更贵。
推荐理由:原文给出各厂商缓存读写倍率、session_id 粘性路由用法和缓存未命中排查方法,读者可以直接照做降低 Agent 多轮成本。
SGLang 在 8xB300(bs=1)上为 GLM-5.2 NVFP4 智能体负载实现超 500 TPS,两周内完成从 day-0 支持到 v0.5.15.post1 的优化。
Hugging Face 博客发布 Profiling in PyTorch 系列第三篇,在 NVIDIA A100 上用 profiler 对比手写 attention 与 SDPA 的 math、efficient、flash、cuDNN 后端。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),图像统一以 JPEG quality 92 编码。
Runway 构建了名为 deckard 的容量控制器,在生产与研究集群间重新分配 GPU:白天跟随推理需求扩缩,夜间把闲置算力借给研究,并在早高峰前归还。该控制器按五个时间窗口执行预计算调度,将工作日 8:30–12:30 ET 划为高峰子窗口,并基于排队论按 p98 延迟目标确定 GPU 数量。由于跨集群迁移节点需 20 到 60 分钟,控制器会提前预测需求波峰并预先移动容量。
SGLang 团队将 CUDA 崩溃调试、diffusion 模型接入、性能 profile、生产事故分诊等开发流程封装为可执行的 SKILL.md 技能,并构建基于 Humanize/RLCR 的 SOTA Performance Loop。
SGLang 为 DeepEP MoE 推理引入两种调度期负载均衡方案:面向共享专家的 Waterfill 和基于线性规划、针对冗余专家副本的 LPLB。
SGLang-JAX 现已支持在 TPU v7x 上高效服务 inclusionAI 的 Ling-2.6-1T,其新 Pallas kernel Fused MoE V2 将 MoE prefill 延迟从 5.16 ms 降至 2.42 ms(降幅 53%),decode kernel 延迟从 0.249 ms 降至 0.211 ms。
Linear 推出 Diffs 功能,用于应对智能体生成代码带来的审查压力:2026 年 1 月至 3 月,其团队新建 issue 与合并 PR 数量均上升 50%。该功能把审查集中到 Linear 内,支持一键查看代码变更背后的客户反馈或 bug 报告,并将改动分组为可读的叙事块,作者可直接在 Linear 中用智能体处理评论。
Suno 发布 Voices 功能使用指南,给出 6 个提升人声表现力的技巧:在安静环境录制、提前练习、不必追求完美、尽量录长(建议至少 1 分钟)、让声音匹配曲风、大胆尝试意外风格。Voices 已在 Web、iOS 和 Android 上线,可免费试用,付费方案提供更多功能。
Dynamo 与 SGLang 通过设备感知加权路由实现异构 Encode-Prefill-Decode(EPD)分离,将 VLM 的视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案相比纯 GPU EPD 在 QPS 1-2 负载下取得约 1.2x-1.3x 的 P99 TTFT 与请求吞吐提升,P99 TPOT 降低约 1.3x-30x。
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体独自完成产品本地化,耗时不到 4 个月,而他在 Slack 参与的同类项目需 10 人团队 9 到 12 个月。他经历 IDE 智能体、云端智能体、批量调用 Claude 脚本三轮迭代,并发现技能文档过长会超出上下文窗口反而推高错误率,最终把工作重心从执行迁移转向设计反馈循环。
推荐理由:作者复盘个人用 AI 编码智能体完成本地化的完整工作流,提炼出批处理脚本、反馈循环与上下文管理等可迁移方法。