Cursor 推出构建功能,云端智能体启动速度提升至 3 倍
Cursor 推出构建,即在后台预先准备好的可直接使用的开发环境副本,默认每小时创建一次,无需额外费用。智能体直接在已就绪环境中启动,Cursor 内部环境启动快 10 倍、首个 token 生成快 3 倍;构建失败时智能体回退到上一次成功构建,8 月 17 日起所有环境默认启用。
Cursor 推出构建,即在后台预先准备好的可直接使用的开发环境副本,默认每小时创建一次,无需额外费用。智能体直接在已就绪环境中启动,Cursor 内部环境启动快 10 倍、首个 token 生成快 3 倍;构建失败时智能体回退到上一次成功构建,8 月 17 日起所有环境默认启用。
HeyGen 与 Google Cloud 合作,把其 18B 参数以上的数字人视频扩散模型 Avatar IV 移植到八芯片 Trillium(v6e)主机上,速度达到首个可用版本的 1.86 倍。
WhatsApp 推出可选功能 Scam Alert,在设备端用机器学习模型对非联系人消息做诈骗分类,消息内容不上传、不自动上报。模型版本经 Cloudflare 签名并发布到第三方 append-only 透明账本,遥测经基于 TEE 的机密联邦分析管线以差分隐私聚合方式回传,用户可在应用内查看 Scam Alert Activity 日志,功能正在 Beta 小范围推送。
推荐理由:原文给出了 Scam Alert 的端侧架构与可验证机制细节,安全研究者可以据此评估其在端到端加密下的实现。
OpenRouter 发布实时网络搜索基准榜单,覆盖 BrowseComp、DeepSearchQA、WideSearch 和 HLE 四套评测,比较模型、引擎(Exa、Parallel、Perplexity 及 OpenAI、Anthropic、Google 原生搜索)、搜索方法与预算的组合。
推荐理由:原文用四套实时榜单量化搜索预算、引擎与模型对质量和成本的影响,还给出可直接套用的参数配置方法。
SGLang 与 Miles 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B,采用 69 层 GDN 线性注意力与 23 层 GQA 全注意力 3:1 交错的混合架构,MoE 含 512 专家 top-10 路由。
推荐理由:SGLang 团队详解 Qwen3.8 混合注意力架构的推理支持方案,给出内核优化、并行布局与实测吞吐数字,可作部署参考。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键工作负载提供自定义速率限制和 uptime SLA。
Linear 官方详解 Linear Agent 的构建思路:不为 Agent 设计固定路径,而是通过系统提示词、工具设计、对 Linear 产品的语义建模、system skills 按需加载和自研 harness 来划定边界。
推荐理由:Linear 官方复盘 Agent 的设计取舍,涉及系统提示词、工具设计、system skills 和自研 harness,方法可迁移到类似 Agent 构建。
OpenRouter 发布重大更新的 Auto 路由器(openrouter/auto),基于平台每周超 55T token 的真实消费数据选择模型,并已向所有用户开放。
推荐理由:基于 55T 周消费数据的市场化路由思路,附各任务基准与成本对比,读者可据此评估是否切换自己的 Auto 路由配置。
OpenRouter 发布团队支出管控设置教程,按顺序配置五项控制:创建组织共享信用池、用 presets 固定各工作流的模型与提供商、通过 Management API 为每个 API key 设置 credit 上限和 daily/weekly/monthly 重置。
OpenRouter 官方详解治理团队 AI 支出的 6 项控制:per-key 信用限额、guardrails、workspace 预算、presets、组织角色和 Activity 仪表盘,分别覆盖花多少、花在哪和谁在花。
推荐理由:官方详解 6 项团队支出控制的功能边界和叠加规则,读者可按团队规模选择最省成本的控制组合。
Meta 工程博客介绍其广告排序的多阶段序列建模架构与论文 LLaTTE:离线用户模型异步处理数千长度序列并缓存嵌入,在线排序模型结合实时信号完成打分。
OpenRouter 发布 ori CLI,安装并登录后可自动为 Claude Code、Codex、OpenCode、Hermes 等生成适配 OpenRouter 的优化配置。
SpecForge v0.3.0 将目标模型推理与草稿模型训练解耦,在线训练完全分离,在 8xH20 测试平台上以 3 台 SGLang 服务器加 5 个训练 worker 的拓扑,端到端训练吞吐较此前同置实现提升约 10%。
Cursor 团队分享如何为云端智能体搭建开发环境,让智能体能在其单体仓库中运行和测试代码。做法包括用 Dockerfile 统一 Ubuntu VM 环境、构建 anydev CLI 简化智能体操作、通过 Cursor Cloud MCP 和 Cloud Doctor 实现环境自愈与持续优化。云端智能体编写 PR 的占比从去年 12 月的约十分之一升至今日的超过一半。
推荐理由:Cursor 团队分享了自家云端智能体环境的搭建细节,含 anydev CLI 和 Cloud Doctor 等可借鉴做法。
Microsoft 提出行业下一个焦点是 token 效率,主张通过联合优化模型、harness 和 RL 环境为具体产品调校模型,而非所有任务都用前沿通用模型。
推荐理由:Microsoft 官方阐述 token 效率策略,用多款 MAI Flash 模型的实际成本数据说明如何按任务匹配模型规模。
Sierra 发布 Agency 智能体沙箱编排层,为 Pinecone 和 Ghostwriter 的每个会话与任务提供安全运行环境。Agency 基于 Kubernetes 构建,分无状态控制平面与有状态 runner 两层,每个 runner 配备 8+ 核、24GiB 内存和持久化存储,并默认不向智能体暴露任何 API key 或密钥。
RadixArk 与 Google Cloud 合作,把开源推理框架 SGLang 带到 TPU。SGL-JAX 现已可用,支持 Gemma、Qwen、DeepSeek。
IBM Research 与 UC Berkeley Sky Lab 基于进化式内核搜索框架 K-Search 构建 MLX 后端和结构化 CUDA 到 MLX 翻译层,把既有 NVIDIA 内核经验转化为 Apple Silicon 可用的优化指导。
OpenRouter 发布官方教程,介绍专用包 langchain-openrouter(PyPI)和 @langchain/openrouter(npm)在 LangChain 中接入 400+ 模型、70+ 提供商的当前做法。
Miles 为 MoE 专家实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8 与逐 token NVFP4,覆盖 rollout、前向传播、权重梯度与数据梯度 GEMM,并支持检查点转换、Megatron 训练、SGLang rollout 与在线权重更新的细粒度精度控制。
OpenRouter 发布指南,讲解如何评估同一模型在不同服务商端点的表现差异,核心指标为延迟(首 token 时间)、吞吐(输出 tokens/秒)、可用性和量化精度,并建议用 p90/p99 而非平均值读数。
SGLang 在 issue #15194 中提出量化栈重构方案,将原本由单一类承担的量化路径拆分为 Quant Config、Linear/MoE Method、Scheme、Kernel 四层,使 checkpoint 格式解析与硬件后端执行解耦。
SGLang 和 Miles 发布对 Kimi K3 的 Day-0 支持,分别覆盖推理与 RL 训练。K3 为 2.8T 参数的 3 万亿参数级首个开源模型,采用 69 层 KDA 线性注意力与 24 层 MLA 的混合架构和 1M token 上下文窗口。
推荐理由:原文由 SGLang 团队自述 Day-0 支持的实现细节,给出内存管理、投机解码与并行策略的具体方案和实测数字,可迁移到异构注意力架构的部署。
LangChain 发文提出未来五年企业要么用 AI 运营业务、要么把 AI 做成产品,通用智能不足以支撑差异化,企业需要"拥有自己的智能"。
OpenRouter 推出 beta 版 Classifiers,可在每个请求完成后异步分类,为生成记录写入结构化元数据,用于 AI 用量和成本追踪。
Sierra 分享为内部 agent 搭建 MCP Gateway 的七条经验,包括抓住所有权减少协调、用 mcp-gateway.md 提升编码 agent 一次成功率、多阶段流程防止跨客户数据访问,以及优先用 gh CLI 等 agent 熟悉的工具。目前 89% 的 Sierra 员工通过它连接 45 个服务,近三分之二提交来自社区。
推荐理由:Sierra 工程师复盘 MCP Gateway 建设全程,给出协作机制、权限审计和工具取舍七条可迁移经验。
OpenRouter 上线 POST /api/v1/audio/transcriptions 音频转写端点,复用 Chat Completions 的同一 API key 和鉴权。
推荐理由:官方教程给出了完整的请求参数、限制和计费细节,读者可以直接照抄接入而不必自建 Whisper 服务。
OpenRouter 发布教程讲解提示词缓存与粘性路由如何降低 Agent 多轮成本。缓存读取为输入价格的 0.1x 到 0.5x,Anthropic 缓存写入为 1.25x(5 分钟 TTL)或 2.0x(1 小时 TTL),未被复用的单次写入比不缓存更贵。
推荐理由:原文给出各厂商缓存读写倍率、session_id 粘性路由用法和缓存未命中排查方法,读者可以直接照做降低 Agent 多轮成本。
Sierra 发布内部云 Agent 平台 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、共享和自动化云端智能体会话。每个会话约一秒内获得带代码仓库、构建缓存和开发服务的隔离环境,并提供多人协作、自动盯 PR、定时自动化、可复用 Skills 和多会话 Projects 等能力。
推荐理由:Sierra 官方复盘自研内部云 Agent 的架构与经验,读者可以从中了解企业如何沉淀员工工作智慧并组织智能体协作。
IBM Research 团队撰文指出,把 Agent 系统中的模型路由当作分类问题会失效,实际是成本、质量、延迟与合规并存的系统优化问题。
SGLang 与 Miles 团队同 Thinking Machines Lab 合作,为 975B 参数、上下文最长 1M tokens 的多模态模型 Inkling 提供 Day-0 支持。
推荐理由:原文给出 Inkling 架构细节、SGLang 各项优化后的具体吞吐数字,以及 Miles 侧完整 RL 训练方案,工程参考价值具体。
SGLang 在 8xB300(bs=1)上为 GLM-5.2 NVFP4 智能体负载实现超 500 TPS,两周内完成从 day-0 支持到 v0.5.15.post1 的优化。
Runway 开源 AVTensor,一个直接调用 FFmpeg C API 的 Rust 媒体解码器,单次 demux 同时解码音频与视频并共享时间原点,解决了 torchcodec 与 torchaudio 在负 PTS 资产上时间零点不一致导致的音画失步问题。
Hugging Face 博客发布 Profiling in PyTorch 系列第三篇,在 NVIDIA A100 上用 profiler 对比手写 attention 与 SDPA 的 math、efficient、flash、cuDNN 后端。
Sierra 于今年 1 月成立六人 AI 加速团队,将多个角色专属 Agent 合并为统一 Agent Pinecone,内置在 Claude Code 和 Codex 之上。
推荐理由:原文给出 Sierra 内部推行统一 Agent 的具体做法与教训,单 Agent 架构、持久化上下文和以产出物衡量价值等经验可迁移到其他公司。
DeepSeek-V4 Flash 的 RL 训练现已在 AMD Instinct MI355X GPU 上通过 Miles 支持,基于 ROCm 完成四节点端到端验证。
Netpreme X-Mem™ MPU 作为专用 KV 内存层接入 SGLang HiCache,在前缀密集型负载下将首 token 延迟(TTFT)较基于 Host DRAM 的方案降低 6.7 倍。
Hugging Face 官方博客总结 🤗 Kernels 项目数月来的重大更新,包括 Hub 新增 kernel 仓库类型、默认仅加载受信任发布者的 kernel、基于 Sigstore cosign 的代码签名、重构 kernels 与 kernel-builder 的 CLI。
SGLang 现已支持 DSpark 投机解码,在 dense 和 sparse 模型(如 Qwen3、DeepSeek-V4)上均可用。DSpark 采用半自回归块草稿器与基于草稿模型置信度的逐请求变长验证,减少无效 token 验证。在 H200 上以 DeepSeek-V4-Flash 测试,其吞吐/延迟权衡在整个并发扫描中优于 MTP 和非投机基线。
Runway 构建了名为 deckard 的容量控制器,在生产与研究集群间重新分配 GPU:白天跟随推理需求扩缩,夜间把闲置算力借给研究,并在早高峰前归还。该控制器按五个时间窗口执行预计算调度,将工作日 8:30–12:30 ET 划为高峰子窗口,并基于排队论按 p98 延迟目标确定 GPU 数量。由于跨集群迁移节点需 20 到 60 分钟,控制器会提前预测需求波峰并预先移动容量。