Miles 如何用 Token-In-Token-Out 消除智能体 RL 的训练-推理不匹配
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求第 n 轮 prompt 的 token 序列必须与第 n-1 轮 prompt+response 逐位一致,以消除智能体 RL 中训练与推理的 token 序列不匹配。
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求第 n 轮 prompt 的 token 序列必须与第 n-1 轮 prompt+response 逐位一致,以消除智能体 RL 中训练与推理的 token 序列不匹配。
Suno 发布 Voices 功能使用指南,给出 6 个提升人声表现力的技巧:在安静环境录制、提前练习、不必追求完美、尽量录长(建议至少 1 分钟)、让声音匹配曲风、大胆尝试意外风格。Voices 已在 Web、iOS 和 Android 上线,可免费试用,付费方案提供更多功能。
Sierra 回顾 2024 年 12 月提出按结果(outcome-based)定价以来的经验:自那时起 S&P 500 上涨约 30%,而 SaaS 指标 WCLD 下跌约 15%。文章引用 Madhavan Ramanujam 的 2x2 框架(自主性与结果归因)定位定价模式,认为按结果定价只有在软件高度自主且结果可清晰归因时才可行,并判断最终能存续的是卖结果而非卖访问权的公司。
推荐理由:Sierra 作者基于自身按结果定价的实践复盘其得失,并用一个 2x2 框架解释为何席位制 SaaS 正承压。
SGLang 与 Miles 团队宣布 Day-0 支持 NVIDIA Nemotron 3 Ultra,一个面向长程自主智能体的开源推理模型,采用混合 Transformer-Mamba 架构的 Latent MoE,总参数 550B、激活 55B,上下文最长 1M token,支持 NVFP4 与 BF16 推理。
Microsoft 发布文本转语音模型 MAI-Voice-2,在保真度、语言覆盖、说话人一致性和情感范围上较前代显著提升。支持语言从英语扩展到 15 种,提供情感标签细粒度控制,可用 5-60 秒参考音频零样本创建自定义声音,且生产环境仅允许授权声音合成。
推荐理由:官方发布给出语言扩展、零样本克隆与偏好测试数据,读者可据此评估该语音模型在生产场景中的可用性。
Suno 宣布完成超 4 亿美元 D 轮融资,投后估值 54 亿美元,由 Bond Capital 领投,IVP、Forerunner、Union Square Ventures、Alkeon 和 Quiet 参投,现有投资者 Matrix、Lightspeed、Menlo Ventures 和 Schroders Capital 跟投。
推荐理由:Suno 官方公布融资规模、估值与投资方,并预告将与音乐行业合作推出首个音乐模型,读者可据此了解其后续方向。
Microsoft MAI 团队发布图像模型 MAI-Image-2.5 及更快更便宜的 MAI-Image-2.5-Flash,MAI-Image-2.5 在 Arena 图像编辑榜排名第 2(超过 Nano Banana 2),文生图榜排名第 3,较 MAI-Image-2 总分提升 75 分。
推荐理由:官方公布了 Arena 图像编辑第 2 的排名、与 Flash 双版本定价和 Foundry 入口,读者可据此评估生产图像工作流的选型。
Microsoft AI 发文阐述其在医疗领域的产品与研究方向,称旗下消费产品每天处理数千万条健康问题,对 50 万条 Copilot 对话的分析显示用户依赖 AI 做症状解读、检查结果解释和就医导航。
推荐理由:微软官方阐述其在医疗领域的价值落地,读者可以据此了解 MAI DxO、Mayo Clinic 合作与 Copilot Health 的进展全貌。
Microsoft MAI 在 Build 2026 主题演讲中发布七款新模型,覆盖图像、语音、转录、推理和编码。
推荐理由:作者以当事方身份逐一公布七个新模型的定位、基准数字和开放渠道,读者可以对照竞品评估各自适用场景。
微软推出转录模型 MAI-Transcribe-1.5,新增关键词偏置功能,可让用户提供领域特定关键词列表来引导预测,模型会结合上下文判断是否应用偏置而非盲目强制匹配。在 FLEURS 多语言基准上,启用关键词偏置后词错误率(WER)降低 30%,在提升专业词汇识别的同时保持通用语音的准确率。
Microsoft AI 发布七款新 MAI 模型,将上线 Foundry、OpenRouter、Fireworks 和 Baseten,并首次允许开发者自行微调模型权重。
推荐理由:官方完整说明了模型开放方式、Frontier Tuning 效率数据和医疗合作安排,读者可以据此评估其模型路线与可调性。
Microsoft 发布面向开发者的编码模型 MAI-Code-1-Flash,训练直接使用 GitHub Copilot 生产 harness,以适配真实智能体编码工作流。
Claude API 的 advisor 工具新增 max_tokens 参数,可限制顾问模型每次调用的输出长度,降低延迟与输出 token 成本,需在 tools[].max_tokens 中设置。同时,当请求返回 stop_reason: "refusal" 且 Claude 未生成任何输出时,Claude API 不再对该请求计费。
Import AI 第459期:一篇论文估算美国AI经济2025年名义规模约2500亿美元、质量调整产出年增约2600%,但常规GDP统计难以体现;UK AI Security Institute论文说明自动化对齐研究的错误比人类基线更难识别,并给出测量与红队等干预建议。
Runway 宣布在伦敦设立欧洲总部及新的通用世界模型研究枢纽,计划未来 18 个月向英国 AI 生态投资 1 亿美元,到 2028 年该数字将翻倍以上。过去十二个月 Runway 欧洲订阅销量增长 50%,超 20% 企业客户位于欧洲,BBC、Fremantle 和 WPP 均为其客户。新总部将招聘研究、产品、工程、销售等岗位,并招募一名 Head of Europe 统筹欧洲业务。
Runway 宣布以创始成员身份加入 Cosmos Coalition,与 NVIDIA 及多家 AI 实验室共建开放世界模型生态。联盟首个项目是由 Runway 和 NVIDIA 联合开发的基础模型。该联盟围绕共享基础设施与双向技术贡献组建,旨在加速世界模型研发并推动物理 AI 的互操作性。
Dynamo 与 SGLang 通过设备感知加权路由实现异构 Encode-Prefill-Decode(EPD)分离,将 VLM 的视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案相比纯 GPU EPD 在 QPS 1-2 负载下取得约 1.2x-1.3x 的 P99 TTFT 与请求吞吐提升,P99 TPOT 降低约 1.3x-30x。
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体独自完成产品本地化,耗时不到 4 个月,而他在 Slack 参与的同类项目需 10 人团队 9 到 12 个月。他经历 IDE 智能体、云端智能体、批量调用 Claude 脚本三轮迭代,并发现技能文档过长会超出上下文窗口反而推高错误率,最终把工作重心从执行迁移转向设计反馈循环。
推荐理由:作者复盘个人用 AI 编码智能体完成本地化的完整工作流,提炼出批处理脚本、反馈循环与上下文管理等可迁移方法。
Claude Managed Agents 的 webhooks、多智能体编排和自托管沙箱现已在 AWS 上的 Claude Platform 提供。官方文档列出了新增的 IAM actions 和 AnthropicSelfHostedEnvironmentAccess 托管策略。
Mistral 在 AI Now Summit 2026 宣布面向工业工程的整体 AI 栈,并与 Airbus、BMW 和 ASML 合作,覆盖设计、仿真和生产场景。
Mistral 将 Le Chat 升级为统一智能体 Vibe,一个账号覆盖工作与编码场景,已上线 chat.mistral.ai。Work Mode 面向长时多步任务,支持企业知识搜索、数据分析、文档起草、定时任务和可复用技能;Code Mode 提供远程编码会话并推出 VS Code 扩展,CLI 新增技能命令、会话权限控制和 /teleport 迁移。
推荐理由:原文是 Mistral 官方发布,完整列出 Work 与 Code 两种模式的能力、集成入口和各档定价,读者可据此评估是否替换现有工作流。
Mistral AI 发布 Search Toolkit 公测版,一个用于构建 AI 应用生产级搜索管道的开源可组合框架,统一了此前分散的数据摄取、检索与评估三个环节。
推荐理由:官方发布开源搜索框架,把 ingestion、检索和评估整合为统一接口,适合评估它能否减少 RAG 基础设施维护成本。
Linear 发布代码评审产品 Diffs,面向所有套餐开放,目标是让代码评审在不牺牲严谨性的前提下保持快速。评审在 Linear 内打开并关联对应的 issue 和项目,优先级可见;Guided reviews 把大 diff 按工作的推理顺序拆成章节,先展示核心改动,结构化 diff 高亮会剥离格式改动,让 2000 行的 PR 在一次阅读中变得可读。
推荐理由:Linear 官方解释了 Diffs 针对的评审痛点与具体设计,读者可以对照自己团队被 agent 大量 PR 拖慢的评审流程判断是否适用。
AMD 与 SGLang 团队联合优化,使 MI355X 在 DeepSeek-R1 大规模分离式推理中实现 129 tok/s/user 交互性下每百万 token $0.169 的成本,比 B200 TRT-LLM 低 5%,单 GPU 吞吐比 B200 SGLang 高 1.25 倍,结果由 SemiAnalysis 的 InferenceX 持续基准验证。
Anthropic 发布 Claude Opus 4.8,为其最强模型,在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上默认支持 1M token 上下文窗口,最大输出 128k token。
推荐理由:原文完整列出 1M 上下文、采样参数限制和各端可用性等迁移要点,接入方可以直接对照判断升级路径。
Mistral 将 Emmi AI 并入后推出物理 AI,用模型从几何与边界条件直接预测物理场,单次前向传播在单块 GPU 上以秒级完成,替代传统 CFD/FEM 每轮设计动辄数小时至数周的求解流程。该能力面向 ASML、Airbus、Safran、Siemens Energy 等合作伙伴,覆盖产品设计、工装工艺与实时数字孪生三类场景,传统求解器保留用于验证与边缘工况。
Mistral AI 宣布收购 Emmi AI,并强调将投入面向航空航天、汽车、半导体和能源等行业的基础 Physics AI 研究。文章列举了相关已发表成果,包括 2025 年 12 月发布的约 30,000 样本跨音速 3D 机翼 CFD 仿真数据集,以及 AB-UPT、GyroSwin、UPT、NeuralDEM 等神经代理模型的研究和开源仓库。
Runway 发布 Runway MCP(Model Context Protocol)服务器,把 Runway 接入用户已有的 Agent 和编码工具,在对话中直接生成图像和视频而无需切换上下文。
推荐理由:原文给出了接入方式和可用模型清单,读者可据此判断在自己的 Agent 工作流中调用 Runway 生成是否顺手。
Claude Messages API 响应新增 usage.output_tokens_details.thinking_tokens 字段,用于显示计费输出 token 中有多少来自扩展思考。流式模式下该明细仅出现在最后一个 message_delta 事件中,且无需 beta header。
Anthropic 联合创始人 Jack Clark 在牛津大学人类中心 AI 实验室发表 2026 年 Cosmos 演讲,主张面对 AI 持续进步应选择探索未来而非回避现实。
Runway 发布 Project Luxo,称 AI 生成视频已跨越恐怖谷,观众开始关注故事本身而非技术瑕疵。Runway 向制片人、演员、工会成员、制片厂和媒体等放映了三部全 AI 生成短片和一支 spec ad,反馈称作品成立。
Mistral AI 宣布与奥地利 Physics AI 公司 Emmi AI 达成最终收购协议,以加强面向工业企业的 AI 转型业务。Emmi AI 团队包括 30 多名研究人员和工程师,将于 5 月加入 Mistral AI 的 Science 和 Applied AI 团队,其大工程模型能力涵盖实时模拟、数字孪生等工程场景,应用于航空航天、汽车和半导体等领域。
Sayash Kapoor 等人分析 Google 在开发者大会上发布 Gemini 3.5 Flash 和 Antigravity 2.0 时宣称的智能体团队以单一提示词、约 916.92 美元 API 费用和 2.6B tokens 造出操作系统的实验。
推荐理由:文章逐条拆解 Google 智能体造操作系统的宣称,指出单一提示词等说法缺乏关键细节,并探讨开放世界评测需要的方法规范。
我们将把折扣永久化!🎉 尽情用 DeepSeek-V4-Pro 构建,让你的创新想法成为现实!🚀
The DeepSeek-V4-Pro discount has been extended until May 31, 2026, 15:59 UTC!
Dwarkesh Patel 发布与 MatX CEO Reiner Pope 的黑板讲解访谈,从逻辑门出发逐层构建出乘加电路、脉动阵列、时钟流水线和 FPGA 的 LUT 原理,并解释 GPU、TPU、FPGA 与人脑的设计差异。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型(modified MIT 许可),256k 上下文窗口,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,自托管最少只需四块 GPU,API 定价每百万输入 token $1.5、输出 token $7.5。
推荐理由:官方同步发布模型与云端异步智能体,给出基准分数、定价和开源权重,可对照评估其编码与长程任务能力。
Mistral 发布 Studio 的 Connectors(Public Preview),内置连接器和自定义 MCP 可通过 API/SDK 用于所有模型与 Agent 调用。
Sierra 已在多伦多开设办公室,目前约有十几名员工,客户数量持续增长。基于 Sierra 构建的 AI 智能体现已服务超过 40% 的 Fortune 50 企业,处理数十亿次客户交互。Singtel 上线用时 10 周,解决率超过 70%;Cigna 八周进入生产环境,患者身份验证时间缩短 80%。
Sayash Kapoor 撰文回应 Derek Thompson 认为AI异常性证明需要特别政府监管的观点,提出特别干预代价高昂,理由有三:基于预期伤害的预防性限制、将负担加在非直接致害的公司身上、绕过正常民主治理程序。
Runway 发布视频编辑模型 Aleph 2.0,并同步推出围绕其构建的 Edit Studio 应用。新模型支持编辑最长 30 秒的 1080p 视频,可做仅改动目标区域的局部编辑,用一帧编辑后的图像预览并控制最终效果,还能一次把改动应用到多个镜头。Edit Studio 面向营销团队、影视后期等场景,现已在所有 Runway 付费计划的桌面网页端开放。
推荐理由:原文给出了模型能力细节和开放范围,读者可以据此判断对现有视频素材二次加工工作流的影响。