Miles 如何用 Token-In-Token-Out 消除智能体 RL 的训练-推理不匹配
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求第 n 轮 prompt 的 token 序列必须与第 n-1 轮 prompt+response 逐位一致,以消除智能体 RL 中训练与推理的 token 序列不匹配。
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求第 n 轮 prompt 的 token 序列必须与第 n-1 轮 prompt+response 逐位一致,以消除智能体 RL 中训练与推理的 token 序列不匹配。
Microsoft AI 发布七款新 MAI 模型,将上线 Foundry、OpenRouter、Fireworks 和 Baseten,并首次允许开发者自行微调模型权重。
推荐理由:官方完整说明了模型开放方式、Frontier Tuning 效率数据和医疗合作安排,读者可以据此评估其模型路线与可调性。
Import AI 第459期:一篇论文估算美国AI经济2025年名义规模约2500亿美元、质量调整产出年增约2600%,但常规GDP统计难以体现;UK AI Security Institute论文说明自动化对齐研究的错误比人类基线更难识别,并给出测量与红队等干预建议。
Import AI 457 聚焦三项研究:SentinelOne 拆解出约 20 年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果来破坏科研与工程计算。
SGLang 为 RL 工作负载引入基于 RDMA 的 P2P 权重更新机制,通过 Mooncake TransferEngine 传输,将 1T 参数 Kimi-K2 的权重传输从 53 秒缩短至 7.2 秒,提速 7 倍,代价是每个训练 rank 额外占用 32G CPU 内存的推理引擎副本。
Google DeepMind 发布 Decoupled DiLoCo(分布式低通信)训练架构,将训练拆分为异步的算力孤岛,硬件故障被隔离后其余部分可继续学习。
Google Research 发布压缩算法 TurboQuant,可在零精度损失下大幅压缩模型,兼顾 KV cache 压缩与向量搜索,将亮相 ICLR 2026。
Mistral AI 推出 Forge,一套让企业基于自有专有知识训练前沿级 AI 模型的系统,支持预训练、后训练与强化学习全流程。Forge 同时支持 dense 与 MoE 架构,并可处理多模态输入,模型可在企业自有基础设施内训练与治理。该平台以智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数并生成合成数据。
Miles 开源强化学习框架现已支持 ROCm,可在 AMD Instinct MI300/350 系列 GPU 上原生运行大规模 RL 后训练。该框架基于 SGLang 和 Slime 生态,支持 GRPO/PPO、Ray 编排及 Megatron-LM 集成,并提供预构建容器。
Microsoft AI 分析 2026 年 1 月超过 50 万条 Copilot 健康与 wellbeing 相关对话,发现近 1/5 对话涉及用户描述自身症状、解读检查结果或管理病情,约 40% 的问题聚焦症状、疾病和治疗信息。
SGLang RL 团队联合 InfiXAI、蚂蚁集团等团队,在 slime 框架上落地了 INT4 QAT 端到端方案,训练用 fake quantization、推理用 W4A16,实现与 BF16 全精度相当的训练-推理一致性。
Mistral 用 LoRA 微调 Pixtral-12B 处理卫星图像,在 Aerial Image Dataset(AID)上显著优于基座模型。基座模型在 Playground 与 Stadium 等模糊类别上易混淆,甚至幻觉出不存在的类别名,微调后分类更准确。微调通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优。
Sayash Kapoor 在 AI as Normal Technology 框架下撰文指出,科学论文产出指数级增长但实际进步停滞甚至放缓,AI 很可能加剧这一生产-进步悖论。