LMSYS Blog· Miles Team: Jiajun Li, Yuzhen Zhou, Shi Dong, Yanbin Jiang, Mao Cheng, Yusheng Su, Yueming Yuan, Zhichen Zeng, Banghua Zhu·· 2026-06-05AI 评分40
Miles 如何用 Token-In-Token-Out 消除智能体 RL 的训练-推理不匹配
No Token Left Behind: Demystifying Token-In-Token-Out in Miles
AI 导读
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求第 n 轮 prompt 的 token 序列必须与第 n-1 轮 prompt+response 逐位一致,以消除智能体 RL 中训练与推理的 token 序列不匹配。
来源:LMSYS Blog · lmsys.org