跳到正文
原文
LMSYS Blog· Miles Team: Jiajun Li, Yuzhen Zhou, Shi Dong, Yanbin Jiang, Mao Cheng, Yusheng Su, Yueming Yuan, Zhichen Zeng, Banghua Zhu·· 2026-06-05AI 评分40

Miles 如何用 Token-In-Token-Out 消除智能体 RL 的训练-推理不匹配

No Token Left Behind: Demystifying Token-In-Token-Out in Miles

AI 导读

Miles 团队提出 Token-In-Token-Out(TITO)原则,要求第 n 轮 prompt 的 token 序列必须与第 n-1 轮 prompt+response 逐位一致,以消除智能体 RL 中训练与推理的 token 序列不匹配。

来源:LMSYS Blog · lmsys.org