Liquid AI 用 Final Token Preference Optimization 减少推理模型“doom loop”重复退化
Reducing Doom Loops with Final Token Preference Optimization
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Liquid AI 提出 Antidoom 方法,基于 Final Token Preference Optimization(FTPO)定位循环起始 token,训练模型在该位置偏好连贯替代词,从而减少推理中的重复退化。在 LFM2.5-2.6B 早期 checkpoint 上,困难数学与代码提示的重复循环率从 10.2% 降至 1.4%,评测分数同步提升。
来源:Liquid AI 模型与工程博客 · liquid.ai