TTPO:测试时策略优化,无需标签即可提升 LLM 数学推理
TTPO: Test-Time Policy Optimization
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 Test-Time Policy Optimization(TTPO),一种非对称目标:对与伪标签一致的 rollout 用 OPSD 蒸馏,对不一致的 rollout 用 Grouped RL 惩罚,从而在无标签条件下实现测试时训练。
来源:Hugging Face Daily Papers · arxiv.org