跳到正文
Hugging Face Daily Papers·· 2026-08-28AI 评分42

TTPO:测试时策略优化,无需标签即可提升 LLM 数学推理

TTPO: Test-Time Policy Optimization

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出 Test-Time Policy Optimization(TTPO),一种非对称目标:对与伪标签一致的 rollout 用 OPSD 蒸馏,对不一致的 rollout 用 Grouped RL 惩罚,从而在无标签条件下实现测试时训练。

来源:Hugging Face Daily Papers · arxiv.org