MInTRL:离线策略干预如何提升在线策略强化学习
MInTRL: Off-policy Intervention can boost On-policy RL
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 Minimal Intervention Reinforcement Learning(MInTRL),通过在在线策略 rollout 中周期性插入稀疏局部修正来扩展探索边界,训练时采用序列级优势回归目标,无需重要性采样。在数学与代码基准上,MInTRL 持续优于标准在线策略与离线策略基线;消融显示自干预和不同 judge 策略下仍有效,且性能在中等干预强度时达到峰值。
来源:Hugging Face Daily Papers · arxiv.org