ROMI:破解对抗式模型学习「过保守、训不稳」困局,ICLR 2026 论文提出离线强化学习新方法
GAIR Paper 105|离线强化学习新突破——ROMI:破解对抗式模型学习「过保守、训不稳」深层困局|ICLR 2026
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
香港城市大学、腾讯等机构研究者提出离线强化学习新方法 ROMI,通过鲁棒价值感知的模型学习与隐式可微自适应加权双层优化,解决 RAMBO 保守性难控、模型梯度更新易致梯度爆炸的问题。在 D4RL 与 NeoRL 基准上,ROMI 总得分 953.5,较 RAMBO 提升 18.6%,并在多数任务上达到或超越 SOTA。该论文已被 ICLR 2026 接收。
来源:AI科技评论 · 微信公众号 · mp.weixin.qq.com