Q-Learning with Scalar Adjoint Matching:SQAM 如何高效微调流策略
Q-Learning with Scalar Adjoint Matching
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 Q-learning with Scalar Adjoint Matching(SQAM),通过闭式标量伴随将价值梯度按流时间缩放,消除了逐步的 vector-Jacobian 乘积计算。SQAM 在 OGBench 四个最难域上成功率超过最强基线 18 至 35 个百分点,并在真实双臂机器人的视觉-语言-动作策略微调中,三个任务均优于监督微调。
来源:Hugging Face Daily Papers · arxiv.org