Ling-RCCA-Flash:面向强化学习的 Rubric-to-Code 信用分配框架
Rubric-to-Code Credit Assignment for Reinforcement Learning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出 Rubric-to-Code Credit Assignment(RCCA)强化学习框架,将评分标准级功能反馈转化为代码上的局部优化信号,通过分层奖励区分格式、源码、运行时和功能失败。
来源:Hugging Face Daily Papers · arxiv.org