GRPO Beyond English:非英语与多语言场景下 GRPO 的大规模研究
GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
一项大规模实证研究考察了 GRPO 在非英语和多语言场景下的表现,覆盖多种基座模型、训练语言和不同的推理语言奖励设置。研究发现,用母语进行推理训练与用英语推理训练之间的差距往往很小。
来源:Apple Machine Learning Research · machinelearning.apple.com