跳到正文
Apple Machine Learning Research·· 2026-08-18AI 评分36

GRPO Beyond English:非英语与多语言场景下 GRPO 的大规模研究

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

一项大规模实证研究考察了 GRPO 在非英语和多语言场景下的表现,覆盖多种基座模型、训练语言和不同的推理语言奖励设置。研究发现,用母语进行推理训练与用英语推理训练之间的差距往往很小。

来源:Apple Machine Learning Research · machinelearning.apple.com