低资源语言推理研究:SFT 能构建什么,RL 能修复什么,准确率看不到什么
Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究将三个前沿 MoE 模型(阿里、OpenAI、NVIDIA,各 3.6-4.0B 激活参数)微调为用低资源语言推理,发现准确率基准几乎无变化,仅改随机种子就能让分数波动 7.7 分。
来源:Hugging Face Daily Papers · arxiv.org