跳到正文
Hugging Face Daily Papers·· 2026-08-21AI 评分45

低资源语言推理研究:SFT 能构建什么,RL 能修复什么,准确率看不到什么

Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究将三个前沿 MoE 模型(阿里、OpenAI、NVIDIA,各 3.6-4.0B 激活参数)微调为用低资源语言推理,发现准确率基准几乎无变化,仅改随机种子就能让分数波动 7.7 分。

来源:Hugging Face Daily Papers · arxiv.org