Sherpa:让 LLM 学会自适应教学
Sherpa: Teaching LLMs to Teach Adaptively
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
多轮强化学习框架 Sherpa 通过构建多种具有不同学习偏好的学生原型,训练教师模型直接最大化学生学习效果,使其在所有原型上的学生表现平均提升 20.5 个百分点。在 MathTutorBench 评测中,Sherpa 将整体教学法得分从 52.5% 提升至 79.2%;人类研究中,训练后的教师模型在 79.6% 的成对比较中优于基座模型。代码与模型已公开。
来源:Hugging Face Daily Papers · arxiv.org