跳到正文
原文
Hugging Face Blog·· 29 天前精选AI 评分65

用 TRL 和 GRPO 微调 LFM2.5-350M,100 步提升 IFStruct 结构化输出成绩

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

AI 导读

Hugging Face 发布一份完整教程,用 TRL 库的 GRPO 微调 LiquidAI/LFM2.5-350M 提升结构化输出合规性,在 IFStruct benchmark 上从 22.6% 提升到 29.7%。

推荐理由

原文给出完整可复现的 GRPO 微调流程和前后对比数据,读者可以照着用免费 GPU 把小模型的结构化输出提升约 7 个百分点。

来源:Hugging Face Blog · huggingface.co