智谱开源强化学习后训练框架 slime,GLM-5.2 后训练约两天完成
太狠了,智谱把GLM-5.2的炼丹炉直接开源了,Fable 5级别的开源模型很快可能达到
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
智谱开源其内部使用的强化学习训练框架 slime,GLM-5.2 的 OPD 后训练在该平台上约用 2 天完成。slime 通过连接 Megatron 与 SGLang 做高性能训练,并提供自定义数据生成接口,官方称其是 GLM-5.2、GLM-5.1、GLM-5、GLM-4.7 等模型背后的 RL 训练框架。
来源:AI寒武纪 · 微信公众号 · mp.weixin.qq.com