跳到正文
@vista8· @vista8 · X·· 2026-05-15AI 评分15
AI 导读

大语言模型后训练技术 SFT、DPO、GRPO 的简单对比:SFT 让模型学会"听话",DPO 让模型输出更符合人类偏好,GRPO 进一步激发推理/思考能力。三者构成从基础指令遵循到偏好对齐再到推理能力强化的递进关系。

正文

大语言模型(LLM)后训练技术:SFT、DPO、GRRO的简单对比。

SFT(让模型学会"听话")

↓

DPO(让模型输出更符合人类偏好)

↓

GRPO(进一步激发推理/思考能力)

#一起学习

来源:@vista8 · x.com