跳到正文
@karminski3· @karminski3 · X·· 24 天前AI 评分26
AI 导读

DeepSeek R1 论文 Section 3 显示,模型长思考时表现从 71.0% 飙升至 86.7%,并将长思维链蒸馏到 Qwen-1.5B、7B、14B 小模型,运行时给足思考预算后解题能力随思考长度正相关暴涨。当时 Ollama 把 deepseek-r1-distilled-qwen-7b 当作 deepseek 装到用户电脑上,号称运行 deepseek。

正文

请读完了Section 2后继续看Section 3 . 明确写了模型在长思考时的表现. 当时震撼人心的继续从71.0% 飙升到 86.7% 就是这么来的. 然后将 R1 生成的长思维链蒸馏到了小模型( Qwen-1.5B、7B、14B)。在运行时给足其思考预算,然后解题能力就呈现出与思考长度正相关的暴涨。这不就是去年的新闻嘛....怎么还能记不住呢....然后就ollama把deepseek-r1-distilled-qwen-7b 当deepseek给大家装到电脑上了, 美其名曰运行deepseek. 有印象没? 串起来了吧?

来源:@karminski3 · x.com