跳到正文
Hugging Face Daily Papers·· 4 天前AI 评分42

高效推理训练并不总是损害 CoT 忠实性与可监控性

Efficient Reasoning Training Does Not Always Harm CoT Faithfulness and Monitorability

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究用固定生成预算、单样本长度目标和组相对长度奖励三种方式对多种模型进行微调,发现高效推理训练对 CoT 忠实性和可监控性的影响不同:忠实性在多数设置下下降,主要因为模型一致性变差;可监控性更稳健,即使 CoT 大幅缩短,模型仍会承认输入干预对答案的影响。

来源:Hugging Face Daily Papers · arxiv.org