高效推理训练并不总是损害 CoT 忠实性与可监控性
Efficient Reasoning Training Does Not Always Harm CoT Faithfulness and Monitorability
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究用固定生成预算、单样本长度目标和组相对长度奖励三种方式对多种模型进行微调,发现高效推理训练对 CoT 忠实性和可监控性的影响不同:忠实性在多数设置下下降,主要因为模型一致性变差;可监控性更稳健,即使 CoT 大幅缩短,模型仍会承认输入干预对答案的影响。
来源:Hugging Face Daily Papers · arxiv.org