跳到正文
Apple Machine Learning Research·· 21 天前AI 评分35

价值诱导如何重塑 LLM 行为

How Value Induction Reshapes LLM Behaviour

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

对话式大语言模型在后期训练中会学习好奇心、开放心态、共情等行为特质,以及有用性、无害性、诚实等价值。但价值之间复杂且相互关联,诱导某一价值可能改变模型在其他价值上的行为,甚至通过生成语言让模型更具成瘾性或谄媚倾向。

来源:Apple Machine Learning Research · machinelearning.apple.com