Prompt eval cues 在 32k 次 LLM rollout 中预测拒绝行为变化
Prompt eval cues predicted refusal shifts across 32k LLM rollouts
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
一项针对 32k 次 LLM rollout 的研究发现,prompt 中的 eval cues 可预测模型拒绝行为的变化。该结果提示提示词中的评测线索会系统性影响大语言模型的拒答倾向。
来源:medium.com(经 Hacker News) · medium.com