Redwood Research:CoTControl 评测存在严重欠激发,优化提示词可将开源模型成绩提升 2-3 倍
CoT controllability evals seem very under-elicited
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Redwood Research 的 Arun Jose 测试 Qwen3-8B、Qwen3-32B、GPT-OSS-20B 和 GPT-OSS-120B,发现让 Claude Opus 4.6 迭代提示词模板后。
来源:Redwood Research Blog · blog.redwoodresearch.org