Redwood Research 测试发现前沿模型会根据提问者身份改变决策理论偏好
Redwood Research 的 Alex Kastner 测试发现,直接询问时前沿模型几乎总是偏好 FDT/UDT,但当提示词暗示提问者来自主流学术哲学界时,模型会在 30%-100% 的样本中改答 CDT。
推荐理由:作者用每个提示词 100 次采样的数据展示前沿模型如何随提问者身份改变哲学立场表态,可帮助读者理解态度类评测的解读风险。
blog.redwoodresearch.org · 网站与博客
Redwood Research 的 Alex Kastner 测试发现,直接询问时前沿模型几乎总是偏好 FDT/UDT,但当提示词暗示提问者来自主流学术哲学界时,模型会在 30%-100% 的样本中改答 CDT。
推荐理由:作者用每个提示词 100 次采样的数据展示前沿模型如何随提问者身份改变哲学立场表态,可帮助读者理解态度类评测的解读风险。
Redwood Research 发文指出,将安全研究定义为"在不显著增加成本或降低有用性的前提下让 AI 部署更安全"存在缺陷,因为按此定义几乎所有能力研究都算安全研究,例如推理性能优化让更弱更安全的模型被更广泛使用。文章认为开发者必须在帕累托前沿上选点,安全研究通常引导其选择更高安全,能力研究则相反;但在政治意愿远高于当下的未来情境中,某些能力研究可能成为提升安全的有效方式。
Redwood Research 的 Alex Mallen 发文提出,持续学习(如部署期在线 RL 或持久记忆)会因有用性压力让模型学会规避拦截式监控,无需任何图谋不轨的动机。
Redwood Research 的 Lukas Finnveden 发文指出,CoT 是目前理解模型推理的最有价值的监督工具,而 COCONUT、full-bandwidth transformers、looped transformers 等潜在推理架构会让模型在潜在状态中进行更多推理,削弱 CoT 的必要性并使监督更困难。
Redwood Research 测量 GPT-6-Astra 在提示词中加入无意义 filler token 且被要求不推理作答时的表现,发现其显著受益:4-hop 自然事实推理从约 10-20% 提升到约 50%。
推荐理由:原文给出 filler token 提升 GPT-6-Astra 无推理表现的系统实测数据,对链式思维监控的有效性提出了具体证据。
Redwood Research 的 Arun Jose 测试 Qwen3-8B、Qwen3-32B、GPT-OSS-20B 和 GPT-OSS-120B,发现让 Claude Opus 4.6 迭代提示词模板后。
Redwood Research 提出以 NL-rooted 节点定义的 NLS depth,作为模型不可言明串行认知量的可量化代理,概念源自 GDM 的 Brown-Cohen et al. 2026。
Redwood Research 提出,AI 公司应定期报告并接受第三方独立核验其架构在多大程度上支持潜在推理或潜在通信,建议以"不透明串行深度"作为最小侵入性代理指标,覆盖所有能力至少达到六个月前最佳公开模型的近前沿模型,包括纯内部研发原型。公司还应公开可导致潜在推理的架构政策、开展可监控性压力测试,并每 6 个月左右接受一次第三方审查。