跳到正文

#安全/对齐

今日 2 条
今天10月2日周五
  1. IT Home43

    AI 伦理研究:DeepSeek V4-Flash 对男女一视同仁,Claude Sonnet 4.6 与 GPT-5.5 却区别对待

    一项 arXiv 预印本研究显示,在"为阻止核灾难是否可虐待个体"的假设情境中,DeepSeek 的 V4-Flash 对男女受虐场景均回应"同意",实现"零性别差距";而 Claude Sonnet 4.6 与 GPT-5.5 对女性受虐"强烈反对"、对男性受虐却"中等程度同意"。论文作者认为,这种差异可能源于训练数据中的社会刻板印象或对齐过程中对特定价值观的强化。

9月30日周三
  1. Hugging Face Daily Papers43

    让 AI 审稿人更可信:RobustReview 基准与 SciCore 审稿模型

    研究者提出"修辞鲁棒性"概念,并发布 RobustReview 基准,包含 1,260 个稿件版本,评测了 30 种审稿配置,发现低改写敏感度可能与跨论文评分崩塌并存的"虚假鲁棒性"。为此提出双分支审稿模型 SciCore,将全文判断与结构化科学核心判断取平均,在 GPT-5.5 对比中取得领先的稳定性-区分度表现,同时保持有竞争力的人类对齐度。

  2. Apple Machine Learning Research41

    LLM 条件控制中的有效性-流畅性权衡:一项系统性研究

    Apple 研究团队系统考察了 LLM 条件控制方法在概念注入与移除场景下的表现,发现高效激活引导方法往往以流畅性大幅下降为代价。研究还发现激活引导在指令微调模型上的效果远不如基座模型,而提示词与监督微调适合概念注入却不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关。

  3. Hugging Face Daily Papers55

    arXiv 论文:多智能体系统潜空间通信的安全风险与修复

    研究显示,多智能体系统的潜空间通信即使良性训练链接也会提高有害顺从度,而智能体本身的安全对齐未被改动。攻击者可通过在有害查询-响应对上优化链接、投毒训练数据或强化学习攻击放大该效应,在三种通信拓扑和四个安全基准上将平均有害顺从分从 27.9 提至 76.9;把奖励调整为更安全行为可修复被攻陷的链接,无需更新智能体。

9月29日周二
  1. Hugging Face Blog49

    Hugging Face 发布 ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 发布 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实真实但被归因到错误来源的问题。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在四项对比检查器中取得最高分。

  2. Hugging Face Daily Papers38

    NEEDLE:通过权重正交化移除 LLM 后门

    NEEDLE 提出一种无需训练的后门移除方法,在识别触发词后,通过激活向量估计后门方向和拒绝子空间,并应用顺序权重正交化来抑制后门,同时防止拒绝相关表征发生变化。该方法无需干净参考模型或原始中毒训练数据。在多个模型家族和攻击类型上的评估中,NEEDLE 取得了最低的平均攻击成功率(ASR),在具有挑战性的代码注入攻击上达到 0%,且 KL 散度最低,能力和安全性变化最小。

  3. Hugging Face Daily Papers33

    CorrGRPO:面向多奖励学习的相关性归一化 GRPO

    CorrGRPO 提出将 GRPO 中成对奖励协方差归一化为皮尔逊相关系数,在不改变中心化总奖励的前提下,平衡不同尺度奖励对归一化的影响,避免大尺度奖励主导优势值计算。研究者在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数的模型进行对比,结果显示 CorrGRPO 在三项任务上均优于 GRPO 及其他变体。代码已开源。

  4. Hugging Face Daily Papers42

    针对黑盒 LLM 的受控解码攻击

    研究者提出受控解码攻击框架,可在仅返回采样文本的黑盒 LLM 接口上绕过安全对齐。该方法通过采样分布重建、风险门控残差控制和推测式多 token 执行,将采样成本集中在少数关键位置。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。

9月28日周一
9月26日周六
  1. Hugging Face Daily Papers40

    BiasReducer:面向奖励模型的自适应偏见缓解框架

    BiasReducer 通过只编辑奖励模型的线性奖励头,自动识别并削弱模型对长度、自信度等表层属性的依赖,无需重新训练。在五个奖励模型上,BiasReducer-M 将三项基准平均提升 8.3、18.0 和 6.9 个百分点,优于两个基于训练的基线。该增益可迁移至下游,减少冗余冗长与谄媚,同时保持相当的评判质量。

9月10日周四
  1. Anthropic Research74

    Anthropic 红队发布 AI 模型战术情报定位与常规武器能力评测报告

    Anthropic 前沿红队发布新评测,测量模型在战术情报定位(基于碎片信息找人)和常规武器开发(如编写无人机制导软件)上的能力,显示部分任务上模型能做到过去只有稀缺专家才能做的事。

    推荐理由:原文用自建评测给出模型在情报定位和武器开发任务上的具体表现与模型间差距,读者可据此理解这类双用途能力的分布。

9月9日周三
  1. Anthropic Research81

    Anthropic 发布四起 Claude 网络安全评测中误连真实互联网事件的对齐评估

    Anthropic 评估四起 Claude 在网络安全评测中因环境配置错误接入真实互联网的事件,涉及 Claude Opus 4.6 早期版本、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共 7 次运行。

    推荐理由:Anthropic 公开四起 Claude 在网络安全评测中接入真实互联网的事件,并给出有偏推理与鲁莽两类对齐问题的实证分析。

9月7日周一
7月27日周一
6月22日周一
6月11日周四
6月8日周一
4月3日周五
  1. Google Research40

    Google Research 发布 LLM 行为倾向对齐评估框架,测试 25 个模型

    Google Research 提出一套基于情境判断测试(SJT)的框架,评估 LLM 在真实用户-助手场景中的行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。在人类标注完全一致的场景中,小于 120B 的模型与前沿闭源模型对齐度接近完美,但共识低于 90% 时对齐度停滞在 80% 出头。

3月13日周五
  1. Berkeley AI Research45

    伯克利 AI 研究提出 SPEX 与 ProxySPEX:为 LLM 大规模识别关键交互

    伯克利 AI 研究提出 SPEX 与 ProxySPEX 算法,用于在大规模 LLM 中识别驱动模型输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,而 LIME、Banzhaf 等边际方法忠实度明显更低。