跳到正文
原文
Google Research·· 2026-04-03AI 评分40

Google Research 发布 LLM 行为倾向对齐评估框架,测试 25 个模型

Evaluating alignment of behavioral dispositions in LLMs

AI 导读

Google Research 提出一套基于情境判断测试(SJT)的框架,评估 LLM 在真实用户-助手场景中的行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。在人类标注完全一致的场景中,小于 120B 的模型与前沿闭源模型对齐度接近完美,但共识低于 90% 时对齐度停滞在 80% 出头。

来源:Google Research · research.google