跳到正文
Hugging Face Daily Papers·· 2026-08-18AI 评分50

临床多智能体系统被社会性捷径带偏,研究对比三类监督智能体

Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

一项研究在六个公开数据集、七个队列上测试临床决策多智能体委员会能否被捷径刷分,发现线索单独出现时 Gemini 委员会翻转率仅 5-16%,但两名同伴同时给出同一错误答案时,被测试智能体有 38% 的案例采纳。

来源:Hugging Face Daily Papers · arxiv.org