Amazon 发布 PatientAgentBench 评估面向患者的医疗 AI 智能体
A new benchmark for evaluating patient-facing health AI agents
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Amazon 发布 PatientAgentBench,一个可复现、经临床医生审核的医疗 AI 智能体评估基准,框架已在 GitHub 开源。基准动态生成合成病历与场景,用 100 多项临床审核准则按临床安全、分诊质量等六个维度由 LLM 陪审团评分。实验发现,即使前沿模型也难以达标,失败集中在遗漏危机资源和编造临床信息,常规行政请求比明显急症更易暴露风险。
来源:Amazon Science · amazon.science