基于检索的开放式评估在哪里失败?从长篇医学答案事实性验证自动归纳分类体系
Where Does Retrieval-Based Open-Ended Evaluation Fail? Automatic Taxonomy Induction from Long-Form Medical Answer Factuality Verification
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究针对基于检索的医学事实性评估,基于 MedExpert 开放式数据集和 3 个封闭式数据集构建了两套分类体系,将失败拆解为检索阶段五个质量维度的错误与验证器推理的六个连续步骤。团队用 LLM-as-Judge 自动归纳模式,在 4 种检索方法和 6 个前沿验证模型上压力测试,发现扩大模型规模、增加推理投入、扩展权威网络来源和医学微调均无法消除这些失败模式。
来源:Hugging Face Daily Papers · arxiv.org