DeepAmbigQA:用于评测 LLM 答案完整性的歧义多跳问答基准
DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
Apple 提出 DeepAmbigQA,一个面向 LLM 答案完整性的歧义多跳问答基准,并配套自动数据生成流水线 DEEPAMBIGQAGEN。该基准针对"《Heat》中哪位演员拿过至少一座奥斯卡奖"这类问题,同时考察同名作品区分与跨大量演员的推理整合能力,而现有 QA 基准很少联合评测这两项挑战。
来源:Apple Machine Learning Research · machinelearning.apple.com