跳到正文
Apple Machine Learning Research·· 2026-08-06AI 评分38

DeepAmbigQA:用于评测 LLM 答案完整性的歧义多跳问答基准

DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Apple 提出 DeepAmbigQA,一个面向 LLM 答案完整性的歧义多跳问答基准,并配套自动数据生成流水线 DEEPAMBIGQAGEN。该基准针对"《Heat》中哪位演员拿过至少一座奥斯卡奖"这类问题,同时考察同名作品区分与跨大量演员的推理整合能力,而现有 QA 基准很少联合评测这两项挑战。

来源:Apple Machine Learning Research · machinelearning.apple.com