CoGR:用强化学习让生成式检索器查询侧与物品侧协同进化
It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
CoGR 是一个让 LLM 在查询侧和物品侧直接生成关键词表示的检索框架,关键词通过倒排索引匹配,兼容现有检索基础设施。它采用两阶段训练:先监督微调建立对齐的关键词空间,再用 GRPO 交替优化两侧生成器,物品侧使用反事实边际奖励。在内部 APP Marketplace 数据集和公开 WANDS 基准上,CoGR 的 F1 分别比最强基线提升 10.9% 和 36.1%。
来源:Hugging Face Daily Papers · arxiv.org