跳到正文
Hugging Face Daily Papers·· 2026-09-03AI 评分40

CoGR:用强化学习让生成式检索器查询侧与物品侧协同进化

It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

CoGR 是一个让 LLM 在查询侧和物品侧直接生成关键词表示的检索框架,关键词通过倒排索引匹配,兼容现有检索基础设施。它采用两阶段训练:先监督微调建立对齐的关键词空间,再用 GRPO 交替优化两侧生成器,物品侧使用反事实边际奖励。在内部 APP Marketplace 数据集和公开 WANDS 基准上,CoGR 的 F1 分别比最强基线提升 10.9% 和 36.1%。

来源:Hugging Face Daily Papers · arxiv.org