跳到正文
原文
Google Research·· 17 天前AI 评分43

Google Research 提出 Retrieve-for-Train:用 RL 编译扩散模型绕过推理瓶颈

Bypassing inference bottlenecks: Accelerating complex AI search with Retrieve-for-Train

AI 导读

Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现单次非自回归的查询扇出,无需推理时的 CoT 思考 token。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,旨在解决零样本 LLM 在数据库感知查询分解中的复述坍缩与自回归延迟瓶颈。

来源:Google Research · research.google