跳到正文
Hugging Face Daily Papers·· 2026-08-20AI 评分50

Co-RL:多模型协作强化学习让无监督推理能力涌现

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

Co-RL 提出一种协作式多智能体强化学习框架,让多个不共享参数的模型用同伴给出的奖励同时优化,在完全不用标注数据的情况下提升推理能力。该框架在七个纯文本基准上平均提升 3.0-8.6%,在四个多模态基准上提升 2.3-7.2%,可匹配或超过有监督方法。

来源:Hugging Face Daily Papers · arxiv.org