跳到正文
Hugging Face Daily Papers·· 21 天前AI 评分34

并非所有提示词都平等:面向多模态强化学习后训练的探索引导式提示词脚手架

Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者提出探索引导式提示词脚手架框架,在多模态大语言模型(MLLM)的在线强化学习后训练中动态调整训练提示词分布,核心是可直接由 on-policy rollout 统计计算的 Exploration Potential Score(EPS)。

来源:Hugging Face Daily Papers · arxiv.org