并非所有提示词都平等:面向多模态强化学习后训练的探索引导式提示词脚手架
Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出探索引导式提示词脚手架框架,在多模态大语言模型(MLLM)的在线强化学习后训练中动态调整训练提示词分布,核心是可直接由 on-policy rollout 统计计算的 Exploration Potential Score(EPS)。
来源:Hugging Face Daily Papers · arxiv.org