FEEs:用反馈增强环境引导 Qwen3 智能体自进化
Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者提出反馈增强环境(FEEs),将智能体训练从"智能体侧预热"转向"环境侧适配",通过在回合内探索与回合间演化后期从动作引导转为观测增强来缓解长程任务的奖励稀疏问题。在 SciWorld 和 BFCL 基准上,FEEs 配合 Qwen3 各规模模型及 GRPO、GSPO、DAPO 等 RL 算法均稳定优于标准设置,并能降低熵波动、促进状态空间探索,使环境引导内化进策略权重。
来源:Hugging Face Daily Papers · arxiv.org