SkillEvo:从多轮交互反馈中生成自更新进化梯度
SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
SkillEvo 提出用多轮用户模拟生成反馈梯度、并用独立治理层约束进化方向,解决现有 Agent Skills 进化在首轮修补后梯度衰减、多轮缺陷不可见而停滞的问题。在 6 类云服务、9 个生产 Skills 和 98 个 skill-reference 文件上,SkillEvo 比基于自我反思的进化高 23.0 分,比单轮 QA 驱动的进化高 15.4 分。
来源:Hugging Face Daily Papers · arxiv.org