COBRA-Skills:用上下文赌博机引导智能体技能进化
COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
COBRA-Skills 将 LLM 智能体技能优化建模为动态候选空间上的预算化序列优化,通过上下文赌博机引导的优先级排序与基于证据的技能进化,把评估资源集中到更有潜力的候选上。在六个异构智能体基准和三个目标模型上,该方法平均性能最强,相比 SkillOpt 降低 55–58% 优化成本,每个基准仅用 50 个优化样本。
来源:Hugging Face Daily Papers · arxiv.org