跳到正文
Hugging Face Daily Papers·· 22 天前AI 评分38

COBRA-Skills:用上下文赌博机引导智能体技能进化

COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

COBRA-Skills 将 LLM 智能体技能优化建模为动态候选空间上的预算化序列优化,通过上下文赌博机引导的优先级排序与基于证据的技能进化,把评估资源集中到更有潜力的候选上。在六个异构智能体基准和三个目标模型上,该方法平均性能最强,相比 SkillOpt 降低 55–58% 优化成本,每个基准仅用 50 个优化样本。

来源:Hugging Face Daily Papers · arxiv.org