SkillGate:在长程智能体中训练策略内技能选择
SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
SkillGate 通过将 token 支持划分为两条互不重叠的信用通道——结果信用只到达执行 token,动作局部优势只到达技能命名 token——解决了长程智能体技能选择中的"选择器信用饥饿"问题。在 16 个候选技能的设定下,五个智能体基准测试中,SkillGate 将 9B 策略的试验成功率从 40.8% 提升至 53.2%,同时将误导性候选的暴露减少三分之二,并读取更少的技能。
来源:Hugging Face Daily Papers · arxiv.org