跳到正文
Hugging Face Daily Papers·· 2026-08-20AI 评分45

SkillGate:在长程智能体中训练策略内技能选择

SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

SkillGate 通过将 token 支持划分为两条互不重叠的信用通道——结果信用只到达执行 token,动作局部优势只到达技能命名 token——解决了长程智能体技能选择中的"选择器信用饥饿"问题。在 16 个候选技能的设定下,五个智能体基准测试中,SkillGate 将 9B 策略的试验成功率从 40.8% 提升至 53.2%,同时将误导性候选的暴露减少三分之二,并读取更少的技能。

来源:Hugging Face Daily Papers · arxiv.org