Hugging Face Daily Papers·· 4 天前AI 评分33
APPL:用智能体先验引导策略学习,打通技能泛化与组合
Agent Priors-guided Policy Learning
AI 导读
研究提出 Agent Priors-guided Policy Learning(APPL),把每个策略的结构先验同时用作训练约束与组合接口:构建智能体将完整演示切分为可复用技能,为每个技能提出多个结构先验并各训练、验证一个策略,运行时智能体再按先验接口选择并组合这些策略。
来源:Hugging Face Daily Papers · arxiv.org