跳到正文
原文
Hugging Face Daily Papers·· 4 天前AI 评分33

APPL:用智能体先验引导策略学习,打通技能泛化与组合

Agent Priors-guided Policy Learning

AI 导读

研究提出 Agent Priors-guided Policy Learning(APPL),把每个策略的结构先验同时用作训练约束与组合接口:构建智能体将完整演示切分为可复用技能,为每个技能提出多个结构先验并各训练、验证一个策略,运行时智能体再按先验接口选择并组合这些策略。

来源:Hugging Face Daily Papers · arxiv.org