Hugging Face Daily Papers·· 2 天前AI 评分37
DexPolicy:面向轨迹引导灵巧操作的调度式探索
DexPolicy: Scheduled Exploration for Trajectory-Guided Dexterous Manipulation
AI 导读
DexPolicy 将强化学习的探索尺度设为训练步数的显式函数,从宽到窄退火,在 ViViDex 等轨迹引导的灵巧操作任务中提升确定性 Target 成功率。在五个 YCB 物体、三个随机种子上,FPO 的平均成功率从 49.4% 升至 68.1%,GRPO 从 14.1% 升至 45.4%,PPO 从 32.0% 升至 35.7%。
来源:Hugging Face Daily Papers · arxiv.org