跳到正文
Hugging Face Daily Papers·· 1 天前AI 评分43

Learn2Play Bench:LLM 智能体在陌生环境中从经验学习的效果如何?

Learn2Play Bench: How Well Do LLM Agents Learn from Experience in Unfamiliar Environments?

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者推出 Learn2Play Bench,用规则新颖或反直觉的文本游戏评测 LLM 智能体从交互经验中学习的能力,并提供可复现反馈与自动评分。评测发现:完整保留动作与反馈记录比总结成规则更利于学习;顶尖人类玩家峰值分数高于受测智能体;固定骨干模型时更换 harness 可提升表现并降低推理成本。

来源:Hugging Face Daily Papers · arxiv.org