PACE-Bench:在动态环境中通过代码演化评测物理适应能力
PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
PACE-Bench 是一个基于模拟器的基准,包含六个物理领域的 144 个源到目标适应对,用于测试智能体在环境条件改变后能否通过代码迭代恢复。评测显示 Reflexion + Qwen3-14B 仅解决 35.9% 的完整基准对,GPT-5.5 在完整预算下解决 Statics 子集的 66.7%。结果表明基于模拟器的反思比未经验证的自我修正更可靠,而机制重设计而非参数推断才是核心瓶颈。
来源:Hugging Face Daily Papers · arxiv.org