跳到正文
Hugging Face Daily Papers·· 2026-08-18AI 评分42

PACE-Bench:在动态环境中通过代码演化评测物理适应能力

PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

PACE-Bench 是一个基于模拟器的基准,包含六个物理领域的 144 个源到目标适应对,用于测试智能体在环境条件改变后能否通过代码迭代恢复。评测显示 Reflexion + Qwen3-14B 仅解决 35.9% 的完整基准对,GPT-5.5 在完整预算下解决 Statics 子集的 66.7%。结果表明基于模拟器的反思比未经验证的自我修正更可靠,而机制重设计而非参数推断才是核心瓶颈。

来源:Hugging Face Daily Papers · arxiv.org