跳到正文
Hugging Face Daily Papers·· 2026-08-20AI 评分45

SPADE:在自适应合成可执行环境中的自博弈框架

SPADE: Self-Play in Adaptive Synthetic Executable Environments

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

SPADE 是一个自博弈强化学习框架,让单个 LLM 同时扮演环境设计者和推理智能体,环境设计者以可执行代码形式编写带 reset()/step() 接口的长时程训练环境。扩展到 30B 参数模型时,SPADE 在八个数学、科学、代码与推理基准上平均超过最强固定环境基线 +5.3,BFCL-v4 多轮提升 +5.7,ACEBench-Agent 提升 +13.9。

来源:Hugging Face Daily Papers · arxiv.org