跳到正文
Hugging Face Blog·· 2026-08-19AI 评分57

ALTK-Evolve 实测八种模型后提出智能体记忆剂量应按模型能力校准

How Much Memory Does Your Agent Actually Need?

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

IBM 研究团队基于 ALTK-Evolve 在 AppWorld 585 个多步任务上评估八种模型,发现智能体记忆不是开关而是需要校准的剂量。强模型如 DeepSeek-V3.2 用全量指南集提升 +9.5pp,较弱模型 gpt-oss-120b 用精选检索只增加 5% token 就提升 +16.1pp,饱和模型 GLM-5 无可测增益,生产中可用 prompt caching 控制成本。

来源:Hugging Face Blog · huggingface.co