当智能体慢下来:通过 Elo-per-token 分析理解 LLM 智能体的测试时策略
When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究提出 Elo-per-token 分析,追踪每个 token 预算下找到的最优解,并用 Bradley-Terry 模型将任务内排序聚合为跨任务的 Elo 评分。
来源:Hugging Face Daily Papers · arxiv.org