MetroLLM-Bench:评估语言模型作为地铁自助终端运行时
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
MetroLLM-Bench 发布,这是一个 955 例基准,用于测试语言模型作为地铁自助终端策略层的能力,覆盖六个真实地铁系统(37 至 414 站)和十一类任务。
来源:Hugging Face Daily Papers · arxiv.org