跳到正文
Hugging Face Daily Papers·· 25 天前AI 评分40

MetroLLM-Bench:评估语言模型作为地铁自助终端运行时

MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

MetroLLM-Bench 发布,这是一个 955 例基准,用于测试语言模型作为地铁自助终端策略层的能力,覆盖六个真实地铁系统(37 至 414 站)和十一类任务。

来源:Hugging Face Daily Papers · arxiv.org