EvoGenUI-Bench:评估 LLM 作为多轮生成式 UI 助手
EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
研究者推出 EvoGenUI-Bench,用于评估 LLM 在多轮生成式 UI 任务中维护可执行界面的能力,包含 150 个五轮任务、共 750 轮,覆盖信息呈现、可执行交互和工具接地外部状态三类场景。
来源:Hugging Face Daily Papers · arxiv.org