跳到正文
Hugging Face Daily Papers·· 2026-09-01AI 评分43

EvoGenUI-Bench:评估 LLM 作为多轮生成式 UI 助手

EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

研究者推出 EvoGenUI-Bench,用于评估 LLM 在多轮生成式 UI 任务中维护可执行界面的能力,包含 150 个五轮任务、共 750 轮,覆盖信息呈现、可执行交互和工具接地外部状态三类场景。

来源:Hugging Face Daily Papers · arxiv.org