跳到正文
Hugging Face Daily Papers·· 21 天前AI 评分48

LLaDA-UI:将块级扩散引入视觉语言 GUI 智能体

LLaDA-UI: Bringing Block-wise Diffusion to Vision-Language GUI Agents

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

LLaDA-UI 是一个 16.7B 参数的 MoE 块级扩散视觉语言 GUI 智能体,采用两阶段训练:先以通用多模态预训练对齐原生分辨率视觉编码器与 LLaDA2.0-mini-base 扩散语言骨干,再在移动、桌面、Web 与 grounding 数据上做 GUI 智能体监督微调。

来源:Hugging Face Daily Papers · arxiv.org