LLaDA-UI:将块级扩散引入视觉语言 GUI 智能体
LLaDA-UI: Bringing Block-wise Diffusion to Vision-Language GUI Agents
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
LLaDA-UI 是一个 16.7B 参数的 MoE 块级扩散视觉语言 GUI 智能体,采用两阶段训练:先以通用多模态预训练对齐原生分辨率视觉编码器与 LLaDA2.0-mini-base 扩散语言骨干,再在移动、桌面、Web 与 grounding 数据上做 GUI 智能体监督微调。
来源:Hugging Face Daily Papers · arxiv.org