跳到正文
量子位 · 微信公众号·· 2026-06-27AI 评分48

vivo 提出半在线 RL 框架 SOLAR-RL,仅 15k 轨迹稳定训练手机 GUI 智能体

长链路手机AI训练总崩盘?vivo全新半在线RL,仅15k轨迹稳定收敛

阅读原文

本站未展示全文,请前往来源网站阅读。

AI 导读

vivo AI Lab 联合之江实验室、中国科学院大学杭州高等研究院提出半在线强化学习框架 SOLAR-RL,以 Qwen2.5-VL-7B-Instruct 为基座、仅用 15k 条静态轨迹训练,在 AndroidWorld 上取得 33.7%SR,超过使用 145k 轨迹的在线方法 UI-TARS-7B-SFT(33.3%)。

来源:量子位 · 微信公众号 · mp.weixin.qq.com