vivo 提出半在线 RL 框架 SOLAR-RL,仅 15k 轨迹稳定训练手机 GUI 智能体
长链路手机AI训练总崩盘?vivo全新半在线RL,仅15k轨迹稳定收敛
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
vivo AI Lab 联合之江实验室、中国科学院大学杭州高等研究院提出半在线强化学习框架 SOLAR-RL,以 Qwen2.5-VL-7B-Instruct 为基座、仅用 15k 条静态轨迹训练,在 AndroidWorld 上取得 33.7%SR,超过使用 145k 轨迹的在线方法 UI-TARS-7B-SFT(33.3%)。
来源:量子位 · 微信公众号 · mp.weixin.qq.com