Qwen-Drive-1.0:面向自动驾驶的视觉语言基础模型首步
Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
阅读原文
本站未展示全文,请前往来源网站阅读。
AI 导读
阿里发布 Qwen-Drive-1.0,一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,通过外部 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,并由规划专家生成未来自车轨迹。实验显示其在保持通用视觉语言能力的同时具备较强 3D 感知与驾驶场景理解,开环、伪闭环和闭环评测中运动规划表现具竞争力。
来源:Hugging Face Daily Papers · arxiv.org