阿里千问开源自动驾驶视觉语言模型Qwen-Drive-1.0-4B

作者:作者:沁沧(实习) 发布时间:2026-09-07 06:09:40 浏览:11
阿里千问开源首个面向自动驾驶的视觉语言基础模型Qwen-Drive-1.0-4B,统一3D感知与运动规划,提升驾驶安全与交互能力。

9月6日,阿里千问开源首个面向自动驾驶的视觉语言基础模型Qwen-Drive-1.0-4B,基于Qwen3.5-4B构建,预训练阶段统一3D感知与视觉问答,并扩展至运动规划。

该模型采用分阶段训练,结合驾驶监督与通用视觉语言数据,提供SFT和RL两个规划专家,在获得驾驶能力的同时保持通用视觉理解能力。

模型仅用公开数据构建规划样本并统一轨迹格式,经强化学习优化后,在人类偏好对齐和闭环安全性上显著提升,仅以微小开环误差为代价。

相关代码与模型已发布于GitHub、Hugging Face和ModelScope平台。

阅读原文