9月6日,阿里千问开源首个面向自动驾驶的视觉语言基础模型Qwen-Drive-1.0-4B,基于Qwen3.5-4B构建,预训练阶段统一3D感知与视觉问答,并扩展至运动规划。
该模型采用分阶段训练,结合驾驶监督与通用视觉语言数据,提供SFT和RL两个规划专家,在获得驾驶能力的同时保持通用视觉理解能力。
模型仅用公开数据构建规划样本并统一轨迹格式,经强化学习优化后,在人类偏好对齐和闭环安全性上显著提升,仅以微小开环误差为代价。
相关代码与模型已发布于GitHub、Hugging Face和ModelScope平台。
