Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation… — HuggingFace Daily — TG.ME

"Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving" by Xin Zhou , Zongchuang Zhao , Zhibo Yang , Mingsheng Li , Humen Zhong , Shuai Bai , Du Chu , Ruizhe Chen , Zhaohai Li , Jun Tang , Qiuyue Wang , Mingkun Yang , Jiazhao Zhang , Dayiheng Liu , Dingkang Liang , Xiang Bai

TLDR:
Qwen-Drive-1.0 is a vision-language foundation model for autonomous driving that combines 3D perception, visual question answering, and motion planning through shared representations and staged training. The model integrates a bird's-eye-view perception head to detect objects and predict scene occupancy, while a Planning Expert generates future driving trajectories. By leveraging a pretrained vision-language model, Qwen-Drive-1.0 acquires driving-specific competence while maintaining general visual understanding and instruction-following capabilities. Experiment results indicate strong 3D perception and driving scene understanding, as well as competitive motion-planning performance across various settings.

Read Paper / Blog
huggingface.co
Paper page - Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
Join the discussion on this paper page
👍1
September 3, 2026 50