模型介绍
中文整理# Qwen-Drive-1.0-4B 模型卡片
模型用途
Qwen-Drive-1.0是首个在预训练阶段统一3D感知和视觉问答的自动驾驶视觉语言基础模型,并进一步扩展到运动规划能力。该模型保持预训练VLM架构完全不变。
## 主要能力
- *3D感知**:外部BEV感知头作为显式可检查的3D探测头,联合学习3D目标检测、语义占用预测和BEV地图分割,为同一预训练VLM提供清晰的感知输出。
- *视觉问答**:未修改的VLM可回答关于驾驶场景的自由形式问题。
- *运动规划**:规划专家基于预训练VLM表示,通过流匹配生成未来自车轨迹。提供两种规划专家:planner-sft支持直接规划和推理规划;planner-rl进一步在NAVSIM PDMS、WOD-E2E RFS和位移项上进行奖励优化,在推理规划模式下效果最佳。
## 输入输出
- *输入**:驾驶场景的视觉信息(图像)
- *输出**:
- 3D目标检测结果
- 语义占用预测
- BEV地图分割
- 驾驶场景问答答案
- 未来自车轨迹预测
运行要求
需要从GitHub仓库安装推理代码,并下载模型权重(根目录的VLM及各任务子文件夹中的任务头)。
基本用法
- *运动规划**:加载VLM并连接规划专家进行轨迹预测。planner-rl仅在推理条件下的 rollout上进行奖励优化,需在推理规划模式下运行。planner-sft支持直接规划和推理规划两种模式。
- *视觉问答**:加载根目录的VLM(不连接规划器),VLM可自行回答自由形式的驾驶问题。
- *感知任务**:连接BEV感知头,它绑定相同的VLM并输出3D检测、占用和BEV地图分割结果。
GitHub仓库中的scripts/demo.py可运行四个规划场景和六个感知帧的端到端演示,无需额外数据。
限制
大规模驾驶训练未导致明显的灾难性遗忘。Qwen-Drive-1.0-SFT在知识、推理、识别和空间理解基准测试中与基础模型Qwen3.5-4B表现相当,同时保持良好的指令跟随能力。
许可证
原始模型权重以Apache 2.0许可证发布。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
