闲社服务运行正常AI智能体自动化平台

Qwen-Drive-1.0-4B

Qwen/Qwen-Drive-1.0-4B

发布机构阿里云通义千问(Qwen)已核实

下载访问条件国内镜像可用

Qwen-Drive-1.0是首个在预训练阶段统一3D感知和视觉问答的自动驾驶视觉语言基础模型,并进一步扩展到运动规划能力。该模型保持预训练VLM架构完全不变。 3D感知:外部BEV感知头作为显式可检查的3D探测头,联合学习3D目标检测、语义占用预测和BEV地图分割,为同一预训练VLM提供清晰的感知输出。 视觉问答:未修改的VLM可回答关于驾驶场景的自由形式问题。

文字对话图文理解
模型详情

模型介绍

中文整理

# Qwen-Drive-1.0-4B 模型卡片

模型用途

Qwen-Drive-1.0是首个在预训练阶段统一3D感知和视觉问答的自动驾驶视觉语言基础模型,并进一步扩展到运动规划能力。该模型保持预训练VLM架构完全不变。

## 主要能力

  • *3D感知**:外部BEV感知头作为显式可检查的3D探测头,联合学习3D目标检测、语义占用预测和BEV地图分割,为同一预训练VLM提供清晰的感知输出。
  • *视觉问答**:未修改的VLM可回答关于驾驶场景的自由形式问题。
  • *运动规划**:规划专家基于预训练VLM表示,通过流匹配生成未来自车轨迹。提供两种规划专家:planner-sft支持直接规划和推理规划;planner-rl进一步在NAVSIM PDMS、WOD-E2E RFS和位移项上进行奖励优化,在推理规划模式下效果最佳。

## 输入输出

  • *输入**:驾驶场景的视觉信息(图像)
  • *输出**:
  • 3D目标检测结果
  • 语义占用预测
  • BEV地图分割
  • 驾驶场景问答答案
  • 未来自车轨迹预测

运行要求

需要从GitHub仓库安装推理代码,并下载模型权重(根目录的VLM及各任务子文件夹中的任务头)。

基本用法

  • *运动规划**:加载VLM并连接规划专家进行轨迹预测。planner-rl仅在推理条件下的 rollout上进行奖励优化,需在推理规划模式下运行。planner-sft支持直接规划和推理规划两种模式。
  • *视觉问答**:加载根目录的VLM(不连接规划器),VLM可自行回答自由形式的驾驶问题。
  • *感知任务**:连接BEV感知头,它绑定相同的VLM并输出3D检测、占用和BEV地图分割结果。

GitHub仓库中的scripts/demo.py可运行四个规划场景和六个感知帧的端到端演示,无需额外数据。

限制

大规模驾驶训练未导致明显的灾难性遗忘。Qwen-Drive-1.0-SFT在知识、推理、识别和空间理解基准测试中与基础模型Qwen3.5-4B表现相当,同时保持良好的指令跟随能力。

许可证

原始模型权重以Apache 2.0许可证发布。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部