闲社服务运行正常AI智能体自动化平台

cv_cspnet_video-object-detection_longshortnet

iic/cv_cspnet_video-object-detection_longshortnet

发布机构iic

下载访问条件魔搭来源

本模型所述的任务为流感知(Streaming Perception)任务,该任务为视频目标检测(Video Object Detection, VOD)任务的一个新的细分方向。如上图上半部分所示,传统的VOD采用离线的处理模式,没有考虑模型的延时,所以模型检测结果和真实环境存在由于模型延时造成的误差。而流感知任务在关注模型精度的同时,也考虑了模型的延时,如上图下半部分所示,这样得到的检测结果与真实环境更加匹配。所以说,流感知任务是一个更加贴近自动驾驶真实应用场景的任务。

视频分析与处理
模型详情

模型介绍

中文整理

LongShortNet 模型介绍

任务说明

本模型所述的任务为流感知(Streaming Perception)任务,该任务为视频目标检测(Video Object Detection, VOD)任务的一个新的细分方向。如上图上半部分所示,传统的VOD采用离线的处理模式,没有考虑模型的延时,所以模型检测结果和真实环境存在由于模型延时造成的误差。而流感知任务在关注模型精度的同时,也考虑了模型的延时,如上图下半部分所示,这样得到的检测结果与真实环境更加匹配。所以说,流感知任务是一个更加贴近自动驾驶真实应用场景的任务。

模型描述

LongShortNet是对流感知任务已有方法StreamYOLO的改进,主要的改进点有以下几个方面:

  • 在流感知任务中首次引入长时序信息。原有的StreamYOLO方法仅使用当前帧和前一帧两帧信息作为输入,这样的短时序信息无法表征复杂的运动状态,如:非匀速运动、非直线运动、物体遮挡等;
  • 本模型提出了一种长短时序融合模块(Long-Short Fusion Module, LSFM)。探索了不同的时序融合方式,最终得到一种在精度和速度上能有较好平衡的融合方式;
  • 本模型在流感知的公开评测数据集Argoverse-HD上,在几乎不增加推理耗时的前提下,达到了SOTA水平。

在模型结构方面,LongShortNet与StreamYOLO保持一致,采用YOLOX作为基础网络结构。

LongShortNet的整体框图如下图所示:

期望模型使用方式以及适用范围

该模型适用于自动驾驶场景目标预测检测,,支持8类交通目标检测,具体的类别信息如下:

类别ID 类别名称

  • ----------- ------------

1 person

2 bicycle

3 car

4 motorcycle

5 bus

6 truck

7 traffic light

8 stop sign

如何使用

在ModelScope框架上,提供输入视频,即可以通过简单的Pipeline调用使用当前模型,得到视频中目标位置及类别。

推理代码范例

基础示例代码。下面的示例代码展示的是如何通过一个视频作为输入,得到图片对应的交通目标坐标信息。

模型局限性以及可能的偏差

对于非自动驾驶前置摄象机场景会出现明显检测性能下降的情况。

训练数据介绍

Argoverse-HD 数据集是最近提出的自动驾驶数据集,该数据集与其他的自动驾驶相比,数据规模中等,复杂程度较高,是一个较有代表性的数据集。更重要的是,Argoverse-HD 是第一个提出流感知任务的数据集,并且设计了Stream AP评测标准。该标准将感知时延充分考虑,实现对模型的性能-速度的全面、有效评价。

训练

本模型暂时不支持finetune, 具体离线训练细节如下:

在Argoverse-HD 上训练8个epoch

使用SGD优化算法,线性 LR 策略

使用flip数据增强, 多尺度训练增强

输入预处理

输入图像根据短边resize到640后,padding 为640x960的矩形进行推理

图像归一化

数据评估及结果

模型在Argoverse-HD的验证集上客观指标如下:

Model size velocity sAP0.5:0.95 sAP50 sAP75 weights COCO pretrained weights

  • ----- :---: :---: :---: :---: :---: :----: :----:

LongShortNet-S 600×960 1x 29.8 50.4 29.5 official official

LongShortNet-M 600×960 1x 34.1 54.8 34.6 official official

LongShortNet-L 600×960 1x 37.1 57.8 37.7 official official

相关论文以及引用信息

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部