闲社服务运行正常AI智能体自动化平台

cv_vitb16_classification_vision-efficient-tuning-prompt

iic/cv_vitb16_classification_vision-efficient-tuning-prompt

发布机构iic

下载访问条件魔搭来源

基于大规模预训练基础模型的参数高效迁移学习方法在各种下游应用中均取得了优异的表现,其中包括了利用Prompt进行调优的方法。该方法对输入的块嵌入向量额外添加了多个可学习的prompt向量,仅需训练极少部分的参数,就能取得不错的性能表现。 该页面展示了Prompt在图像分类任务上的应用,即给定一张图片,返回候选类别中的分类标签及置信度。 Prompt的模型结构如下所示,其中左侧为Prompt嵌入到Vision Transformer中的框架,右侧为Prompt的具体结构:

图像分析
模型详情

模型介绍

中文整理

基础视觉模型高效调优:Prompt

基于大规模预训练基础模型的参数高效迁移学习方法在各种下游应用中均取得了优异的表现,其中包括了利用Prompt进行调优的方法。该方法对输入的块嵌入向量额外添加了多个可学习的prompt向量,仅需训练极少部分的参数,就能取得不错的性能表现。

该页面展示了Prompt在图像分类任务上的应用,即给定一张图片,返回候选类别中的分类标签及置信度。

模型描述

Prompt的模型结构如下所示,其中左侧为Prompt嵌入到Vision Transformer中的框架,右侧为Prompt的具体结构:

期望模型使用方式以及适用范围

如何使用

基于 ModelScope 框架,通过调用预定义的 Pipeline 可实现快速调用。

代码范例

模型局限性以及可能的偏差

本模型基于公开的CIFAR100通用数据集训练,且仅适用于训练数据的覆盖类别,在具体应用场景下可能存在偏差。

本模型当前仅用于图像分类任务,同时该方法可用于其他模态输入(如文本、视频等)和其他视觉下游任务(如检测、分割等)。

训练数据介绍

  • CIFAR100 通用图像分类数据集,包含100个类别。
  • CUB-200-2011 鸟类细粒度分类数据集,包含200个类别。
  • NABirds 鸟类细粒度分类数据集,包含555个类别。
  • Oxford Flowers 花卉细粒度分类数据集,包含102个类别。
  • Stanford Cars 车辆细粒度分类数据集,包含196个类别。
  • Stanford Dogs 犬类细粒度分类数据集,包含120个类别。

数据评估及结果

模型分别在不同的预训练模型和图像分类数据集下进行评估,结果如下:

.tg {border-collapse:collapse;border-spacing:0;}

.tg td{border-color:black;border-style:solid;border-width:1px;font-family:Arial, sans-serif;font-size:14px;

overflow:hidden;padding:10px 5px;word-break:normal;}

.tg th{border-color:black;border-style:solid;border-width:1px;font-family:Arial, sans-serif;font-size:14px;

font-weight:normal;overflow:hidden;padding:10px 5px;word-break:normal;}

.tg .tg-9wq8{border-color:inherit;text-align:center;vertical-align:middle}

Dataset

ViT-B/16 (IN-21K)

ViT-L/14 (CLIP)

Prompt Shallow

Prompt Deep

Prompt Shallow

Prompt Deep

CIFAR100

  • 62%
  • 58%
  • 95%
  • 28%

CUB-200-2011

  • 92%
  • 99%
  • 64%
  • 92%

NABirds

  • 31%
  • 77%
  • 25%
  • 18%

Oxford Flowers

  • 46%
  • 60%
  • 55%
  • 72%

Stanford Cars

  • 45%
  • 25%
  • 65%
  • 82%

Stanford Dogs

  • 53%
  • 27%
  • 22%
  • 28%

Average

  • 72%
  • 24%
  • 04%
  • 03%

其中,ViT-B/16模型使用 ImageNet-21K 作为预训练模型,ViT-L/14使用 CLIP 作为预训练模型。

模型训练和验证

以下为使用FME Benchmark中的子数据集OxfordFlowers[点击预览]进行finetune训练和评测的示例代码:

训练说明见示例代码中的注释部分,详细的训练说明和用法见官方的训练文档。

相关论文以及引用信息

如果该模型对您有所帮助,请引用下面的相关的论文:

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部