模型介绍
中文整理基础视觉模型高效调优:LoRA
基于大规模预训练基础模型的参数高效迁移学习方法在各种下游应用中均取得了优异的表现,其中包括了利用LoRA进行调优的方法。该方法对多头注意力层中的映射权重额外添加了低秩矩阵的训练模块,仅需训练极少部分的参数,就能取得不错的性能表现。
该页面展示了LoRA在图像分类任务上的应用,即给定一张图片,返回候选类别中的分类标签及置信度。
模型描述
Prompt的模型结构如下所示,其中左侧为LoRA嵌入到Vision Transformer中的框架,右侧为LoRA的具体结构:
期望模型使用方式以及适用范围
如何使用
基于 ModelScope 框架,通过调用预定义的 Pipeline 可实现快速调用。
代码范例
模型局限性以及可能的偏差
本模型基于公开的CIFAR100通用数据集训练,且仅适用于训练数据的覆盖类别,在具体应用场景下可能存在偏差。
本模型当前仅用于图像分类任务,同时该方法可用于其他模态输入(如文本、视频等)和其他视觉下游任务(如检测、分割等)。
训练数据介绍
- CIFAR100 通用图像分类数据集,包含100个类别。
- CUB-200-2011 鸟类细粒度分类数据集,包含200个类别。
- NABirds 鸟类细粒度分类数据集,包含555个类别。
- Oxford Flowers 花卉细粒度分类数据集,包含102个类别。
- Stanford Cars 车辆细粒度分类数据集,包含196个类别。
- Stanford Dogs 犬类细粒度分类数据集,包含120个类别。
数据评估及结果
模型分别在不同的预训练模型和图像分类数据集下进行评估,结果如下:
Dataset ViT-B/16 (IN-21K) ViT-L/14 (CLIP)
:---------------: :-----------------: :---------------:
CIFAR100 92.24% 90.96%
CUB-200-2011 88.09% 87.69%
NABirds 84.11% 86.57%
Oxford Flowers 98.94% 95.45%
Stanford Cars 85.82% 92.30%
Stanford Dogs 89.81% 88.31%
Average 89.84% 90.21%
其中,ViT-B/16模型使用 ImageNet-21K 作为预训练模型,ViT-L/14使用 CLIP 作为预训练模型。
模型训练和验证
以下为使用FME Benchmark中的子数据集OxfordFlowers[点击预览]进行finetune训练和评测的示例代码:
训练说明见示例代码中的注释部分,详细的训练说明和用法见官方的训练文档。
相关论文以及引用信息
如果该模型对您有所帮助,请引用下面的相关的论文:
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
