闲社服务运行正常AI智能体自动化平台

cv_crnn_ocr-recognition-general_damo

iic/cv_crnn_ocr-recognition-general_damo

发布机构iic

下载访问条件魔搭来源

新增轻量化端侧识别LightweightEdge-通用场景模型和轻量化端侧行检测模型。 新增训练/微调时读取本地数据集的lmdb,用训练/微调后的模型继续识别,详见代码示例。 新增训练/微调流程,支持自定义参数及数据集,详见代码示例。

图像分析
模型详情

模型介绍

中文整理

读光文字识别

News

2023年6月:

  • 新增轻量化端侧识别LightweightEdge-通用场景模型和轻量化端侧行检测模型。

2023年4月:

  • 新增训练/微调时读取本地数据集的lmdb,用训练/微调后的模型继续识别,详见代码示例。

2023年3月:

  • 新增训练/微调流程,支持自定义参数及数据集,详见代码示例。

2023年2月:

  • 新增业界主流CRNN-通用场景模型。

传送门

各场景文本识别模型:

ConvNextViT-通用场景

ConvNextViT-手写场景

ConvNextViT-自然场景

ConvNextViT-车牌场景

ConvNextViT-文档印刷场景

LightweightEdge-通用场景

各场景文本检测模型:

SegLink++-通用场景行检测

SegLink++-通用场景单词检测

DBNet-通用场景行检测

整图OCR能力:

整图OCR-多场景

欢迎使用!

模型描述

文字识别,即给定一张文本图片,识别出图中所含文字并输出对应字符串。

本模型主要包括三个主要部分,CNN模块提取高维图像特征,BLSTM模块建模序列特征,最后连接CTC loss进行识别解码以及网络梯度优化,详见CRNN论文。

期望模型使用方式以及适用范围

本模型主要用于给输入图片输出图中文字内容,具体地,模型输出内容以字符串形式输出。用户可以自行尝试各种输入图片。具体调用方式请参考代码示例。

注:输入图片应为包含文字的单行文本图片。其它如多行文本图片、非文本图片等可能没有返回结果,此时表示模型的识别结果为空。

模型推理

在安装完成ModelScope之后即可使用ocr-recognition的能力。(在notebook的CPU环境或GPU环境均可使用)

使用图像的url,或准备图像文件上传至notebook(可拖拽)。

输入下列代码。

代码范例

模型可视化效果

以下为模型的可视化文字识别效果。

模型局限性以及可能的偏差

模型是在中英文数据集上训练的,在其他语言的数据上有可能产生一定偏差,请用户自行评测后决定如何使用。

当前版本在python3.7的CPU环境和单GPU环境测试通过,其他环境下可用性待测试。

模型微调/训练

训练数据及流程介绍

本文字识别模型训练数据集是MTWI以及部分收集数据,训练数据数量约6M。

本模型参数随机初始化,然后在训练数据集上进行训练,在32x640尺度下训练20个epoch。

模型微调/训练示例

训练数据集准备

示例采用ICDAR13手写数据集,已制作成lmdb,数据格式如下

详情可下载解析了解。

配置训练参数并进行微调/训练

参考代码及详细说明如下

用训练/微调后的模型进行识别

ONNX模型使用

参考文献

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部