闲社服务运行正常AI智能体自动化平台

cv_raft_video-frame-interpolation_practical

iic/cv_raft_video-frame-interpolation_practical

发布机构iic

下载访问条件魔搭来源

给定一段低帧率视频,模型会返回更流畅的高帧率视频,可支持任意指定帧率输出。 全链路插帧模型包含光流计算模块和中间帧生成模块。其中光流计算模型复用了RAFT,详见:https://github.com/princeton-vl/RAFT 。中间帧生成模型包含了光流refine、backward warping以及中间帧融合模块。该模型适用于各类低帧率视频增强,用于提升视频的流畅度,消除卡顿现象。和原版视频插帧模型相比,该版模型在支持任意帧率输出的同时,在大运动、重复纹理、台标字

视频分析与处理
模型详情

模型介绍

中文整理

视频插帧(应用型)介绍

给定一段低帧率视频,模型会返回更流畅的高帧率视频,可支持任意指定帧率输出。

模型描述

全链路插帧模型包含光流计算模块和中间帧生成模块。其中光流计算模型复用了RAFT,详见:https://github.com/princeton-vl/RAFT 。中间帧生成模型包含了光流refine、backward warping以及中间帧融合模块。该模型适用于各类低帧率视频增强,用于提升视频的流畅度,消除卡顿现象。和原版视频插帧模型相比,该版模型在支持任意帧率输出的同时,在大运动、重复纹理、台标字幕等困难场景下的插帧效果更好,适合大部分真实场景视频的插帧任务。

模型效果如下:

:-------------------------------------------------------------------------------:

原始视频(左) , 2倍插帧(中) , 4倍插帧(右)

期望模型使用方式以及适用范围

本模型主要用于视频帧率转换,提升视频流畅度。用户可以自行尝试不同分辨率视频输入和不同帧率输出下的模型效果。具体调用方式请参考代码示例。

如何使用

在ModelScope框架下,通过调用简单的Pipeline即可使用当前模型,其中,输入需为字典格式,合法键值包括'video'、'interp ratio'以及'out fps'。video提供输入视频地址,为必选项;interp ratio可指定需要的插帧倍率;out fps可指定输出帧率。两者任选其一输入即可,若同时指定,则以interp ratio为准,若均不指定,则默认以2倍率插帧。该模型暂仅支持在GPU上进行推理。输入具体代码示例如下:

代码范例

模型局限性以及可能的偏差

该模型在公开数据集vimeo septuplet上进行了预训练,并在内部数据集上进行了finetune。和原版模型相比,该版模型在学术验证集上的指标略有下降。此外,不同的训练数据增强方法以及光流gt会对模型训练结果产生影响,请用户自行评测后决定如何使用。

训练数据介绍

vimeo septuplet: 经典的视频插帧数据集,训练集包含64612组图片,验证集包含7824组图片,每组图片包含连续7帧448x256图像, 具体数据可以下载

训练

该模型暂不支持训练(finetune),该功能将在之后的更新中尽快开放

模型评估

该模型支持在ucf 101、middlebury、davis公开数据上进行验证,详见右侧的关联数据集。数据评估结果及示例代码如下

Dataset PSNR SSIM LPIPS

:---- :---- :---- :----

ucf 101 32.37 0.966 0.036

middlebury 34.44 0.971 0.035

davis 27.51 0.888 0.094

相关论文以及引用信息

该模型借鉴了以下论文的思路或代码:

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部