闲社服务运行正常AI智能体自动化平台

tapnet

google/tapnet

发布机构谷歌(Google)已核实

下载访问条件国内镜像可用

TAP模型系列用于跟踪任何固体物理表面上的任意点。给定某一帧上的查询点,模型预测该点在视频其他每一帧中的位置,同时输出遮挡/可见性估计。 TAP模型的核心功能是在视频序列中追踪用户指定的任意像素点,并判断该点在每一帧是否可见(未被遮挡)。不同版本的模型在精度、速度和稳定性方面有所差异: TAPIR:两阶段匹配+精调,精度较TAP-Net有显著提升

其他模型
模型详情

模型介绍

中文整理

# Tracking Any Point (TAP) 模型卡片

模型用途

TAP模型系列用于跟踪任何固体物理表面上的任意点。给定某一帧上的查询点,模型预测该点在视频其他每一帧中的位置,同时输出遮挡/可见性估计。

## 主要能力

TAP模型的核心功能是在视频序列中追踪用户指定的任意像素点,并判断该点在每一帧是否可见(未被遮挡)。不同版本的模型在精度、速度和稳定性方面有所差异:

  • TAP-Net:基线模型
  • TAPIR:两阶段匹配+精调,精度较TAP-Net有显著提升
  • BootsTAPIR:基于无标注视频的自训练版本
  • TAPNext / BootsTAPNext:采用下一token预测架构,是目前最快、最简单的追踪器
  • TAPNext++:在BootsTAPNext基础上微调,稳定性提升40倍,具备遮挡处理和重检测能力
  • TRAJAN:用于运动表示学习的点轨迹自编码器

## 输入输出

  • *输入**:视频序列以及用户指定的一个或多个查询点位置
  • *输出**:每个查询点在视频每一帧中的坐标位置,以及对应的可见性/遮挡状态

运行要求

  • 框架:PyTorch 或 Jax
  • 分辨率:256×256 或 512×512
  • 硬件:建议使用GPU加速

基本用法

参考官方Colab演示 notebook 进行快速测试。GitHub仓库提供了完整的推理代码。

许可证

Apache License 2.0

版权所有 2022-2026 Google LLC

本仓库中的所有软件和模型检查点均采用Apache License 2.0开源许可。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部