模型介绍
中文整理# Tracking Any Point (TAP) 模型卡片
模型用途
TAP模型系列用于跟踪任何固体物理表面上的任意点。给定某一帧上的查询点,模型预测该点在视频其他每一帧中的位置,同时输出遮挡/可见性估计。
## 主要能力
TAP模型的核心功能是在视频序列中追踪用户指定的任意像素点,并判断该点在每一帧是否可见(未被遮挡)。不同版本的模型在精度、速度和稳定性方面有所差异:
- TAP-Net:基线模型
- TAPIR:两阶段匹配+精调,精度较TAP-Net有显著提升
- BootsTAPIR:基于无标注视频的自训练版本
- TAPNext / BootsTAPNext:采用下一token预测架构,是目前最快、最简单的追踪器
- TAPNext++:在BootsTAPNext基础上微调,稳定性提升40倍,具备遮挡处理和重检测能力
- TRAJAN:用于运动表示学习的点轨迹自编码器
## 输入输出
- *输入**:视频序列以及用户指定的一个或多个查询点位置
- *输出**:每个查询点在视频每一帧中的坐标位置,以及对应的可见性/遮挡状态
运行要求
- 框架:PyTorch 或 Jax
- 分辨率:256×256 或 512×512
- 硬件:建议使用GPU加速
基本用法
参考官方Colab演示 notebook 进行快速测试。GitHub仓库提供了完整的推理代码。
许可证
Apache License 2.0
版权所有 2022-2026 Google LLC
本仓库中的所有软件和模型检查点均采用Apache License 2.0开源许可。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
