模型介绍
中文整理# VibeVoice-ASR-BitNet
模型用途
VibeVoice-ASR-BitNet 是 VibeVoice-ASR 的压缩版本,专为边缘 CPU 的实时语音识别推理优化,无需 GPU。
## 主要能力
通过异构量化技术,模型从 4.62 GB 压缩至 1.58 GB,推理速度比 Whisper.cpp 快 1.6–2.3 倍,支持实时语音识别(RTF < 1)。
量化压缩详情:
- VAE Tokenizer:从 1.31 GB 压缩至 0.65 GB(I8_S 量化),压缩比 2.0×
- LM Decoder:从 3.32 GB 压缩至 0.92 GB(I2_S + Q6_K 量化),压缩比 3.6×
- 总体压缩比:2.9×
## 输入输出
- 输入:音频数据
- 输出:语音识别文本
运行要求
- CPU 推理,无需 GPU
- 支持 AVX2 和 FMA 指令集
- 支持 1 至 8 线程
基本用法
使用量化后的模型文件进行推理:
- vibeasr-vae-encoder-i8s.gguf(0.65 GB):VAE tokenizer,I8_S 量化
- vibeasr-lm-i2s-embed-q6k.gguf(0.92 GB):LM decoder,I2_S + Q6_K 量化
原始模型文件(model-*.safetensors,10.7 GB)可用于模型转换。
限制
压缩后模型在部分基准测试中的识别准确率略低于原始 VibeVoice-ASR-7B 模型。例如在 MLC-EN 基准上原始模型为 7.82,压缩模型为 8.25;在 AISHELL4 基准上原始模型为 19.83,压缩模型为 27.45。
许可证
MIT 许可证
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
