闲社服务运行正常AI智能体自动化平台

VibeVoice-ASR-BitNet

microsoft/VibeVoice-ASR-BitNet

发布机构微软(Microsoft)已核实

下载访问条件国内镜像可用

VibeVoice-ASR-BitNet 是 VibeVoice-ASR 的压缩版本,专为边缘 CPU 的实时语音识别推理优化,无需 GPU。 通过异构量化技术,模型从 4.62 GB 压缩至 1.58 GB,推理速度比 Whisper.cpp 快 1.6–2.3 倍,支持实时语音识别(RTF < 1)。 VAE Tokenizer:从 1.31 GB 压缩至 0.65 GB(I8_S 量化),压缩比 2.0×

文字对话语音音频推理思考
模型详情

模型介绍

中文整理

# VibeVoice-ASR-BitNet

模型用途

VibeVoice-ASR-BitNet 是 VibeVoice-ASR 的压缩版本,专为边缘 CPU 的实时语音识别推理优化,无需 GPU。

## 主要能力

通过异构量化技术,模型从 4.62 GB 压缩至 1.58 GB,推理速度比 Whisper.cpp 快 1.6–2.3 倍,支持实时语音识别(RTF < 1)。

量化压缩详情:

  • VAE Tokenizer:从 1.31 GB 压缩至 0.65 GB(I8_S 量化),压缩比 2.0×
  • LM Decoder:从 3.32 GB 压缩至 0.92 GB(I2_S + Q6_K 量化),压缩比 3.6×
  • 总体压缩比:2.9×

## 输入输出

  • 输入:音频数据
  • 输出:语音识别文本

运行要求

  • CPU 推理,无需 GPU
  • 支持 AVX2 和 FMA 指令集
  • 支持 1 至 8 线程

基本用法

使用量化后的模型文件进行推理:

  • vibeasr-vae-encoder-i8s.gguf(0.65 GB):VAE tokenizer,I8_S 量化
  • vibeasr-lm-i2s-embed-q6k.gguf(0.92 GB):LM decoder,I2_S + Q6_K 量化

原始模型文件(model-*.safetensors,10.7 GB)可用于模型转换。

限制

压缩后模型在部分基准测试中的识别准确率略低于原始 VibeVoice-ASR-7B 模型。例如在 MLC-EN 基准上原始模型为 7.82,压缩模型为 8.25;在 AISHELL4 基准上原始模型为 19.83,压缩模型为 27.45。

许可证

MIT 许可证

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部