模型介绍
中文整理模型名称
DiarizationLM-Gemma-4-E4B-v1
模型用途
DiarizationLM 是一个大语言模型框架,用于后处理、纠正和优化自动语音识别(ASR)及说话人日志输出。
主要能力
基于谷歌 Gemma 4 E4B(40亿密集参数)基础模型微调,采用局部性保持预言监督训练,涵盖四个标准说话人日志基准语料库:Fisher English(2人对话电话语音)、Callhome American English(2-5人非正式电话对话)、ICSI Meeting Corpus(3-9人学术研究会议)、AMI Meeting Corpus(4人桌面会议)。模型学习纠正词汇轮次边界和简短插话(1-5词),同时在长独白(6词以上)中保持声学说话人锚点,从而优化说话人日志性能。
输入输出
输入:ASR和说话人日志的输出结果
输出:经过纠正和优化的ASR及说话人日志结果
运行要求
提示分段长度:4000字符(最大序列长度2560 tokens)
推荐使用量化版本:Q4 K_M GGUF(约5.30GB)
支持在 llama.cpp、Ollama 或 llama-cpp-python 上运行
基本用法
支持 Python(transformers + diarizationlm)在 GPU 上以 bfloat16 格式运行推理
支持 GGUF 格式模型在 llama.cpp 等推理框架中运行
限制
本产品非谷歌官方支持产品
许可证
未在文档中明确说明
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
