闲社服务运行正常AI智能体自动化平台

DiarizationLM-Gemma-4-E4B-v1

google/DiarizationLM-Gemma-4-E4B-v1

发布机构谷歌(Google)已核实

下载访问条件国内镜像可用

DiarizationLM-Gemma-4-E4B-v1 DiarizationLM 是一个大语言模型框架,用于后处理、纠正和优化自动语音识别(ASR)及说话人日志输出。 基于谷歌 Gemma 4 E4B(40亿密集参数)基础模型微调,采用局部性保持预言监督训练,涵盖四个标准说话人日志基准语料库:Fisher English(2人对话电话语音)、Callhome American English(2-5人非正式电话对话)、ICSI Meeting Corpus(3-9人学术研

图文理解语音音频文字对话
模型详情

模型介绍

中文整理

模型名称

DiarizationLM-Gemma-4-E4B-v1

模型用途

DiarizationLM 是一个大语言模型框架,用于后处理、纠正和优化自动语音识别(ASR)及说话人日志输出。

主要能力

基于谷歌 Gemma 4 E4B(40亿密集参数)基础模型微调,采用局部性保持预言监督训练,涵盖四个标准说话人日志基准语料库:Fisher English(2人对话电话语音)、Callhome American English(2-5人非正式电话对话)、ICSI Meeting Corpus(3-9人学术研究会议)、AMI Meeting Corpus(4人桌面会议)。模型学习纠正词汇轮次边界和简短插话(1-5词),同时在长独白(6词以上)中保持声学说话人锚点,从而优化说话人日志性能。

输入输出

输入:ASR和说话人日志的输出结果

输出:经过纠正和优化的ASR及说话人日志结果

运行要求

提示分段长度:4000字符(最大序列长度2560 tokens)

推荐使用量化版本:Q4 K_M GGUF(约5.30GB)

支持在 llama.cpp、Ollama 或 llama-cpp-python 上运行

基本用法

支持 Python(transformers + diarizationlm)在 GPU 上以 bfloat16 格式运行推理

支持 GGUF 格式模型在 llama.cpp 等推理框架中运行

限制

本产品非谷歌官方支持产品

许可证

未在文档中明确说明

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部