模型介绍
中文整理# AuK:开源语音生成与编辑基础模型
## 模型简介
AuK 是一个拥有 15 亿参数的基础模型,用于语音生成与编辑。该模型基于数百万小时的多样化音频数据训练而成,支持零样本和指令式的语音合成、内容与声学编辑、副语言学编辑、语音增强以及声源分离,所有功能均可通过统一的自然语言指令接口实现。
## 模型变体
- **AuK**:用于高质量生成的基础模型
- **AuK-Flash**:用于快速 4 步推理的蒸馏模型
## 主要能力
### 语音生成
- **零样本 TTS**:根据参考音频的音色朗读目标文本
- **指令 TTS**:仅通过语音描述生成语音,无需参考音频
### 内容编辑
- **语音内容编辑**:重写语音内容,包括替换、插入或删除文本
- **歌词编辑**:在保留旋律和人声的前提下重写歌唱录音中的歌词
### 声学编辑
- **音高编辑**:按半音升高或降低音高
- **语速编辑**:调整说话速度,输出长度随速度系数变化
- **音量编辑**:按分贝升高或降低音量
### 副语言学编辑
- **情感编辑**:在保持内容和音色不变的前提下改变情感
- **音色编辑**:根据描述改变音色,保持内容不变
- **去口音**:消除地区口音,保留说话人音色和内容
- **非语言声音编辑**:移除或添加呼吸声笑声咳嗽声等非语言声音
- **低语转换**:在正常语音和低语之间转换,保持说话人和内容不变
### 增强与分离
- **语音增强**:降噪、去混响或恢复自然清晰的语音
- **语音分离**:按说话顺序保留一人声音并移除其他人声
- **音乐分离**:从混音中提取人声,或保留所有人声
- **目标说话人提取**:保留由其语音内容识别的目标说话人
## 输入输出
- **输入**:自然语言指令、参考音频(可选)、文本或语音描述
- **输出**:生成的语音或编辑后的音频
运行要求
模型权重需要从 Hugging Face 或 ModelScope 下载。模型检查点包含扩散变换器和层融合权重。MLLM 编码器和 VAE 在运行时从单独的文件加载,因此加载检查点时缺少 text_encoder.* 键属于正常现象。
基本用法
所有任务均通过统一的自然语言指令接口暴露。具体使用方法请参阅 GitHub 仓库和 Cookbook 中的安装、推理、Gradio、ComfyUI 以及微调说明。
许可证
AuK 采用 MIT 许可证发布。详见 LICENSE 文件中的完整条款。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
