闲社服务运行正常AI智能体自动化平台

AuK

Tencent-Hunyuan/AuK

发布机构Tencent-Hunyuan

下载访问条件魔搭来源

AuK 是一个拥有 15 亿参数的基础模型,用于语音生成与编辑。该模型基于数百万小时的多样化音频数据训练而成,支持零样本和指令式的语音合成、内容与声学编辑、副语言学编辑、语音增强以及声源分离,所有功能均可通过统一的自然语言指令接口实现。 AuK-Flash:用于快速 4 步推理的蒸馏模型 零样本 TTS:根据参考音频的音色朗读目标文本

语音音频推理思考
模型详情

模型介绍

中文整理

# AuK:开源语音生成与编辑基础模型

## 模型简介

AuK 是一个拥有 15 亿参数的基础模型,用于语音生成与编辑。该模型基于数百万小时的多样化音频数据训练而成,支持零样本和指令式的语音合成、内容与声学编辑、副语言学编辑、语音增强以及声源分离,所有功能均可通过统一的自然语言指令接口实现。

## 模型变体

  • **AuK**:用于高质量生成的基础模型
  • **AuK-Flash**:用于快速 4 步推理的蒸馏模型

## 主要能力

### 语音生成

  • **零样本 TTS**:根据参考音频的音色朗读目标文本
  • **指令 TTS**:仅通过语音描述生成语音,无需参考音频

### 内容编辑

  • **语音内容编辑**:重写语音内容,包括替换、插入或删除文本
  • **歌词编辑**:在保留旋律和人声的前提下重写歌唱录音中的歌词

### 声学编辑

  • **音高编辑**:按半音升高或降低音高
  • **语速编辑**:调整说话速度,输出长度随速度系数变化
  • **音量编辑**:按分贝升高或降低音量

### 副语言学编辑

  • **情感编辑**:在保持内容和音色不变的前提下改变情感
  • **音色编辑**:根据描述改变音色,保持内容不变
  • **去口音**:消除地区口音,保留说话人音色和内容
  • **非语言声音编辑**:移除或添加呼吸声笑声咳嗽声等非语言声音
  • **低语转换**:在正常语音和低语之间转换,保持说话人和内容不变

### 增强与分离

  • **语音增强**:降噪、去混响或恢复自然清晰的语音
  • **语音分离**:按说话顺序保留一人声音并移除其他人声
  • **音乐分离**:从混音中提取人声,或保留所有人声
  • **目标说话人提取**:保留由其语音内容识别的目标说话人

## 输入输出

  • **输入**:自然语言指令、参考音频(可选)、文本或语音描述
  • **输出**:生成的语音或编辑后的音频

运行要求

模型权重需要从 Hugging Face 或 ModelScope 下载。模型检查点包含扩散变换器和层融合权重。MLLM 编码器和 VAE 在运行时从单独的文件加载,因此加载检查点时缺少 text_encoder.* 键属于正常现象。

基本用法

所有任务均通过统一的自然语言指令接口暴露。具体使用方法请参阅 GitHub 仓库和 Cookbook 中的安装、推理、Gradio、ComfyUI 以及微调说明。

许可证

AuK 采用 MIT 许可证发布。详见 LICENSE 文件中的完整条款。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部