闲社服务运行正常AI智能体自动化平台

Qwen3-Omni-30B-A3B-Captioner

Qwen/Qwen3-Omni-30B-A3B-Captioner

发布机构Qwen

下载访问条件魔搭来源

Qwen3-Omni-30B-A3B-Captioner 是基于 Qwen3-Omni-30B-A3B-Instruct 微调的下游音频细粒度描述模型,专门用于为任意音频输入生成详细、低幻觉的字幕描述。 该模型能够自动解析和描述各类音频内容,包括复杂的语音、环境声音、音乐和电影音效。即使在多源混合音频环境中,也能提供稳定可靠的输出。 在语音理解方面,模型能够识别多种说话者的情绪、多语言表达和层叠意图,并感知音频中的文化语境和隐含信息,实现对语音深层含义的深入理解。

多模态
模型详情

模型介绍

中文整理

# Qwen3-Omni-30B-A3B-Captioner

模型用途

Qwen3-Omni-30B-A3B-Captioner 是基于 Qwen3-Omni-30B-A3B-Instruct 微调的下游音频细粒度描述模型,专门用于为任意音频输入生成详细、低幻觉的字幕描述。

## 主要能力

该模型能够自动解析和描述各类音频内容,包括复杂的语音、环境声音、音乐和电影音效。即使在多源混合音频环境中,也能提供稳定可靠的输出。

在语音理解方面,模型能够识别多种说话者的情绪、多语言表达和层叠意图,并感知音频中的文化语境和隐含信息,实现对语音深层含义的深入理解。

在非语音场景中,模型展现出出色的声音识别和分析能力,能够准确区分和描述现实世界声音的复杂层次、环境氛围以及电影和媒体中的动态音频细节。

## 输入输出

输入:仅支持音频输入,不接受任何文本提示

输出:仅支持文本输出

模型为单轮模型,每次推理仅接受一个音频输入。

运行要求

建议使用兼容 FlashAttention 2 的硬件以减少 GPU 显存占用。模型需以 torch.float16 或 torch.bfloat16 格式加载后才能使用 FlashAttention 2。

需要安装 ffmpeg。建议创建新的 Python 环境以避免运行时冲突。

基本用法

模型可通过 Hugging Face Transformers 或 vLLM 加载使用。推荐使用 vLLM 进行推理和部署。模型权重会根据模型名称自动下载。

限制

模型为单次推理模型,每次仅能处理一个音频输入。过长的音频可能会降低细节感知能力,建议将音频长度控制在 30 秒以内。

许可证

有关许可证信息,请参阅模型官方页面。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部