模型介绍
中文整理Voxtral Small 1.0 (24B) - 2507
模型用途
Voxtral Small 是 Mistral Small 3 的增强版本,在保留顶级文本性能的同时,集成了先进的音频输入能力。该模型专注于语音转写、翻译和音频理解任务。
主要能力
Voxtral 基于 Mistral Small 3 构建,具备强大的音频理解能力。支持纯语音转写模式以最大化性能,默认情况下可自动检测音频语言并进行转写。拥有 32k token 上下文长度,最长可处理 30 分钟音频的转写任务,或 40 分钟音频的理解任务。支持直接通过音频提问,无需额外的语音识别和语言模型即可分析音频并生成结构化摘要。支持自动语言检测,覆盖全球最广泛使用的语言,包括英语、西班牙语、法语、葡萄牙语、印地语、德语、荷兰语和意大利语。支持直接从语音触发后端函数、工作流或 API 调用。保留了其语言模型基座 Mistral Small 3.1 的文本理解能力。
输入输出
支持音频和文本输入,可处理单条消息中的多个音频文件及多轮对话。输出文本转写、翻译、问答回复或摘要。
运行要求
在 bf16 或 fp16 精度下运行需要约 55 GB GPU 显存。使用 vLLM 时需安装 vLLM >= 0.10.0 和 mistral-common >= 1.8.1。使用 Transformers 时需 transformers >= 4.54.0 和 mistral-common >= 1.8.1。
基本用法
推荐使用 vLLM 框架。音频理解任务建议使用 temperature=0.2 和 top_p=0.95,转写任务建议使用 temperature=0.0。支持函数调用功能。系统提示词暂不支持。
限制
函数调用功能仍处于实验阶段。系统提示词功能尚未支持。
许可证
相关内容未在原文中提供。
优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。
你将获得什么
完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。
完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。
使用前须知
运行模型需要的设备、工具与依赖,以原作者说明为准。
是否允许商用、修改和分发,请查看模型许可证。
闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。
资料或下载有问题?
登录后可提交反馈。
