闲社服务运行正常AI智能体自动化平台

Voxtral-Small-24B-2507

mistralai/Voxtral-Small-24B-2507

发布机构Mistral AI已核实

下载访问条件国内镜像可用

Voxtral Small 1.0 (24B) - 2507 Voxtral Small 是 Mistral Small 3 的增强版本,在保留顶级文本性能的同时,集成了先进的音频输入能力。该模型专注于语音转写、翻译和音频理解任务。 Voxtral 基于 Mistral Small 3 构建,具备强大的音频理解能力。支持纯语音转写模式以最大化性能,默认情况下可自动检测音频语言并进行转写。拥有 32k token 上下文长度,最长可处理 30 分钟音频的转写任务,或 40 分钟

语音音频
模型详情

模型介绍

中文整理

Voxtral Small 1.0 (24B) - 2507

模型用途

Voxtral Small 是 Mistral Small 3 的增强版本,在保留顶级文本性能的同时,集成了先进的音频输入能力。该模型专注于语音转写、翻译和音频理解任务。

主要能力

Voxtral 基于 Mistral Small 3 构建,具备强大的音频理解能力。支持纯语音转写模式以最大化性能,默认情况下可自动检测音频语言并进行转写。拥有 32k token 上下文长度,最长可处理 30 分钟音频的转写任务,或 40 分钟音频的理解任务。支持直接通过音频提问,无需额外的语音识别和语言模型即可分析音频并生成结构化摘要。支持自动语言检测,覆盖全球最广泛使用的语言,包括英语、西班牙语、法语、葡萄牙语、印地语、德语、荷兰语和意大利语。支持直接从语音触发后端函数、工作流或 API 调用。保留了其语言模型基座 Mistral Small 3.1 的文本理解能力。

输入输出

支持音频和文本输入,可处理单条消息中的多个音频文件及多轮对话。输出文本转写、翻译、问答回复或摘要。

运行要求

在 bf16 或 fp16 精度下运行需要约 55 GB GPU 显存。使用 vLLM 时需安装 vLLM >= 0.10.0 和 mistral-common >= 1.8.1。使用 Transformers 时需 transformers >= 4.54.0 和 mistral-common >= 1.8.1。

基本用法

推荐使用 vLLM 框架。音频理解任务建议使用 temperature=0.2 和 top_p=0.95,转写任务建议使用 temperature=0.0。支持函数调用功能。系统提示词暂不支持。

限制

函数调用功能仍处于实验阶段。系统提示词功能尚未支持。

许可证

相关内容未在原文中提供。

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部