闲社服务运行正常AI智能体自动化平台

Voxtral-Mini-3B-2507

mistralai/Voxtral-Mini-3B-2507

发布机构Mistral AI已核实

下载访问条件国内镜像可用

Voxtral Mini 1.0 (3B) - 2507 Voxtral Mini 是 Ministral 3B 的增强版本,在保留顶级文本性能的同时,集成了先进的音频输入能力。该模型专注于语音转写、翻译和音频理解任务。 基于 Ministral-3B 架构构建强大的音频理解能力。支持专用语音转写模式,可最大化转写性能。默认情况下,模型自动检测音频语言并进行转写。支持长达 32k token 的上下文长度,可处理最长 30 分钟的转写任务或 40 分钟的理解任务。支持直接通过

语音音频
模型详情

模型介绍

中文整理

Voxtral Mini 1.0 (3B) - 2507

模型用途

Voxtral Mini 是 Ministral 3B 的增强版本,在保留顶级文本性能的同时,集成了先进的音频输入能力。该模型专注于语音转写、翻译和音频理解任务。

主要能力

基于 Ministral-3B 架构构建强大的音频理解能力。支持专用语音转写模式,可最大化转写性能。默认情况下,模型自动检测音频语言并进行转写。支持长达 32k token 的上下文长度,可处理最长 30 分钟的转写任务或 40 分钟的理解任务。支持直接通过音频进行问答和摘要生成,无需单独的语音识别和语言模型。自动检测语言,支持世界上使用最广泛的语言(英语、西班牙语、法语、葡萄牙语、印地语、德语、荷兰语、意大利语)。支持直接从语音触发后端函数、工作流或 API 调用。保留 Ministral-3B 的文本理解能力。

输入输出

输入:音频文件(支持多音频输入)

输出:转写文本、翻译内容、问答回复、结构化摘要

运行要求

使用 vLLM(推荐)或 Transformers 框架运行。GPU 显存需求:bf16 或 fp16 格式下约 9.5 GB。vLLM 版本需 >= 0.10.0,mistral-common >= 1.8.1。Transformers 版本需 >= 4.54.0。

基本用法

音频理解模式:temperature=0.2,top_p=0.95

转写模式:temperature=0.0

支持单条消息包含多个音频及多轮对话

暂不支持系统提示词

限制

暂不支持系统提示词

许可证

请参考官方许可证信息

优先采用原作者提供的中文模型卡片;仅有英文说明时由闲社AI翻译整理。重要参数、许可证和商用范围请以原文为准。

你将获得什么

完整仓库方式包含该固定版本中的权重、配置、分词器及说明文件;指定版本方式只下载所选文件或整组分片。多模态模型的投影文件、配置等依赖,请按作者说明配齐。

完整仓库可能包含多个权重格式,因此需要的磁盘空间可能大于单一格式的模型大小。下载文件不等于完成模型部署。

使用前须知

运行环境

运行模型需要的设备、工具与依赖,以原作者说明为准。

授权范围

是否允许商用、修改和分发,请查看模型许可证。

闲社提供资料与镜像下载方法,不代表已运行模型或完成安全审计。下载的代码应先检查,再执行。

返回顶部