【事件概述】
Microsoft AI 于 2026 年 9 月 3 日发布 MAI-Transcribe-2。这是一款面向真实录音和批量语音转写的托管模型,支持 60 种语言,并把说话人分离、逐词时间戳、关键词偏置、自动语言识别和可配置转写风格整合到同一套能力中。模型目前可在 MAI Playground 体验,并通过 Microsoft Foundry 的 Azure Speech 以预览方式接入。
【模型与开发者】
模型:MAI-Transcribe-2
开发者:Microsoft AI
官方发布日期:2026 年 9 月 3 日
主要任务:语音识别与录音转写
语言范围:官方称覆盖 60 种语言
开放方式:Microsoft Foundry(预览)、MAI Playground、OpenRouter
日期核对说明:Microsoft AI 官方发布页明确标注 2026-09-03。本文以该发布日期为准,不把文档更新时间或第三方榜单更新时间当作模型发布日期。
【关键能力与改动】
1. 说话人分离:模型可区分录音中的不同发言者,并把文字归属到对应说话人,适合会议、访谈、客服电话和多人播客。
2. 逐词时间戳:输出可包含每个词的精确时间位置,便于字幕对齐、录音检索、跳转播放和后期编辑。
3. 关键词偏置:开发者可以提供专业术语、缩写、人名或产品名,降低特定领域词汇被误识别的概率。
4. 两种转写风格:verbatim 模式尽量保留口头语、填充词和说话中断,适合合规审计或语言分析;clean 模式会清理部分口头冗余,更适合字幕、纪要和公开文本。
5. 自动识别与混合语言:模型可自动检测语言,并处理对话中自然切换语言的情况。官方特别提到 Hinglish、Spanglish 等混合表达,但具体语言组合仍应逐项测试。
6. 噪声环境适配:微软将其定位于真实世界录音,可处理背景噪声、音质波动和长音频,但这并不意味着任何录音条件下都能保持相同准确率。
7. 性能数据:微软称该模型在 FLEURS 60 种语言测试上的平均词错误率为 5.2%,并称处理速度最高可比部分领先竞品快 10 倍。以上均为厂商评测结果,实际表现会随语言、口音、噪声、音频长度和接口配置变化。
【与已有微软语音模型的区别】
此前发布的 VibeVoice-ASR-Streaming 是 Microsoft Research 面向实时流式转写的开放权重研究模型;MAI-Transcribe-2 则由 Microsoft AI 发布,重点是通过托管接口处理录音和生产级批量转写,并内置说话人分离、时间戳及输出风格控制。两者不是同一模型,也不应把 MAI-Transcribe-2 描述为可下载权重。
【适用对象】
适合需要会议纪要、访谈整理、字幕生成、客服质检、内容检索和无障碍转写的开发团队。医疗记录、法律文书和合规场景也可以把它作为初稿工具,但最终内容必须由具备责任主体的人复核。
对跨语言产品来说,单一接口覆盖 60 种语言可以减少为不同市场分别维护模型的复杂度;对专业行业,关键词偏置有助于改善专有名词,但不能替代术语表维护和样本验收。
【实际影响】
语音转写系统过去常把识别、说话人分离、时间对齐和文本清理拆成多条流水线。MAI-Transcribe-2 将这些能力集中到一个托管模型中,有机会减少后处理组件和对齐逻辑。真正上线前仍应使用自己的语言、口音、设备、噪声和专业词汇建立测试集。
微软还公布了限时发布价格:截至 2026 年底为每小时音频 0.10 美元。这只是官方发布时的限时价格,不是长期承诺;实际账单、区域、配额和后续价格应以 Foundry 控制台与最新定价页为准。
【建议评估方法】
准备一组覆盖安静会议、多人抢话、电话窄带、室外噪声、专业术语和混合语言的真实授权录音。分别记录词错误率、说话人归属错误、时间戳偏差、漏词、专名准确率、处理耗时和总费用。
对 clean 与 verbatim 两种模式要单独验收:前者重点检查是否错误删掉有意义的停顿或否定表达,后者重点检查口头语、重复和打断是否按需求保留。
【限制与使用提醒】
第一,Microsoft Foundry 中的 MAI-Transcribe-2 目前属于预览能力,可用区域、配额、接口字段、稳定性和支持范围可能变化,生产系统应设计版本锁定、重试和降级方案。
第二,Microsoft Learn 文档显示,增强快速转写接口目前要求音频小于 300 MB,并支持 WAV、MP3、FLAC 等格式。上传前还应核对当前区域、资源类型与最新限制。
第三,说话人分离并不等于身份识别。系统可以把发言分成不同角色,但不能仅凭这一结果确认现实中的具体人员;重叠说话和短促插话也可能导致归属错误。
第四,医疗、法律、金融、字幕和客服质检等高影响场景不能直接采用机器转写作为最终记录。人名、数字、剂量、日期、否定词和责任表述都应人工复核。
第五,官方基准和速度比较是在特定测试集与条件下得出,不代表所有中文口音、行业录音或长音频都能复现。本文不把厂商数据写成服务等级保证。
第六,这是一项托管服务而非开放权重模型。涉及商业秘密、个人语音、医疗信息或客户通话时,必须先确认录音授权、数据处理区域、保留政策和组织合规要求。
第七,限时价格将在官方所称期限后变化,预算评估不能只按发布优惠测算,应同时考虑存储、网络、失败重试和人工复核成本。
【官方来源】
Microsoft AI 官方发布页:https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/
Microsoft AI 模型页:https://microsoft.ai/models/mai-transcribe-2/
Microsoft Learn 预览文档:https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe |