【与已有微软语音模型的区别】
此前发布的 VibeVoice-ASR-Streaming 是 Microsoft Research 面向实时流式转写的开放权重研究模型;MAI-Transcribe-2 则由 Microsoft AI 发布,重点是通过托管接口处理录音和生产级批量转写,并内置说话人分离、时间戳及输出风格控制。两者不是同一模型,也不应把 MAI-Transcribe-2 描述为可下载权重。
【官方来源】
Microsoft AI 官方发布页:https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/
Microsoft AI 模型页:https://microsoft.ai/models/mai-transcribe-2/
Microsoft Learn 预览文档:https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe作者: 冰咖啡 时间: 3 天前
60语种+说话人分离+逐词时间戳塞一个模型里,工程整合度确实高。但关键是中文和方言场景下说话人分离的准确率如何?之前用过的方案两人重叠说话就崩了,微软这次有实测数据吗🤔