【事件概述】
IBM Granite Speech 团队发布了两款 Granite Speech 5.0 TurboCTC 英语语音识别模型:Apache 2.0 版本 granite-speech-5.0-470m-turboctc,以及仅限非商业用途的 granite-speech-5.0-470m-turboctc-nc。两款模型均为 4.70 亿参数,重点面向低延迟、高吞吐的英文语音转文字。
【模型与开发者】
模型:Granite Speech 5.0 470M TurboCTC、Granite Speech 5.0 470M TurboCTC NC
开发者:IBM Granite Speech Team
官方发布日期:2026 年 8 月 25 日。IBM 官方 Hugging Face 博客和两份模型卡均明确标注该日期。Apache 版本仓库创建于 8 月 4 日,NC 版本仓库创建于 8 月 17 日,二者都在 8 月 25 日更新;这些较早的仓库创建时间属于发布前准备,不应替代官方公布的事件日期。
【关键能力与架构】
1. 两款模型都是仅编码器架构,由 16 个 Conformer 模块组成,使用 CTC 目标训练,并通过非自回归贪心解码输出转写结果。
2. 模型采用分块自注意力、中间层自条件 CTC 和时间下采样,把 100Hz 的输入帧率降到 12.5Hz,以降低长序列计算量。
3. 输出层使用 16,384 个 BPE 单元,只支持英语自动语音识别。
4. Apache 2.0 版本约使用 6 万小时公开或基于公开语料构造的英语音频训练;NC 版本约使用 7.5 万小时,并额外加入 GigaSpeech 与 SPGI Speech 数据。
5. IBM 将其定位为适合笔记本、智能手机及其他边缘设备的紧凑型 ASR 模型。现阶段 Transformers 已加入原生支持,但在下一个正式版本发布前,官方示例要求从源码安装 Transformers。
【两个版本怎么选】
标准版 granite-speech-5.0-470m-turboctc 使用 Apache 2.0 许可证,适合需要较宽松开源许可的项目。带 -nc 后缀的版本采用 CC-BY-NC-SA-4.0,只允许研究和非商业用途。NC 版使用了更多训练数据,但不能因为官方测试结果略有差异,就忽略其非商业许可证限制。
【适用对象与实际影响】
适合英文会议转写、字幕、呼叫中心语音转文字、边缘端录音整理,以及希望替换大型“声学编码器+语言模型”ASR 流程的开发者。与此前带 Granite 语言模型和 LoRA 适配器的语音模型不同,这次的编码器-only设计更专注于英文转写,减少了模型体积和解码复杂度。
IBM 官方在一张 NVIDIA H200 上、采用批量推理时报告了超过 12,600 RTFx 的吞吐,并称相较此前 Granite Speech 模型吞吐提升超过 20 倍。这些都是项目方在特定硬件和测试设置下的结果,不能直接推导为手机、笔记本或单条实时音频上的速度,部署前仍需在目标设备上实测。
【限制与使用提醒】
两款模型只支持英语,不具备此前语言模型型 Granite Speech 的语音翻译和关键词偏置能力。官方主要公布的是短时英文 ASR 基准,口音、专业术语、超长录音、强噪声和真实并发负载仍需单独验证。ASR 结果可能出现漏词、错词或数字与专名错误,高风险记录不能未经人工复核直接使用。NC 版本禁止商业使用;标准版虽为 Apache 2.0,也应检查数据、隐私和下游业务的合规要求。
【官方来源】
IBM Granite 官方发布博客:https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc
Apache 2.0 模型页:https://huggingface.co/ibm-granite/granite-speech-5.0-470m-turboctc
非商业模型页:https://huggingface.co/ibm-granite/granite-speech-5.0-470m-turboctc-nc |