微软一直在持续扩充其自研的 MAI 系列模型矩阵。今年 4 月,微软发布了 MAI-Transcribe-1,宣称该模型在 25 种语言上的平均词错误率(WER)仅为 3.9%,是当时全球最准确的语音转录模型,且极具竞争力的定价为每小时 0.36 美元。
随后在 6 月,微软又推出了 MAI-Transcribe-1.5,将语言支持扩展至 43 种,新增了关键词偏置功能,并大幅提升了处理速度。
今日,微软正式发布了 MAI-Transcribe-2,并宣称这是目前市面上最快、最准确且最便宜的语音识别模型。在 FLEURS 多语言基准测试中,MAI-Transcribe-2 在 60 种语言上的平均词错误率仅为 5.2%,位列第一。微软还表示,在独立机构 Artificial Analysis 的词错误率排行榜上,该模型也高居第二。
微软指出,在保持更高转录准确率的同时,MAI-Transcribe-2 的推理速度比 OpenAI 的 GPT-Transcribe 快 10 倍,比 ElevenLabs 的 Scribe v2 快 7 倍,比谷歌的 Gemini 3.5 Transcribe 快 5 倍。
此外,MAI-Transcribe-2 还弥补了早期 Transcribe 模型的诸多局限。例如,新版本现已支持说话人分离、逐词时间戳、关键词偏置、自动语言识别,以及针对混合语言对话(如印式英语 Hinglish 和西班牙式英语 Spanglish)的代码切换功能。
开发者还可以根据需求在两种转录风格中进行选择:“逐字模式”会保留语气词和口误,适用于合规审查与数据分析场景;而“清洁模式(clean)”则会剔除这些冗余内容,以生成更易读的字幕、笔记和转录文本。
微软 AI 团队在关于 MAI-Transcribe-2 的博客文章中提到:
“凭借说话人分离、可配置转录风格和逐词时间戳等全新功能,MAI-Transcribe-2 不仅超越了 Gemini 3.5 Transcribe、GPT-Transcribe、Whisper V3-Large 和 ScribeV2 等其他领先模型,还能更好地处理各种复杂的真实世界音频。”
在定价策略上,微软同样极具侵略性。MAI-Transcribe-2 的音频转录费用仅为每小时 0.10 美元,远低于 MAI-Transcribe-1 首发时 0.36 美元/小时的价格。不过,这一极具吸引力的价格属于限时优惠,仅持续至 2026 年底,微软尚未公布优惠结束后的常规收费标准。
目前,MAI-Transcribe-2 已在 Microsoft Foundry 和 MAI Playground 上线,后续还将登陆 OpenRouter 平台。