产品帮助中心
欢迎来到简鹿技术支持中心,我们可以为您提供哪些帮助?

微软 MAI-Transcribe-2 发布,连 OpenAI 和谷歌都被甩在身后

时间:2026-09-06 作者:小鹿 来源:简鹿办公
简鹿人声分离
官方正版
纯净安全
软件评分:
简鹿人声分离是一款高效的音频分离软件,能一键批量从音频或视频中分离出高质量的人声和伴奏,并支持视频降噪和乐器声提取,满足不同环境下的专业音频处理工具。
Win下载 Mac下载

微软一直在持续扩充其自研的 MAI 系列模型矩阵。今年 4 月,微软发布了 MAI-Transcribe-1,宣称该模型在 25 种语言上的平均词错误率(WER)仅为 3.9%,是当时全球最准确的语音转录模型,且极具竞争力的定价为每小时 0.36 美元。


随后在 6 月,微软又推出了 MAI-Transcribe-1.5,将语言支持扩展至 43 种,新增了关键词偏置功能,并大幅提升了处理速度。

MAI-Transcribe-2

今日,微软正式发布了 MAI-Transcribe-2,并宣称这是目前市面上最快、最准确且最便宜的语音识别模型。在 FLEURS 多语言基准测试中,MAI-Transcribe-2 在 60 种语言上的平均词错误率仅为 5.2%,位列第一。微软还表示,在独立机构 Artificial Analysis 的词错误率排行榜上,该模型也高居第二。


微软指出,在保持更高转录准确率的同时,MAI-Transcribe-2 的推理速度比 OpenAI 的 GPT-Transcribe 快 10 倍,比 ElevenLabs 的 Scribe v2 快 7 倍,比谷歌的 Gemini 3.5 Transcribe 快 5 倍。


此外,MAI-Transcribe-2 还弥补了早期 Transcribe 模型的诸多局限。例如,新版本现已支持说话人分离、逐词时间戳、关键词偏置、自动语言识别,以及针对混合语言对话(如印式英语 Hinglish 和西班牙式英语 Spanglish)的代码切换功能。


开发者还可以根据需求在两种转录风格中进行选择:“逐字模式”会保留语气词和口误,适用于合规审查与数据分析场景;而“清洁模式(clean)”则会剔除这些冗余内容,以生成更易读的字幕、笔记和转录文本。


微软 AI 团队在关于 MAI-Transcribe-2 的博客文章中提到:

凭借说话人分离、可配置转录风格和逐词时间戳等全新功能,MAI-Transcribe-2 不仅超越了 Gemini 3.5 Transcribe、GPT-Transcribe、Whisper V3-Large 和 ScribeV2 等其他领先模型,还能更好地处理各种复杂的真实世界音频。


在定价策略上,微软同样极具侵略性。MAI-Transcribe-2 的音频转录费用仅为每小时 0.10 美元,远低于 MAI-Transcribe-1 首发时 0.36 美元/小时的价格。不过,这一极具吸引力的价格属于限时优惠,仅持续至 2026 年底,微软尚未公布优惠结束后的常规收费标准。


目前,MAI-Transcribe-2 已在 Microsoft Foundry 和 MAI Playground 上线,后续还将登陆 OpenRouter 平台。

热门教程
音频格式转换器 格式转换工厂
办公软件,就选简鹿 简便、快捷、高效

客户服务

帮助中心

关注我们

百家号 搜狐号 抖音号 CSDN B站平台
QQ客服
QQ:3236169202 复制
简鹿办公QQ客服二维码
微信客服
微信:jianlu365 复制
简鹿办公微信公众号
回到顶部