OpenAI 推出了两款新模型:GPT-Live-Transcribe 和 GPT-Transcribe。前者专为低延迟的实时语音转文字任务设计,后者则针对已完成的音频文件和异步批量处理进行了优化。
两款模型现在均可利用录音的自由形式上下文信息(如关键词、特定领域术语的名称及预期语言)来提升准确率。其中,GPT-Live-Transcribe 还能自动将此前转录的内容作为上下文参考。
在 OpenAI 的上下文感知自动语音识别(Context Aware ASR)基准测试中,加入上下文信息后,GPT-Live-Transcribe 的语义准确率从 38.5% 提升至 44.6%,GPT-Transcribe 则从 41.6% 提升至 45.2%。在另一项真实场景音频基准测试中,GPT-Live-Transcribe 的转录错误率为 9.60%,优于 GPT-Realtime-Whisper 的 11.65%;GPT-Transcribe 的错误率为 8.98%,相较 Whisper-1 的 15.21% 有显著改善。
据 Artificial Analysis 报告,GPT-Transcribe 的词错误率为 3.31%,相较 OpenAI 此前的模型有明显进步,其定价为每 1000 分钟 4.50 美元。
OpenAI 官方表示:“我们正在 API 中推出两款新的转录模型:GPT-Live-Transcribe 专为低延迟实时转录打造,GPT-Transcribe 则优化了已完成音频文件和批量任务的异步转录。两款模型均能更好地理解上下文...”
阿里巴巴则发布了 Qwen-Audio-3.0-Realtime Plus 和 Flash 模型,专注于端到端的语音到语音对话。与 GPT-Live 类似,这些新模型支持全双工交互,允许用户在 AI 说话时打断,并支持函数调用和自定义克隆声音。
事实上,阿里巴巴的 Qwen-Audio-3.0-Realtime Plus 目前在 Artificial Analysis 的语音到语音指数中以 84.1% 的得分位居榜首,领先于 OpenAI 的 GPT-Realtime-2.1 High(79.1%)。该模型在语音推理、对话动态和智能体性能测试中均表现优异。不过其劣势在于响应启动较慢:Artificial Analysis 发现,其首次音频响应时间约为 4 秒,而 GPT-Realtime-2 High 约为 1.14 秒。