产品帮助中心
欢迎来到简鹿技术支持中心,我们可以为您提供哪些帮助?

OpenAI 和阿里巴巴今日联合发布了全新的语音 AI 模型

时间:2026-07-30 作者:小鹿 来源:简鹿办公
简鹿人声分离
官方正版
纯净安全
软件评分:
简鹿人声分离是一款高效的音频分离软件,能一键批量从音频或视频中分离出高质量的人声和伴奏,并支持视频降噪和乐器声提取,满足不同环境下的专业音频处理工具。
Win下载 Mac下载

OpenAI 推出了两款新模型:GPT-Live-Transcribe 和 GPT-Transcribe。前者专为低延迟的实时语音转文字任务设计,后者则针对已完成的音频文件和异步批量处理进行了优化。

OpenAI 推出 AI 语音大模型

两款模型现在均可利用录音的自由形式上下文信息(如关键词、特定领域术语的名称及预期语言)来提升准确率。其中,GPT-Live-Transcribe 还能自动将此前转录的内容作为上下文参考。


在 OpenAI 的上下文感知自动语音识别(Context Aware ASR)基准测试中,加入上下文信息后,GPT-Live-Transcribe 的语义准确率从 38.5% 提升至 44.6%,GPT-Transcribe 则从 41.6% 提升至 45.2%。在另一项真实场景音频基准测试中,GPT-Live-Transcribe 的转录错误率为 9.60%,优于 GPT-Realtime-Whisper 的 11.65%;GPT-Transcribe 的错误率为 8.98%,相较 Whisper-1 的 15.21% 有显著改善。


据 Artificial Analysis 报告,GPT-Transcribe 的词错误率为 3.31%,相较 OpenAI 此前的模型有明显进步,其定价为每 1000 分钟 4.50 美元。


OpenAI 官方表示:“我们正在 API 中推出两款新的转录模型:GPT-Live-Transcribe 专为低延迟实时转录打造,GPT-Transcribe 则优化了已完成音频文件和批量任务的异步转录。两款模型均能更好地理解上下文...”


阿里巴巴则发布了 Qwen-Audio-3.0-Realtime Plus 和 Flash 模型,专注于端到端的语音到语音对话。与 GPT-Live 类似,这些新模型支持全双工交互,允许用户在 AI 说话时打断,并支持函数调用和自定义克隆声音。


事实上,阿里巴巴的 Qwen-Audio-3.0-Realtime Plus 目前在 Artificial Analysis 的语音到语音指数中以 84.1% 的得分位居榜首,领先于 OpenAI 的 GPT-Realtime-2.1 High(79.1%)。该模型在语音推理、对话动态和智能体性能测试中均表现优异。不过其劣势在于响应启动较慢:Artificial Analysis 发现,其首次音频响应时间约为 4 秒,而 GPT-Realtime-2 High 约为 1.14 秒。

热门教程
格式转换工厂 音频格式转换器
办公软件,就选简鹿 简便、快捷、高效

客户服务

帮助中心

关注我们

百家号 搜狐号 抖音号 CSDN B站平台
QQ客服
QQ:3236169202 复制
简鹿办公QQ客服二维码
微信客服
微信:jianlu365 复制
简鹿办公微信公众号
回到顶部