产品帮助中心
欢迎来到简鹿技术支持中心,我们可以为您提供哪些帮助?

阿里 Qwen3.8-Omni-Flash 音频表现力压谷歌 Gemini

时间:2026-09-18 作者:小鹿 来源:简鹿办公
简鹿人声分离
官方正版
纯净安全
软件评分:
简鹿人声分离是一款高效的音频分离软件,能一键批量从音频或视频中分离出高质量的人声和伴奏,并支持视频降噪和乐器声提取,满足不同环境下的专业音频处理工具。
Win下载 Mac下载

阿里巴巴正式发布了其最新 AI 模型 —— Qwen3.8-Omni-Flash。作为一款原生全模态模型,它不仅支持百万级 Token 的超长上下文窗口,还大幅降低了 API 调用成本(音频输入价格直降 98%),并全面兼容 OpenAI 的接口协议。

Qwen3.8-Omni-Flash

据阿里介绍,该模型现已上线 Qwen 网页端聊天界面及移动端 App,用户只需在模型选择器中手动切换即可使用。作为一款全模态模型,它能够流畅处理文本、图像、音频及视频等多种输入形式。在成本控制方面,除了音频输入成本降低 98% 外,视听混合输入的成本也下降了超过 93%。


在性能基准测试中,Qwen3.8-Omni-Flash 在 OmniVideoBench 上的得分从 63.4 提升至 67.8,同时 Token 消耗量大幅减少 45.7%(从 145,736 降至 79,117)。


针对长视频处理能力,阿里巴巴表示:

Qwen3.8-Omni-Flash 实现了长程视听理解能力的重大飞跃——从精准的内容描述与代理式证据搜集,到会议理解及后续任务推进,直至生成以视频为核心的深度研究报告。它不再仅仅是‘处理’更长的内容,而是能够更精准地定位关键证据、进行更深层次的逻辑推理,并更高效地执行任务。


在与西方主流模型的横向对比中,基准测试数据显示 Qwen3.8-Omni-Flash 的表现与 Gemini 3.8 Flash 不相上下。不过阿里也指出,具体的测试结果会因采用“状态模式”还是“代理执行模式”而存在差异。


对于普通用户,只需在网页版 Qwen Chat 或移动版 Qwen Studio 的下拉菜单中选择该模型即可开始体验。对于开发者,只需配置 DashScope 的基础 URL 并设置 DASHSCOPE_API_KEY 环境变量,即可通过标准的 OpenAI 兼容客户端库直接调用。


阿里并非唯一一家紧追西方前沿模型的中国 AI 企业。DeepSeek 近期发布的 DeepSeek V4.1-Flash 在部分基准测试中已能与 GPT-5.6 Sol 媲美。尽管受限于美国对华高端芯片的出口管制,中国模型此前主要聚焦于提升运行效率,但随着华为宣布加速推出新一代 Ascend 960DT AI 芯片,中国 AI 企业有望从“追赶者”转变为“超越者”,在性能上实现对西方模型的赶超。

热门教程
格式转换工厂 音频格式转换器
办公软件,就选简鹿 简便、快捷、高效

客户服务

帮助中心

关注我们

百家号 搜狐号 抖音号 CSDN B站平台
QQ客服
QQ:3236169202 复制
简鹿办公QQ客服二维码
微信客服
微信:jianlu365 复制
简鹿办公微信公众号
回到顶部