阿里千问发布 Qwen3.8-Omni-Flash:原生全模态模型,音视频成本骤降超九成

9月18日,阿里巴巴千问团队正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash。该模型支持文本、图像、音频、视频四种输入,提供 100 万 Token 上下文窗口,核心目标是把全模态模型从「理解内容」推向「规划任务、调用工具并完成创作」。

事件背景

过去的多模态应用通常要把视频抽帧、音频转写,再把结果交给语言模型处理,链路冗长。Qwen3.8-Omni-Flash 尝试在模型层面原生处理不同模态,利用超长上下文直接消化大规模原始音视频,减少切片与拼装。

核心内容

据千问官方数据,相比上一代 Qwen3.5-Omni-Plus,该模型在 29 项基准测试平均得分提升超 25%;在 WildClawBench-MM 上提升 36.5 分、AgenticVBench 上提升 22.3 分,UniClawBench 取得 69.6 分。音频能力整体超过 Gemini 3.8 Flash、音视频能力接近该模型:WildClawBench-MM 中 Qwen 71.0 分对 Gemini 58.9 分,SpotSoundBench 中 67.2 对 39.7。多说话人会议识别(AliMeeting)的说话人错误率 DER 从上一代 88.11 降至 3.35,词错误率 cpWER 由 89.61 降至 17.18。

价格是其最大变量:官方称音频输入估算成本每小时下降超 98%,音视频输入每小时下降超 93%。阿里云国际区域定价为每百万输入 Token 0.15 美元、缓存输入 0.016 美元、输出 0.47 美元,显著低于 Gemini Flash 的 1.5/9.0 美元。模型支持 113 种语言与方言音频、空间音频分析、函数调用与联网搜索,已通过阿里云百炼在北京、新加坡、中国香港、东京、法兰克福、弗吉尼亚等区域提供服务。

影响与解读

若实际成本接近官方测算,长会议录音、播客、直播与大量视频素材的自动分析将变得极廉价的。模型本身未直接开放权重,但阿里同步开源 Qwen-MM-Plugins 与 Qwen-Live-Harness 等配套开发工具,进一步加剧与 Google Gemini 在多模态领域的竞争。

相关动态 / 展望

「智能体交付」是本次重点:模型可分析长视频、定位关键内容并调用工具完成剪辑、整理、会议总结与字幕生成。Qwen 团队还计划推出 Qwen-Live-Harness 以支撑实时交互智能体。

信息来源:Qwen 官方博客|网易科技报道

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。