
9月18日,阿里巴巴千问团队正式上线新一代原生全模态模型Qwen3.8-Omni-Flash,可同时处理文本、图像、音频与视频输入,支持100万token(1M)上下文窗口,定位为长音视频工作流的智能体栈。
事件背景
在Qwen3.5-Omni-Plus之后,行业对“一模型处理多模态长程任务”的需求快速升温。Qwen3.8-Omni-Flash不再只是字幕/描述演示,而是面向规划任务、工具调用与成品媒体资产交付的Agent管线。
核心内容
据官方披露,在约30项公开与内部基准上,新模型较上一代平均提升超过26%,其中智能体音视频与长程任务增益尤为明显:
- WildClawBench-MM 提升36.5分,AgenticVBench 提升22.3分;
- AliMeeting说话人分离错误率/词错率由88.11/89.61降至3.35/17.18;
- 智能体模式下OmniVideoBench准确率由63.4升至67.8,token消耗降低约45.7%。
会议场景支持最长一小时音视频输入,完成说话人切分、转录、纪要生成与邮件/编码等后续动作;实时版Qwen3.8-Omni-Flash-Realtime支持低延迟流式响应与空间音频线索。
影响与解读
API定价方面,小时级音频输入价格下调超98%、音视频输入下调超93%,被业界视为“能力跃升+低成本生产路径”的双击。阿里同时开源Qwen-Live Harness,降低实时连续多模态交互的接入门槛。
相关动态 / 展望
在Gemini、DeepSeek等同样押注长上下文与多模态的格局下,Qwen3.8-Omni-Flash以激进定价压缩推理毛利,有望加速“生产级全模态智能体”在会议、媒体生产、客服等场景的落地。
信息来源:Pandaily / AllWorld.Media
声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。

评论(0)