
9 月 26 日,Qwen 团队发布 Qwen3.8-Omni-Flash,一款面向多模态智能体场景的模型。其采用稀疏 MoE 架构,上下文窗口达到 100 万 Token,可直接完成视频剪辑与长视频/长音频翻译,并配套两个开源框架,降低多模态应用开发门槛。
事件背景
多模态智能体正成为大模型竞争的新主轴:从”能看懂图”走向”能操作音视频、能串联工具完成任务”。Qwen 此次把智能体能力扩展到音视频维度,与当日行业”多模态智能体竞速”的焦点高度契合。
核心内容
- 架构与上下文:稀疏 MoE 设计,100 万 Token 长上下文,兼顾效率与长程理解。
- 音视频能力:可做视频剪辑、长视频翻译与长音频翻译,适配内容生产与本地化场景。
- 生态配套:同步开源两个框架,方便开发者基于该模型构建多模态应用。
影响与解读
当上下文突破百万、且原生支持音视频操作时,多模态智能体有望接管一批此前依赖人工的粗剪、字幕与本地化流程。对中小团队而言,开源权重意味着可自托管、可控成本地部署这类能力,进一步削弱闭源厂商在应用层的独占性。
相关动态
同日基础设施侧亦有进展:Google 开源 Agent 编排运行时 AX,Docker 联合 Linux Foundation 将 Sandbox Kit v3 推为开放标准,Zuse 把 Claude Code、Codex 等 CLI 编程智能体统一封装——智能体”底座标准化”趋势明显。
信息来源:AITOP 日报(2026-09-26)
声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。

评论(0)