DeepSeek V4.1-Flash 上线:新架构推理效率大增,1M 上下文、KV Cache 大幅压缩

9 月 10 日,DeepSeek 正式上线 V4.1-Flash 模型。官方介绍,该模型依托全新 Causal Encoder–Decoder(因果编码器—解码器)架构,推理效率获得大幅提升。

事件背景

进入 2026 年下半年,DeepSeek 在经历外界对其迭代放缓的质疑后重新提速:4 月发布 V4,6 月推出 V4.1,从灰度测试到全量路由仅相隔约半个月,迭代周期被压缩到“月”甚至“周”级别。V4.1-Flash 是这一加速节奏下的最新成果。

核心内容

公开资料显示,V4.1-Flash 的主要特性包括:

  • 采用新的架构设计,在保持强编码与推理指标的同时显著降低推理开销。
  • 支持约 100 万词元(1M)的上下文窗口,并对 KV Cache(键值缓存)占用进行了大幅压缩,有利于长文本与高并发场景下的成本下降。
  • DeepSeek 宣布自 9 月 14 日起退役 V4-Flash 系列变体,将所有 V4-Pro API 请求路由至 V4.1-Flash。

影响与解读

V4.1-Flash 延续了 DeepSeek 一贯的“高性能、可控成本”路线,对长上下文与高吞吐生产工作负载尤其友好。在众多厂商追逐最贵前沿席位的同时,DeepSeek 选择以速度与性价比切入,进一步加剧全球模型市场的分层竞争。

相关动态与展望

在算力侧,DeepSeek 计划在内蒙古乌兰察布部署至少 16 万颗国产芯片用于模型推理,今年前 7 个月其在 AI 基础设施上的支出约为去年的近 10 倍,显示出从“算力使用者”向“算力基础设施建设者”的角色转变。

信息来源:央广网、LM Market Cap 等。

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。