剑指 CUDA!DeepSeek 开源华为昇腾全套组件,TileLang 能否成为国产算子新标准

9月30日,DeepSeek 宣布正式开源面向华为昇腾平台的全套基础设施组件,涵盖编程语言 TileLang、计算库与分布式通信库,与此前面向英伟达平台的开源组件一一对应。这一举动被业界视为中国 AI 芯片软件生态「换轨」的关键一步。

事件背景

过去数年,国产 AI 芯片的真正瓶颈从来不在晶体管,而在软件:英伟达的护城河是 CUDA 十八年积累的生态、数百万开发者与「写一次到处能跑」的体验。算力规格一次次逼近,客户却常在最后一步犹豫——迁移成本太高。DeepSeek 此次开源,正是要将训练前沿模型所需的软件栈,从对英伟达的单一依赖中解放出来。

核心内容

本次开源的核心是 TileLang 昇腾版本,它对昇腾底层指令进行封装,让开发者用更简单的高级语言编程,同时不损失硬件性能。DeepSeek 表示,建立新一代自主可控 GPU 软件生态,首要之事就是建立通用、易编程且能触达硬件性能上限的高级语言——TileLang 在此背景下诞生,已在英伟达成熟平台上承载了 DeepSeek V4 系列大部分算子实现。

双方还共同推进了基于昇腾 950 的 128 卡超节点方案:华为提供 SuperPoD Flex 与 UBL128 组网,实现 128 卡 3.2Tbps 单层交换 Scale-up 与 256K 卡两层交换 Scale-out,支撑超低时延推理与大规模训练。实测互联带宽达 Dispatch 375GB/s、Combine 347GB/s,接近硬件上限。

此外开源的五个关键组件覆盖了训练核心环节:DeepGEMM(通用矩阵运算)、DeepEP(大规模跨设备通信)、TileKernels(向量计算与访存算子)、FlashMLA(稀疏注意力)、DeepSelect(数据筛选)。在多项测试中,这些组件的计算与通信性能已接近硬件上限。DeepSeek 称,其训练中用到的每一个 TileLang 算子,在昇腾上都有了对应的高性能实现。

影响与解读

TileLang 的战略价值在于「换轨」:算子写在 TileLang 里,后端可指向英伟达、昇腾,也可指向任何愿意实现编译后端的芯片。若这一路径成立,寒武纪、海光、摩尔线程、沐曦等国产芯片有望第一次共享跨芯片的算子生态,从根本上缓解碎片化困局。

但挑战同样现实:CUDA 积累十余年、拥有数百万开发者,TileLang 要从「可用」走到「开发者主动选择」,仍需持续运营与迭代;而昇腾自身的算力迭代能力,也将决定这套生态最终能支撑多大的模型与场景。

相关动态

据公开信息,DeepSeek 还规划在内蒙古建设可容纳不少于 16 万张华为昇腾加速卡的智算中心,进一步夯实「芯模协同」的落地规模。

信息来源:财联社 / 科创板日报、中华网科技、Analytics Insight

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。