想象这样一个场景:你向一个 AI 助手抛出一个问题,它在一两秒内给出答案。这个看似平常的过程背后,其实是一场精密的"接力赛"——数据要在计算单元、内存、多张芯片之间飞速穿梭,每一棒都不能掉链子。
而这场接力赛的"跑道",过去几乎只有英伟达一家能铺。直到 2026 年 9 月 30 日,DeepSeek 把一套面向华为昇腾芯片的"跑道"给开源了。
这篇文章,我们就用"接力赛"这个比喻,把这六个组件是怎么配合的、为什么重要,一次讲清楚。
一、先聊聊"算力"这件被忽略的小事
很多人以为,大模型厉害是因为"模型大"。这话只对了一半。真正的门槛,往往藏在更底层——你用什么芯片、用什么软件栈,去驱动这些庞大的计算。
打个比方:模型像一辆性能强悍的跑车,但跑车要跑起来,得靠一条好路(芯片),还得有一套熟练的驾驶系统(软件栈)。英伟达之所以能称霸 AI 江湖,靠的正是"路"和"驾驶系统"都做得极好——尤其是它的 CUDA 软件生态,几十年积累,成了所有 AI 开发者默认的"驾驶习惯"。
DeepSeek 的算力布局,其实一直是"双路并行":训练主力用英伟达的卡,推理部分则早早用上了华为昇腾。也就是说,昇腾并不是"新面孔",而是一直在后台默默干活的老伙计。
转折出现在 2025 年。路透社在当年 1 月报道,DeepSeek 的 R1 模型发布后,有关部门鼓励它采用华为昇腾处理器。随着海外高端芯片出口持续收紧,越来越多的企业把算力供给转向国产。到了 2025 年 9 月,伴随 DeepSeek-V3.2-Exp 发布,昇腾完成了关键算子的适配——这算是这次大开源前的一次"热身"。
真正的重头戏在 2026 年 4 月 24 日:DeepSeek-V4 选择在昇腾平台首发,底层代码从 CUDA 体系整体迁移到华为自研的 CANN 框架,据说涉及 200 多个算子的重写。到 2026 年 9 月 30 日,DeepSeek 干脆把这套"昇腾版"的底层组件全部开源。
一句话概括:这不是一次普通的开源,而是把"国产芯片的软件生态"从零开始搭起来,并且公开给所有人。
二、六个组件,就是一场接力赛的六个赛段
要理解这六个组件,最好的方式不是背功能列表,而是想象一次推理请求在芯片里"跑"的过程。我们把这场接力赛拆成几个赛段,每个赛段对应一个组件。
第一棒:TileLang —— 写"接力指令"的语言
接力赛要跑,首先得有人写比赛规则、发号施令。在芯片世界里,这个"发号施令"的角色,就是编程语言。
TileLang 是 DeepSeek 自研的高级编程语言,它在国产芯片上的角色,就相当于英伟达生态里的 CUDA。它的本事在于:把底层那些晦涩的硬件指令,包装成人类更容易读懂的代码,让开发者不用死磕硬件细节,也能写出高性能的算子。
在昇腾上,它封装的是华为的 Ascend C 指令,还专门针对芯片里的两类计算单元——矩阵计算单元和向量计算单元——做了优化。
对我们这些写代码的人来说,最直观的感受是:写算子的门槛降低了,代码更好读了。 这就像是把一份复杂的比赛规则,翻译成了普通人也能看懂的说明书。
第二棒:DeepGEMM-Ascend —— 负责"重体力活"的矩阵运算
接力赛里最累的赛段,往往是矩阵运算——大模型里绝大多数计算量都集中在矩阵乘法上。
DeepGEMM 就是专门干这个的加速库。昇腾版和它的英伟达版完全兼容,支持 BF16、FP8、FP4 等多种精度,还能处理大模型特有的 MoE 计算。它最贴心的地方是:把昇腾芯片底层的矩阵排布、对齐、地址计算这些繁琐细节,统统封装了起来。
你不需要懂芯片底层的"排兵布阵",也能把矩阵运算跑得快。 这就像接力赛里,你不用亲自研究怎么摆接力棒,只管全力冲刺就行。
第三棒:DeepEP-Ascend —— 负责"接力棒交接"的通信
接力赛最容易出问题的环节,是交接棒。大模型训练和推理也一样——数据要在多张芯片之间来回传递,一旦通信慢,再快的计算也白搭。
DeepEP 就是解决"交接棒"问题的分布式通信库。它负责在多张芯片之间高速传输数据,覆盖了专家并行、上下文并行、流水线并行等主流的并行模式。
实测数据很能说明问题:它的传输速度已经接近硬件的物理上限。这意味着通信不再是拖后腿的环节,算力能被真正榨干。
第四棒:TileKernels —— 基础动作的"常规赛段"
除了重体力的矩阵运算,模型里还有大量常规的向量计算和内存读写。这些动作单独看不大,但数量极多,是这场接力赛里最频繁的"常规赛段"。TileKernels 就是负责这些基础动作的组件。
第五棒:FlashMLA —— 长文本场景的"特殊赛段"
当你的问题很长(比如要读完一整篇文章),模型需要处理的注意力计算会爆炸式增长,这是长文本推理最大的瓶颈之一。
FlashMLA 就是专门啃这块硬骨头的稀疏注意力算子。它优化了长上下文下的注意力计算,让模型在处理超长文本时,不至于被计算量拖垮。
第六棒:DeepSelect —— 精准"挑选"的筛选赛段
最后这一棒,是负责"挑选"的。大模型里经常需要从一堆候选里,挑出最关键的几个——比如从几百个专家里选出最相关的,或者从海量信息里筛出最重要的。
DeepSelect 就是干这个的,它负责从候选数据里选出得分最高的 K 项,专门服务稀疏注意力和采样器这类场景。
三、和英伟达那边,其实是一一对应的
看到这里,你可能发现了:这六个组件,怎么越看越像英伟达生态里那些熟悉的名字?
没错。DeepSeek 官方也反复强调"一一对应"。我们用一张表把这种对应关系理清楚:
| TileLang | 写算子的高级语言 | CUDA |
| DeepGEMM-Ascend | 矩阵运算加速 | cuBLAS / CUTLASS |
| DeepEP-Ascend | 跨卡通信 | NCCL |
| TileKernels | 基础向量/访存算子 | (基础算子层) |
| FlashMLA | 稀疏注意力 | FlashAttention |
| DeepSelect | TopK 筛选 | (采样/稀疏算子) |
这张表最有意思的地方,不在于"抄了谁",而在于它把英伟达生态的每一层,都在国产芯片上补了一个对应的开源实现。 英伟达有的语言、矩阵库、通信库、注意力算子,DeepSeek 都在昇腾上放了一份。
四、跑得快不快?数据说话
说一千道一万,最后还是得看跑得怎么样。这次公开的数据,确实拿得出手:
- 传输速度:跨卡通信实测接近硬件上限,速度非常可观。
- 推理速度:整体吞吐达到了数千 tokens/s 的量级。
- 超节点算力:华为昇腾 950 超节点,4096 卡规模,FP8 算力达到 8 EFLOPS,计划 2026 年 Q4 批量上市,还能扩展到 8192 卡组网。
- 响应时延:在 8K 输入场景下,跑 V4-Pro 单 token 解码时延约 20 毫秒,V4-Flash 约 10 毫秒。
- 吞吐表现:在特定超节点上部署 V3/R1,50 毫秒时延约束下,单卡解码吞吐突破 1920 tokens/s。
DeepSeek 官方更是放话:“训练中用到的每一个算子,在昇腾上都有对应的高性能实现。”
这句话的分量在于——它证明国产芯片不只是"能跑",而是"能跑得快"。这对很多被算力卡脖子的团队来说,是实打实的希望。
五、这场开源背后,到底图什么?
技术开源只是表面,真正值得琢磨的,是背后的算盘。
1. 想打破"只有英伟达能跑"的魔咒
英伟达最大的护城河,从来不是芯片本身,而是它的软件生态——几百万开发者、几十年积累、无数库和工具。这套生态一旦形成,别人想换赛道,成本高得吓人。
DeepSeek 这次开源,等于在向行业喊话:不必再被这一家绑死,你可以用我的这套工具写一次代码,跑在别的芯片上。 这是对"开发者习惯"的直接争夺。
2. 给国产芯片"搭桥"
对华为来说,这简直是"天上掉馅饼"。有网友调侃:"有人帮他们搭基础环境,这还愁卡卖啊?“话糙理不糙——DeepSeek 相当于免费帮国产芯片补齐了最缺的"软件栈"这一环,让芯片从"能卖"变成"好卖、好用”。华为也在同一天开源了双方联合创新的成果,覆盖模型部署、大规模训练等场景。
3. 商业上的"组合拳"
- 融资与估值:DeepSeek 据称以超 200 亿美元估值完成首轮外部融资,腾讯、阿里参与其中。
- 算力采购:据称采购了 16 万颗华为昇腾芯片。
- 定价策略:其模型 API 定价大幅下调,意在建立行业定价标准。
4. 生态号召力
这套工具正在成为国产芯片上"事实上的标准"。当越来越多的开发者开始用它写算子,英伟达的垄断地位就会一点点松动。这就像一场接力赛,刚开始只有一支队伍在跑,但赛道一旦铺好,就会有更多人加入。
六、也得泼点冷水
当然,任何值得高兴的事,都要留一分清醒。
有分析一针见血地指出:“99.8% 是真的,部分算子仍只支持 CUDA 也是真的。”
这句话的意思是:DeepSeek 的适配确实做得很扎实,绝大多数算子都实现了高性能移植;但并不是 100% 覆盖,仍有一部分算子只在英伟达那边能用。这是"基本可用"到"完全可用"之间的真实差距。
另外,DeepSeek 的算力布局仍是双路线并行——训练主力在英伟达,推理在昇腾。昇腾版组件更多是支撑推理侧,要完全替代英伟达生态,还有很长的路要走。
七、写在最后
这场开源的意义,不在于"又开源了一个项目",而在于它给国产 AI 芯片生态,铺下了一条真正能跑起来的赛道:
- 第一次有头部模型厂商,系统性开源面向国产芯片的整套软件栈;
- 第一次让"摆脱英伟达绑定"这件事,从口号变成了可运行的代码;
- 第一次用实测数据证明,国产芯片不仅能跑大模型,还能跑得快。
对开发者来说,这是一份礼物——你不再被单一生态绑架,可以选择国产芯片,而且有一套成熟、高性能、开箱即用的工具链。
对行业来说,这是一次宣言——AI 算力的未来,不该只属于一家公司。
一场接力赛,刚刚鸣枪。
网硕互联帮助中心
![[AI工程]Jev 决策模型第二篇:三原语、一次多问与置信度路由,从 Playground 到能上线的代码-网硕互联帮助中心](https://www.wsisp.com/helps/wp-content/uploads/2026/10/20260930182734-6abd5496850ec-220x150.png)
![别再只搜“免费一键生成”了:小学道法专业毕业论文,工具要这样搭 [特殊字符]-网硕互联帮助中心](https://www.wsisp.com/helps/wp-content/uploads/2026/10/20260930164131-6abd3bbbec271-220x150.png)


评论前必须登录!
注册