云计算百科
云计算领域专业知识百科平台

看完这篇,看懂大模型架构图!MoE/GQA/MLA黑话大白话解析

文章目录

      • 1. 最基础的入门黑话
        • 1.1 参数与激活参数:别再被770B、49B绕晕
        • 1.2 MoE全家桶:说白了就是公司部门分工
        • 1.3 Dense FFN:传统的“全员加班”模式
      • 2. 模型尺寸相关的三个词
        • 2.1 Layer层:模型的“加工工序”
        • 2.2 Hidden Size:每个Token的“简历长度”
        • 2.3 Context Length:模型的“开卷篇幅”
      • 3. 注意力机制那堆字母:GQA、MLA、DSA
        • 3.1 GQA:共享档案的省钱操作
        • 3.2 MLA:直接把档案压缩成摘要
        • 3.3 DSA:先海选再精算,注意力也搞“初筛”
        • 3.4 Gated DSA:给注意力加个“音量旋钮”
        • 3.5 IndexCache:不用每层都重新筛简历
      • 4. 残差连接的进化:从一本笔记到四本并行
        • 4.1 残差连接:防止做着做着忘了原题
        • 4.2 残差流:贯穿全程的公共笔记本
        • 4.3 iHC:直接搞四本并行笔记本
        • 4.4 mHC:笔记本之间还能互相抄
        • 4.5 Qwen GR:异曲同工的四路残差
        • 4.6 AttnRes:直接翻前面层的笔记
      • 5. 线性注意力+混合架构:长上下文的终极省钱大法
        • 5.1 线性注意力:边读边记笔记,不存原始档案
        • 5.2 KDA和GDN:还能控制“遗忘速度”
        • 5.3 混合架构:平时记摘要,要细节再翻书
        • 5.4 QSA、IndexPool:连海选步骤都开始压缩
        • 5.5 DeepSeek的CSA/HCA:压到极致再找
      • 6. 推测解码:让模型生成速度直接起飞
      • 7. 量化:把1.5T的模型塞进200G硬盘
        • 7.1 量化的三层境界:别再被BF16、INT4、GPTQ绕晕
        • 7.2 浮点格式:BF16为啥成了香饽饽
        • 7.3 Scale和MX:给每组数字配个专属尺子
        • 7.4 W4A16:权重压到4bit,计算还用高精度
        • 7.5 GPTQ、AWQ:压缩算法的卷王
        • 7.6 GGUF的那些后缀:Q4_K_M到底是啥

在这里插入图片描述
P.S. 推荐一个大神的教程给想要了解或者学习人工智能知识的读者,这个教程里内容讲解通俗易懂且风趣幽默,对我帮助很大。我想与大家分享这个宝藏教程,请点击下方链接查看,
传送门https://blog.csdn.net/qq_74013365

最近大模型圈跟赶年底KPI似的,GLM 5.3 Flash、Qwen 3.8 Flash、Hy4 Preview扎堆发布。每次点开官方架构图我都怀疑自己是不是学了假计算机,MoE、Top-8、GQA、MLA、DSA……一串字母甩脸上,跟看摩斯密码没区别。

今天就用人话把这些黑话全唠明白,保证看完再去看架构图,你也能装成半个大模型架构师。

1. 最基础的入门黑话

1.1 参数与激活参数:别再被770B、49B绕晕

参数就是模型脑子里存的“知识点+做题公式”,理论上参数越多越聪明,但占显存也越狠,好比你硬盘里存的剧越多,剩余空间越捉襟见肘。

激活参数才是“干活的”:你每发一个字,真正参与计算的参数就这么多。

打个比方,公司总共有1000号员工,但你这个项目只拉了50个人进场,总人数就是总参数,干活的50个就是激活参数。

比如Hy4总参数770B,每个Token实际只激活约49B,主打一个“人海储备,精英干活”,性价比拉满。

1.2 MoE全家桶:说白了就是公司部门分工

MoE(混合专家),就是把原本一个大部门拆成一堆并行的小专家组,每次只叫几个人上班,剩下的摸鱼。

Router就是小组长,给每个专家打分,决定这活具体派给谁。

Top-8更直白:256个专家里挑得分最高的8个出来干活,多一个都不叫,主打一个精准用工。

共享专家就是行政部,不管什么业务都得走一遍流程,处理语法、基础语言理解这种通用事儿,省得每个专家都重新学一遍怎么发邮件、走审批。

顺便提一句,别真以为专家是“代码专家”“金融专家”,训练完可能确实有分工,但没人给它们贴标签,纯纯开盲盒,你也不知道它到底擅长啥。

1.3 Dense FFN:传统的“全员加班”模式

和MoE对着来的就是Dense FFN,所有Token都走完整一套参数,相当于不管啥项目,全公司所有人都跟着加班。

好处是稳定没毛病,坏处是人越多越费钱,参数越大计算成本越高。

Hy4就很鸡贼,第一层用Dense FFN打基础,后面77层全上MoE,主打一个该省省该花花,基础岗全员到齐,业务岗按需上班。

2. 模型尺寸相关的三个词

2.1 Layer层:模型的“加工工序”

一层就是一次“注意力+前馈网络”全套加工,层数越多,加工次数越多,理解理论上越深。

好比奶茶店做奶茶,摇茶、加料、封口、装袋,一层就是一道工序,78层就是给你反复加工78遍,味儿肯定更足。

2.2 Hidden Size:每个Token的“简历长度”

每个Token进模型,都会转成一串数字向量,Hidden Size就是这串数字有多长。

越长能装的信息越多,就像你找工作填简历,给你A4纸能写满项目经历,给你便签纸只能写个姓名电话。

但越长计算越慢、显存越炸,属于典型的能力越强,开销越大,没有免费的午餐。

2.3 Context Length:模型的“开卷篇幅”

一次请求最多能塞多少Token,决定了模型能一次性看多少文档、多少对话历史。

1M上下文大概能塞一整个代码库,相当于考试开卷能抱一摞书进去,爽是真爽,就是翻起来费劲儿。

3. 注意力机制那堆字母:GQA、MLA、DSA

先铺垫一句人话版注意力:模型生成下一个字的时候,拿当前的“问题”去翻历史的“目录”,再取出对应的“内容”。

  • Query = 我现在要找啥
  • Key = 历史内容的目录
  • Value = 历史内容本身
  • KV Cache = 已经整理好的历史目录和内容,存着不用重新算
3.1 GQA:共享档案的省钱操作

普通多头注意力,每个查询头都存一套完整的KV,相当于64个调查员每人复印一整套档案,纯纯浪费纸。

GQA(分组查询注意力)就是每8个调查员共用一套档案,64个查询头只需要存8组KV。

Query还是各查各的问题,只是档案不用印那么多份了,主打一个省内存、省带宽,长上下文场景特别好用。

3.2 MLA:直接把档案压缩成摘要

MLA(多头潜在注意力)更狠,直接把KV压成更短的“压缩包”,要用的时候再解压参与计算。

好比别人存完整档案,它存档案摘要,每个历史Token就留个512维的“小档案”。

GQA是少存几份完整的,MLA是每份都给你压薄,压缩力度更猛,百万上下文下KV Cache占用直接砍一大截。

3.3 DSA:先海选再精算,注意力也搞“初筛”

就算KV压得再小,100万Token一个个看过来,计算量还是爆炸。

DSA(稀疏注意力)加了个轻量Indexer先海选:先给所有历史Token打个分,挑出最相关的2048个,主注意力只算这2048个。

就像招人的时候HR先筛简历,把符合要求的挑出来,技术面再慢慢面,不用一万份简历都让技术岗挨个看。

复杂度直接从O(L²)降到O(Lk),k就是2048,主打一个效率优先。

3.4 Gated DSA:给注意力加个“音量旋钮”

Gate就是阀门,对注意力输出逐元素控制,决定这次查出来的信息,有多少能进入下一层状态。

Indexer管“看哪里”,Gate管“看出来的东西用多少”。

好比你查资料找到了一堆内容,Gate决定哪些重点记下来,哪些随便看看就行,相当于给每个信息点单独调音量。

3.5 IndexCache:不用每层都重新筛简历

DSA每层都要跑一遍Indexer重新挑位置,但相邻层挑的其实都差不多,纯重复劳动。

IndexCache就把层分组,几层自己算一次,剩下的直接复用结果。比如第0、1层自己筛,2、3、4层直接抄第1层的名单,第5层再自己筛,以此类推。

Hy4里73.1%的层都省掉了独立Indexer,Prefill直接加速1.82倍,属于典型的“能抄就抄,绝不重复干活”。

4. 残差连接的进化:从一本笔记到四本并行

4.1 残差连接:防止做着做着忘了原题

普通Transformer每层都是“旧状态 + 新计算 = 新状态”,旧状态直接保留的那条路就是残差连接。

没有它的话,模型越深,前面的信息忘得越快,好比你做数学题,做着做着忘了题目问的啥。

有了残差连接就像记笔记,旧笔记 + 新批注 = 新笔记,不用每层都从头开始写。

4.2 残差流:贯穿全程的公共笔记本

残差流就是贯穿所有层的那条信息通道,普通Transformer只有一条,注意力和FFN都从这读,写完再放回去。

相当于全公司共用一本公共笔记本,所有人都往上写,也都从这看,传着传着早期的字就模糊了。

4.3 iHC:直接搞四本并行笔记本

iHC(身份超连接)直接给每个Token搞四条并行的残差流,每条都是独立的笔记本。

每层工作的时候,先决定从哪几本里读、各读多少,算完再决定写回哪几本、各写多少,全动态分配。

比如读取权重可能是这样:

[0.5, 0.2, 0.2, 0.1]

写回权重可能是这样:

[1.0, 0.1, 0.7, 0.4]

普通模型是一条信息高速路,iHC直接修成四车道,还能动态调车道优先级,早期信息不容易被后面的内容冲没。

4.4 mHC:笔记本之间还能互相抄

mHC和iHC类似,但多了个流间混合矩阵,允许不同流之间交换内容。

iHC是各写各的,互不干扰;mHC是允许你把1号本的内容抄一部分到2号、3号本里。

信息交流更强,但也容易出现一本独大、其他本被冲淡的问题,所以加了Sinkhorn约束,防止信息全挤到一条道上。

4.5 Qwen GR:异曲同工的四路残差

Qwen3.8的GR也就是门控残差,同样是四路残差流,逐元素读门控,按分支写门控。

有意思的是训练完会自然跑出一条“长途主干道”,专门把早期信息传到深层,工程师都不用特意设计,模型自己跑出来的,属于进化出最优解了。

4.6 AttnRes:直接翻前面层的笔记

普通残差是每层都往上加,越到后面,早期信息越被稀释,好比你写了80页笔记,前面的内容早就记不清了。

AttnRes就不一样了,当前层可以自己决定:我要参考前面哪几层的结果。

相当于做到第80层,觉得第20层的结论特别重要,直接翻回去重点看,不用靠残差一点点传下来。

普通注意力是在“上下文长度”里找信息,AttnRes是在“深度”里找信息,属于跨层检索。

给大家总结个好记的版本:

  • 普通残差 = 一本笔记从头写到尾
  • iHC / GR = 同时写四本并行笔记
  • mHC = 四本笔记之间还能互相抄
  • AttnRes = 写累了直接翻前面的章节看

5. 线性注意力+混合架构:长上下文的终极省钱大法

5.1 线性注意力:边读边记笔记,不存原始档案

普通注意力是把所有历史Token都存着,要用就翻,相当于把整本书都放你面前,翻哪页都行。

但上下文到100万Token,就算压了KV,存着也费劲,跟你硬盘塞了1000部电影似的,找起来都卡。

线性注意力换了思路:一边读,一边把信息压缩进一个固定大小的“工作笔记”里,后面就带着这本笔记走。

相当于你看书不存原著,只记读书笔记,书越厚,笔记优势越明显,因为笔记大小永远不变。

5.2 KDA和GDN:还能控制“遗忘速度”

KDA(Kimi Delta Attention)和GDN(Gated DeltaNet)都是线性注意力的路子,核心是维护一个固定大小的循环状态。

KDA更狠,能控制不同信息的遗忘速度:比如“这是个Flutter项目”这种大局信息,记久一点;“刚才这个变量值是17”这种细节,过会儿就可以忘。

不是光往笔记里加,还得学会什么该留、什么该盖、什么该慢慢忘,非常像人类的记忆模式。

5.3 混合架构:平时记摘要,要细节再翻书

线性注意力有代价:压缩多了,精确细节就难找了,毕竟笔记再详细也不如原文。

所以现在主流都是“线性注意力 + 普通/稀疏注意力”混合着来:几层线性注意力负责低成本“记大概”,插一层普通注意力负责精准“找细节”。

比如Qwen3.8是3层GDN + 1层QSA循环,Kimi K3是3层KDA + 1层Gated MLA循环。

说白了就是平时写摘要,需要查细节的时候再翻原始资料,兼顾速度和精度。

5.4 QSA、IndexPool:连海选步骤都开始压缩

之前DSA是Indexer先海选100万Token,现在连海选都嫌费事儿,开始卷海选本身了。

Qwen的QSA,先把连续Token聚成“小组块”,Indexer先判断哪个组块值得看,再进去找具体的。

相当于招人的时候先看部门,部门合适再看个人简历,不用挨个扫一万份。

GLM的IndexPool更直接,把4个Indexer Key加权压缩成1个,索引信息直接缩小4倍,再去Top-k。

简单区分:IndexPool是把本次搜索的目录压小,IndexCache是不同层之间复用目录,一个省空间,一个省次数。

5.5 DeepSeek的CSA/HCA:压到极致再找

DeepSeek V4更激进,两种注意力交替用:

  • CSA:先把每4个历史Token压成1个,再从压缩后的位置里Top-k海选,属于“压一点再挑”
  • HCA:更狠,每128个Token压成一个块,压完直接全部做注意力,连Indexer都省了,属于“压到极致全看”

一个负责精确选重点,一个负责低成本看全局,交替着来,主打一个极致省钱。

6. 推测解码:让模型生成速度直接起飞

推测解码说白了就是:找个便宜的“草稿模型”先猜后面几个字,主模型一次验证好几个。

猜中了就批量通过,猜错了就从错的地方重来,反正比一个字一个字算快。

比如一次猜4个,中了2个,这一轮就直接输出2个,速度直接翻倍,赌对了就是血赚。

Hy4自带的MTP就是干这个的,总参数10B,激活才0.7B,和主模型一起训练的,专门负责打草稿。

类似的还有EAGLE-3、DFlash这些,本质都是“打草稿 + 批量验证”,卷生成速度的神器。

7. 量化:把1.5T的模型塞进200G硬盘

7.1 量化的三层境界:别再被BF16、INT4、GPTQ绕晕

很多人看量化名词看得头大,其实分三层就全清楚了:

  • 数字本身怎么存:BF16、FP8、INT4这些,就是一个数用多少bit存
  • 一堆数字怎么组织:MXFP8、W4A16这些,就是多少个数共用一个缩放比例,权重和激活各用多少位
  • 怎么压损失小:GPTQ、AWQ这些,就是具体的压缩算法,尽量压小还不崩效果
  • 核心目标只有一个:少占空间,尽量不掉点。

    比如770B参数BF16要1.54TB,压到4bit理论上就385GB,实际玩起混合量化还能更狠。

    770B × 2 Byte ≈ 1.54 TB

    7.2 浮点格式:BF16为啥成了香饽饽

    计算机存小数,分三部分:符号位、指数位、尾数位。指数位决定能表示多大的数,尾数位决定精度有多细。

    FP16是5位指数+10位尾数,精度高但范围小,训练的时候梯度太小容易直接没了,俗称“下溢没了”。

    BF16是8位指数+7位尾数,范围和FP32一样大,精度稍差但不容易溢出。

    大模型训练里,“不溢出”比“多几位小数”重要多了,所以BF16直接成了标配。

    FP8就是继续往下压到8bit,权重内存直接减半,但是范围更小了,得靠Scale缩放来救。

    7.3 Scale和MX:给每组数字配个专属尺子

    Scale就是缩放比例:一组数字太大或太小,先缩放再存,用的时候再还原。

    不然一组数里既有0.01又有1000,为了存1000拉大范围,0.01就直接被压没了,精度直接崩。

    MXFP8就是OCP搞的微缩放,每32个元素共用一个Scale,相当于每32个人发一把自己的尺子。

    小数多的组用小量程尺子,大数多的组用大量程,各自适配,精度一下就保住了。

    所以别看名字叫FP8,实际算上Scale,平均每个元素大概8.25bit,没有真的完全8bit。

    7.4 W4A16:权重压到4bit,计算还用高精度

    W就是Weight权重,A就是Activation激活。

    W4A16就是权重存4bit省空间,真正计算的时候激活还是16bit高精度。

    相当于你把压缩包存在硬盘里,解压到内存再运行,主打一个存储和计算平衡。

    W8A8就是权重激活都是8bit,更省但精度也更低,看你愿意牺牲啥。

    7.5 GPTQ、AWQ:压缩算法的卷王

    INT4、FP4只是“目标格式”,GPTQ、AWQ是“怎么压过去”的算法。

    最粗暴的压法就是直接四舍五入,但模型里有的权重改一点就崩,有的改很多都没事,一刀切肯定不行。

    GPTQ用二阶信息补偿误差,AWQ重点保护重要的权重通道,SmoothQuant把难压的激活转移给权重。

    简单说:4bit是预算,GPTQ、AWQ是教你怎么花这4bit最值。

    7.6 GGUF的那些后缀:Q4_K_M到底是啥

    玩本地模型的肯定见过Q4_K_M、IQ3_XXS这些名字,这都是社区量化配方,不是什么统一标准格式。

    Q4不代表整个模型全是4bit,只是大概在4bit这一档,敏感层可能用更高精度,属于混合量化。

    后缀大致规律:

    • _0 / _1:早期的块量化方案
    • _K:K-quant家族,现在最常用
    • IQ:更复杂的编码,超低bit表现更好
    • TQ / STQ:三值、稀疏三值,压得最狠

    后面的_S / M / L / XL就是质量档位,越靠后文件越大、效果越稳,跟奶茶的少糖、半糖、全糖似的。

    比如UD-Q4_K_XL,就是Unsloth家的动态量化方案,整体4bit档位,偏向保质量。

    最狠的还得是Hy4的MIX-STQ1_0版本,1.5TB的模型压到200G出头,关键部分留高精度,不重要的直接往死里压,性能几乎没损失,属于把量化玩出花了。

    唠到这,现在再看那些架构图和参数表,是不是就没那么像外星文了?

    说白了这波新模型,本质就是在五个地方卷:

    • 长上下文怎么存得便宜
    • 需要细节怎么找得精准
    • 索引太贵怎么再压缩
    • 模型太深信息怎么传
    • 体积太大怎么压得小

    各家路线不同,但核心目标都是:更快、更省、更强。以后再出什么新名词,顺着这个思路套,基本都能猜个八九不离十。

    P.S. 推荐一个大神的教程给想要了解或者学习人工智能知识的读者,这个教程里内容讲解通俗易懂且风趣幽默,对我帮助很大。我想与大家分享这个宝藏教程,请点击下方链接查看,传送门https://blog.csdn.net/qq_74013365

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » 看完这篇,看懂大模型架构图!MoE/GQA/MLA黑话大白话解析
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!