文章目录
-
-
- 1. 最基础的入门黑话
-
- 1.1 参数与激活参数:别再被770B、49B绕晕
- 1.2 MoE全家桶:说白了就是公司部门分工
- 1.3 Dense FFN:传统的“全员加班”模式
- 2. 模型尺寸相关的三个词
-
- 2.1 Layer层:模型的“加工工序”
- 2.2 Hidden Size:每个Token的“简历长度”
- 2.3 Context Length:模型的“开卷篇幅”
- 3. 注意力机制那堆字母:GQA、MLA、DSA
-
- 3.1 GQA:共享档案的省钱操作
- 3.2 MLA:直接把档案压缩成摘要
- 3.3 DSA:先海选再精算,注意力也搞“初筛”
- 3.4 Gated DSA:给注意力加个“音量旋钮”
- 3.5 IndexCache:不用每层都重新筛简历
- 4. 残差连接的进化:从一本笔记到四本并行
-
- 4.1 残差连接:防止做着做着忘了原题
- 4.2 残差流:贯穿全程的公共笔记本
- 4.3 iHC:直接搞四本并行笔记本
- 4.4 mHC:笔记本之间还能互相抄
- 4.5 Qwen GR:异曲同工的四路残差
- 4.6 AttnRes:直接翻前面层的笔记
- 5. 线性注意力+混合架构:长上下文的终极省钱大法
-
- 5.1 线性注意力:边读边记笔记,不存原始档案
- 5.2 KDA和GDN:还能控制“遗忘速度”
- 5.3 混合架构:平时记摘要,要细节再翻书
- 5.4 QSA、IndexPool:连海选步骤都开始压缩
- 5.5 DeepSeek的CSA/HCA:压到极致再找
- 6. 推测解码:让模型生成速度直接起飞
- 7. 量化:把1.5T的模型塞进200G硬盘
-
- 7.1 量化的三层境界:别再被BF16、INT4、GPTQ绕晕
- 7.2 浮点格式:BF16为啥成了香饽饽
- 7.3 Scale和MX:给每组数字配个专属尺子
- 7.4 W4A16:权重压到4bit,计算还用高精度
- 7.5 GPTQ、AWQ:压缩算法的卷王
- 7.6 GGUF的那些后缀:Q4_K_M到底是啥
-

P.S. 推荐一个大神的教程给想要了解或者学习人工智能知识的读者,这个教程里内容讲解通俗易懂且风趣幽默,对我帮助很大。我想与大家分享这个宝藏教程,请点击下方链接查看,
传送门https://blog.csdn.net/qq_74013365
最近大模型圈跟赶年底KPI似的,GLM 5.3 Flash、Qwen 3.8 Flash、Hy4 Preview扎堆发布。每次点开官方架构图我都怀疑自己是不是学了假计算机,MoE、Top-8、GQA、MLA、DSA……一串字母甩脸上,跟看摩斯密码没区别。
今天就用人话把这些黑话全唠明白,保证看完再去看架构图,你也能装成半个大模型架构师。
1. 最基础的入门黑话
1.1 参数与激活参数:别再被770B、49B绕晕
参数就是模型脑子里存的“知识点+做题公式”,理论上参数越多越聪明,但占显存也越狠,好比你硬盘里存的剧越多,剩余空间越捉襟见肘。
激活参数才是“干活的”:你每发一个字,真正参与计算的参数就这么多。
打个比方,公司总共有1000号员工,但你这个项目只拉了50个人进场,总人数就是总参数,干活的50个就是激活参数。
比如Hy4总参数770B,每个Token实际只激活约49B,主打一个“人海储备,精英干活”,性价比拉满。
1.2 MoE全家桶:说白了就是公司部门分工
MoE(混合专家),就是把原本一个大部门拆成一堆并行的小专家组,每次只叫几个人上班,剩下的摸鱼。
Router就是小组长,给每个专家打分,决定这活具体派给谁。
Top-8更直白:256个专家里挑得分最高的8个出来干活,多一个都不叫,主打一个精准用工。
共享专家就是行政部,不管什么业务都得走一遍流程,处理语法、基础语言理解这种通用事儿,省得每个专家都重新学一遍怎么发邮件、走审批。
顺便提一句,别真以为专家是“代码专家”“金融专家”,训练完可能确实有分工,但没人给它们贴标签,纯纯开盲盒,你也不知道它到底擅长啥。
1.3 Dense FFN:传统的“全员加班”模式
和MoE对着来的就是Dense FFN,所有Token都走完整一套参数,相当于不管啥项目,全公司所有人都跟着加班。
好处是稳定没毛病,坏处是人越多越费钱,参数越大计算成本越高。
Hy4就很鸡贼,第一层用Dense FFN打基础,后面77层全上MoE,主打一个该省省该花花,基础岗全员到齐,业务岗按需上班。
2. 模型尺寸相关的三个词
2.1 Layer层:模型的“加工工序”
一层就是一次“注意力+前馈网络”全套加工,层数越多,加工次数越多,理解理论上越深。
好比奶茶店做奶茶,摇茶、加料、封口、装袋,一层就是一道工序,78层就是给你反复加工78遍,味儿肯定更足。
2.2 Hidden Size:每个Token的“简历长度”
每个Token进模型,都会转成一串数字向量,Hidden Size就是这串数字有多长。
越长能装的信息越多,就像你找工作填简历,给你A4纸能写满项目经历,给你便签纸只能写个姓名电话。
但越长计算越慢、显存越炸,属于典型的能力越强,开销越大,没有免费的午餐。
2.3 Context Length:模型的“开卷篇幅”
一次请求最多能塞多少Token,决定了模型能一次性看多少文档、多少对话历史。
1M上下文大概能塞一整个代码库,相当于考试开卷能抱一摞书进去,爽是真爽,就是翻起来费劲儿。
3. 注意力机制那堆字母:GQA、MLA、DSA
先铺垫一句人话版注意力:模型生成下一个字的时候,拿当前的“问题”去翻历史的“目录”,再取出对应的“内容”。
- Query = 我现在要找啥
- Key = 历史内容的目录
- Value = 历史内容本身
- KV Cache = 已经整理好的历史目录和内容,存着不用重新算
3.1 GQA:共享档案的省钱操作
普通多头注意力,每个查询头都存一套完整的KV,相当于64个调查员每人复印一整套档案,纯纯浪费纸。
GQA(分组查询注意力)就是每8个调查员共用一套档案,64个查询头只需要存8组KV。
Query还是各查各的问题,只是档案不用印那么多份了,主打一个省内存、省带宽,长上下文场景特别好用。
3.2 MLA:直接把档案压缩成摘要
MLA(多头潜在注意力)更狠,直接把KV压成更短的“压缩包”,要用的时候再解压参与计算。
好比别人存完整档案,它存档案摘要,每个历史Token就留个512维的“小档案”。
GQA是少存几份完整的,MLA是每份都给你压薄,压缩力度更猛,百万上下文下KV Cache占用直接砍一大截。
3.3 DSA:先海选再精算,注意力也搞“初筛”
就算KV压得再小,100万Token一个个看过来,计算量还是爆炸。
DSA(稀疏注意力)加了个轻量Indexer先海选:先给所有历史Token打个分,挑出最相关的2048个,主注意力只算这2048个。
就像招人的时候HR先筛简历,把符合要求的挑出来,技术面再慢慢面,不用一万份简历都让技术岗挨个看。
复杂度直接从O(L²)降到O(Lk),k就是2048,主打一个效率优先。
3.4 Gated DSA:给注意力加个“音量旋钮”
Gate就是阀门,对注意力输出逐元素控制,决定这次查出来的信息,有多少能进入下一层状态。
Indexer管“看哪里”,Gate管“看出来的东西用多少”。
好比你查资料找到了一堆内容,Gate决定哪些重点记下来,哪些随便看看就行,相当于给每个信息点单独调音量。
3.5 IndexCache:不用每层都重新筛简历
DSA每层都要跑一遍Indexer重新挑位置,但相邻层挑的其实都差不多,纯重复劳动。
IndexCache就把层分组,几层自己算一次,剩下的直接复用结果。比如第0、1层自己筛,2、3、4层直接抄第1层的名单,第5层再自己筛,以此类推。
Hy4里73.1%的层都省掉了独立Indexer,Prefill直接加速1.82倍,属于典型的“能抄就抄,绝不重复干活”。
4. 残差连接的进化:从一本笔记到四本并行
4.1 残差连接:防止做着做着忘了原题
普通Transformer每层都是“旧状态 + 新计算 = 新状态”,旧状态直接保留的那条路就是残差连接。
没有它的话,模型越深,前面的信息忘得越快,好比你做数学题,做着做着忘了题目问的啥。
有了残差连接就像记笔记,旧笔记 + 新批注 = 新笔记,不用每层都从头开始写。
4.2 残差流:贯穿全程的公共笔记本
残差流就是贯穿所有层的那条信息通道,普通Transformer只有一条,注意力和FFN都从这读,写完再放回去。
相当于全公司共用一本公共笔记本,所有人都往上写,也都从这看,传着传着早期的字就模糊了。
4.3 iHC:直接搞四本并行笔记本
iHC(身份超连接)直接给每个Token搞四条并行的残差流,每条都是独立的笔记本。
每层工作的时候,先决定从哪几本里读、各读多少,算完再决定写回哪几本、各写多少,全动态分配。
比如读取权重可能是这样:
[0.5, 0.2, 0.2, 0.1]
写回权重可能是这样:
[1.0, 0.1, 0.7, 0.4]
普通模型是一条信息高速路,iHC直接修成四车道,还能动态调车道优先级,早期信息不容易被后面的内容冲没。
4.4 mHC:笔记本之间还能互相抄
mHC和iHC类似,但多了个流间混合矩阵,允许不同流之间交换内容。
iHC是各写各的,互不干扰;mHC是允许你把1号本的内容抄一部分到2号、3号本里。
信息交流更强,但也容易出现一本独大、其他本被冲淡的问题,所以加了Sinkhorn约束,防止信息全挤到一条道上。
4.5 Qwen GR:异曲同工的四路残差
Qwen3.8的GR也就是门控残差,同样是四路残差流,逐元素读门控,按分支写门控。
有意思的是训练完会自然跑出一条“长途主干道”,专门把早期信息传到深层,工程师都不用特意设计,模型自己跑出来的,属于进化出最优解了。
4.6 AttnRes:直接翻前面层的笔记
普通残差是每层都往上加,越到后面,早期信息越被稀释,好比你写了80页笔记,前面的内容早就记不清了。
AttnRes就不一样了,当前层可以自己决定:我要参考前面哪几层的结果。
相当于做到第80层,觉得第20层的结论特别重要,直接翻回去重点看,不用靠残差一点点传下来。
普通注意力是在“上下文长度”里找信息,AttnRes是在“深度”里找信息,属于跨层检索。
给大家总结个好记的版本:
- 普通残差 = 一本笔记从头写到尾
- iHC / GR = 同时写四本并行笔记
- mHC = 四本笔记之间还能互相抄
- AttnRes = 写累了直接翻前面的章节看
5. 线性注意力+混合架构:长上下文的终极省钱大法
5.1 线性注意力:边读边记笔记,不存原始档案
普通注意力是把所有历史Token都存着,要用就翻,相当于把整本书都放你面前,翻哪页都行。
但上下文到100万Token,就算压了KV,存着也费劲,跟你硬盘塞了1000部电影似的,找起来都卡。
线性注意力换了思路:一边读,一边把信息压缩进一个固定大小的“工作笔记”里,后面就带着这本笔记走。
相当于你看书不存原著,只记读书笔记,书越厚,笔记优势越明显,因为笔记大小永远不变。
5.2 KDA和GDN:还能控制“遗忘速度”
KDA(Kimi Delta Attention)和GDN(Gated DeltaNet)都是线性注意力的路子,核心是维护一个固定大小的循环状态。
KDA更狠,能控制不同信息的遗忘速度:比如“这是个Flutter项目”这种大局信息,记久一点;“刚才这个变量值是17”这种细节,过会儿就可以忘。
不是光往笔记里加,还得学会什么该留、什么该盖、什么该慢慢忘,非常像人类的记忆模式。
5.3 混合架构:平时记摘要,要细节再翻书
线性注意力有代价:压缩多了,精确细节就难找了,毕竟笔记再详细也不如原文。
所以现在主流都是“线性注意力 + 普通/稀疏注意力”混合着来:几层线性注意力负责低成本“记大概”,插一层普通注意力负责精准“找细节”。
比如Qwen3.8是3层GDN + 1层QSA循环,Kimi K3是3层KDA + 1层Gated MLA循环。
说白了就是平时写摘要,需要查细节的时候再翻原始资料,兼顾速度和精度。
5.4 QSA、IndexPool:连海选步骤都开始压缩
之前DSA是Indexer先海选100万Token,现在连海选都嫌费事儿,开始卷海选本身了。
Qwen的QSA,先把连续Token聚成“小组块”,Indexer先判断哪个组块值得看,再进去找具体的。
相当于招人的时候先看部门,部门合适再看个人简历,不用挨个扫一万份。
GLM的IndexPool更直接,把4个Indexer Key加权压缩成1个,索引信息直接缩小4倍,再去Top-k。
简单区分:IndexPool是把本次搜索的目录压小,IndexCache是不同层之间复用目录,一个省空间,一个省次数。
5.5 DeepSeek的CSA/HCA:压到极致再找
DeepSeek V4更激进,两种注意力交替用:
- CSA:先把每4个历史Token压成1个,再从压缩后的位置里Top-k海选,属于“压一点再挑”
- HCA:更狠,每128个Token压成一个块,压完直接全部做注意力,连Indexer都省了,属于“压到极致全看”
一个负责精确选重点,一个负责低成本看全局,交替着来,主打一个极致省钱。
6. 推测解码:让模型生成速度直接起飞
推测解码说白了就是:找个便宜的“草稿模型”先猜后面几个字,主模型一次验证好几个。
猜中了就批量通过,猜错了就从错的地方重来,反正比一个字一个字算快。
比如一次猜4个,中了2个,这一轮就直接输出2个,速度直接翻倍,赌对了就是血赚。
Hy4自带的MTP就是干这个的,总参数10B,激活才0.7B,和主模型一起训练的,专门负责打草稿。
类似的还有EAGLE-3、DFlash这些,本质都是“打草稿 + 批量验证”,卷生成速度的神器。
7. 量化:把1.5T的模型塞进200G硬盘
7.1 量化的三层境界:别再被BF16、INT4、GPTQ绕晕
很多人看量化名词看得头大,其实分三层就全清楚了:
核心目标只有一个:少占空间,尽量不掉点。
比如770B参数BF16要1.54TB,压到4bit理论上就385GB,实际玩起混合量化还能更狠。
770B × 2 Byte ≈ 1.54 TB
7.2 浮点格式:BF16为啥成了香饽饽
计算机存小数,分三部分:符号位、指数位、尾数位。指数位决定能表示多大的数,尾数位决定精度有多细。
FP16是5位指数+10位尾数,精度高但范围小,训练的时候梯度太小容易直接没了,俗称“下溢没了”。
BF16是8位指数+7位尾数,范围和FP32一样大,精度稍差但不容易溢出。
大模型训练里,“不溢出”比“多几位小数”重要多了,所以BF16直接成了标配。
FP8就是继续往下压到8bit,权重内存直接减半,但是范围更小了,得靠Scale缩放来救。
7.3 Scale和MX:给每组数字配个专属尺子
Scale就是缩放比例:一组数字太大或太小,先缩放再存,用的时候再还原。
不然一组数里既有0.01又有1000,为了存1000拉大范围,0.01就直接被压没了,精度直接崩。
MXFP8就是OCP搞的微缩放,每32个元素共用一个Scale,相当于每32个人发一把自己的尺子。
小数多的组用小量程尺子,大数多的组用大量程,各自适配,精度一下就保住了。
所以别看名字叫FP8,实际算上Scale,平均每个元素大概8.25bit,没有真的完全8bit。
7.4 W4A16:权重压到4bit,计算还用高精度
W就是Weight权重,A就是Activation激活。
W4A16就是权重存4bit省空间,真正计算的时候激活还是16bit高精度。
相当于你把压缩包存在硬盘里,解压到内存再运行,主打一个存储和计算平衡。
W8A8就是权重激活都是8bit,更省但精度也更低,看你愿意牺牲啥。
7.5 GPTQ、AWQ:压缩算法的卷王
INT4、FP4只是“目标格式”,GPTQ、AWQ是“怎么压过去”的算法。
最粗暴的压法就是直接四舍五入,但模型里有的权重改一点就崩,有的改很多都没事,一刀切肯定不行。
GPTQ用二阶信息补偿误差,AWQ重点保护重要的权重通道,SmoothQuant把难压的激活转移给权重。
简单说:4bit是预算,GPTQ、AWQ是教你怎么花这4bit最值。
7.6 GGUF的那些后缀:Q4_K_M到底是啥
玩本地模型的肯定见过Q4_K_M、IQ3_XXS这些名字,这都是社区量化配方,不是什么统一标准格式。
Q4不代表整个模型全是4bit,只是大概在4bit这一档,敏感层可能用更高精度,属于混合量化。
后缀大致规律:
- _0 / _1:早期的块量化方案
- _K:K-quant家族,现在最常用
- IQ:更复杂的编码,超低bit表现更好
- TQ / STQ:三值、稀疏三值,压得最狠
后面的_S / M / L / XL就是质量档位,越靠后文件越大、效果越稳,跟奶茶的少糖、半糖、全糖似的。
比如UD-Q4_K_XL,就是Unsloth家的动态量化方案,整体4bit档位,偏向保质量。
最狠的还得是Hy4的MIX-STQ1_0版本,1.5TB的模型压到200G出头,关键部分留高精度,不重要的直接往死里压,性能几乎没损失,属于把量化玩出花了。
唠到这,现在再看那些架构图和参数表,是不是就没那么像外星文了?
说白了这波新模型,本质就是在五个地方卷:
- 长上下文怎么存得便宜
- 需要细节怎么找得精准
- 索引太贵怎么再压缩
- 模型太深信息怎么传
- 体积太大怎么压得小
各家路线不同,但核心目标都是:更快、更省、更强。以后再出什么新名词,顺着这个思路套,基本都能猜个八九不离十。
P.S. 推荐一个大神的教程给想要了解或者学习人工智能知识的读者,这个教程里内容讲解通俗易懂且风趣幽默,对我帮助很大。我想与大家分享这个宝藏教程,请点击下方链接查看,传送门https://blog.csdn.net/qq_74013365
网硕互联帮助中心




评论前必须登录!
注册