前置知识:向量、向量内积、基、向量空间。
在大模型中:正交化用于向量降维、注意力计算、向量数据库、语义向量处理、矩阵分解,是高维AI向量空间的核心工具。
1、什么是两个向量正交
定义
对于两个 n维实向量 \\boldsymbol u,\\boldsymbol v
如果它们的内积等于0:
\\boldsymbol u \\cdot \\boldsymbol v=\\boldsymbol u^\\mathrm T \\boldsymbol v = 0
则称 \\boldsymbol u 和 \\boldsymbol v 相互正交(垂直)。
二维/三维几何直观:就是几何上互相垂直。
高维空间没有直观几何图像,内积为0就是“广义垂直”的数学定义。
例子
\\boldsymbol u=\\begin{pmatrix}1\\\\0\\end{pmatrix},\\quad \\boldsymbol v=\\begin{pmatrix}0\\\\1\\end{pmatrix}
\\boldsymbol u^\\mathrm T\\boldsymbol v=1\\times0+0\\times1=0
两向量正交。
⚠️零向量和任何向量内积都是0,规定零向量不参与正交向量组。
正交向量组
一组非零向量 \\boldsymbol v_1,\\boldsymbol v_2,\\dots,\\boldsymbol v_k,组内两两互相正交:
\\boldsymbol v_i^\\mathrm T \\boldsymbol v_j =0,\\quad i\\neq j
称为正交向量组。
重要定理:正交向量组一定线性无关。
这是巨大优势:只要两两正交,就自动是无关组,不用再算行列式判断线性相关性。
标准正交向量组(单位正交)
正交基础上,每一个向量自身长度(范数)为1:
\\|\\boldsymbol v_i\\|=\\sqrt{\\boldsymbol v_i^\\mathrm T\\boldsymbol v_i}=1
两两内积满足:
\\boldsymbol v_i^\\mathrm T\\boldsymbol v_j=
\\begin{cases}
1,&i=j\\\\
0,&i\\neq j
\\end{cases}
2、正交基 & 标准正交基
基回顾
R^n空间一组基:n个线性无关向量,可以把空间中任意向量,写成这组基的线性组合。
1. 正交基:一组基,同时又是正交向量组。
2. 标准正交基:一组基,两两正交,并且每个向量长度等于1。
标准正交基巨大好处(AI高频)
如果 \\{\\boldsymbol e_1,\\boldsymbol e_2\\dots,\\boldsymbol e_n\\} 是标准正交基。
任意向量 \\boldsymbol x 做分解:
\\boldsymbol x = c_1\\boldsymbol e_1 + c_2\\boldsymbol e_2+\\dots+c_n\\boldsymbol e_n
系数直接用内积算出:
c_i=\\boldsymbol x^\\mathrm T \\boldsymbol e_i
普通基求系数需要解线性方程组;标准正交基直接点积就得到系数,计算量大幅下降。
这就是为什么AI大量追求正交:简化高维向量投影、分解、相似度计算。
矩阵形式:正交矩阵
把标准正交基按列拼成矩阵 Q:
Q=\\begin{bmatrix}\\boldsymbol e_1&\\boldsymbol e_2&\\dots&\\boldsymbol e_n\\end{bmatrix}
满足:
Q^\\mathrm T Q = I
叫正交矩阵。
性质:Q^\\mathrm T=Q^{-1},转置直接等于逆矩阵,求逆几乎零成本。
AI中PCA主成分分析输出的主成分,就是一组标准正交基。
3、格拉姆‑施密特 Gram‑Schmidt 正交化算法
问题:给一组普通线性无关的基,怎么把它变成一组正交基,再变成标准正交基?
Gram‑Schmidt就是这套变换流程。
输入:线性无关向量 \\boldsymbol a_1,\\boldsymbol a_2,\\dots,\\boldsymbol a_k
输出:正交向量 \\boldsymbol v_1,\\boldsymbol v_2,\\dots,\\boldsymbol v_k
步骤公式
1. 第一个向量直接取原向量
\\boldsymbol v_1=\\boldsymbol a_1
2. 第二个向量:把 \\boldsymbol a_2,减去它在 \\boldsymbol v_1 上的投影,得到和\\boldsymbol v_1正交的\\boldsymbol v_2
\\boldsymbol v_2=\\boldsymbol a_2
-\\frac{\\boldsymbol a_2^\\mathrm T\\boldsymbol v_1}{\\boldsymbol v_1^\\mathrm T \\boldsymbol v_1}\\boldsymbol v_1
3. 第三个向量:\\boldsymbol a_3,减去它在\\boldsymbol v_1投影,再减去在\\boldsymbol v_2投影
\\boldsymbol v_3=\\boldsymbol a_3
-\\frac{\\boldsymbol a_3^\\mathrm T\\boldsymbol v_1}{\\boldsymbol v_1^\\mathrm T \\boldsymbol v_1}\\boldsymbol v_1
-\\frac{\\boldsymbol a_3^\\mathrm T\\boldsymbol v_2}{\\boldsymbol v_2^\\mathrm T \\boldsymbol v_2}\\boldsymbol v_2
4. 通用递推公式
\\boldsymbol v_k=\\boldsymbol a_k-\\sum_{i=1}^{k-1}
\\frac{\\boldsymbol a_k^\\mathrm T \\boldsymbol v_i}{\\boldsymbol v_i^\\mathrm T\\boldsymbol v_i}\\boldsymbol v_i
几何理解:每一步,把新向量,减去向前面所有已经得到正交向量上的投影分量,剩下的残差部分就和前面全部正交。
得到正交组\\boldsymbol v_1,\\boldsymbol v_2\\dots之后,做单位化,得到标准正交向量:
\\boldsymbol e_i=\\frac{\\boldsymbol v_i}{\\|\\boldsymbol v_i\\|}
2阶完整手算例题
给定
\\boldsymbol a_1=\\begin{pmatrix}1\\\\1\\end{pmatrix},\\;
\\boldsymbol a_2=\\begin{pmatrix}0\\\\1\\end{pmatrix}
1.\\boldsymbol v_1=\\boldsymbol a_1=\\begin{pmatrix}1\\\\1\\end{pmatrix}
2.计算投影系数
\\frac{\\boldsymbol a_2^\\mathrm T\\boldsymbol v_1}{\\boldsymbol v_1^\\mathrm T\\boldsymbol v_1}
=\\frac{0\\times1+1\\times1}{1^2+1^2}=\\frac12
\\boldsymbol v_2=\\boldsymbol a_2-\\frac12 \\boldsymbol v_1
=\\begin{pmatrix}0\\\\1\\end{pmatrix}-\\frac12\\begin{pmatrix}1\\\\1\\end{pmatrix}
=\\begin{pmatrix}-0.5\\\\0.5\\end{pmatrix}
现在 \\boldsymbol v_1,\\boldsymbol v_2 互相正交。
再各自除以模长,得到标准正交基。
注意:数值计算,传统GS会有精度误差;工程上用修正格拉姆‑施密特(MGS),大模型、数值库实际使用MGS版本。
4、在AI大模型里面,正交/格拉姆施密特用来干什么
① PCA主成分分析
把海量高维语义向量,做正交基变换。新的正交基按方差从大到小排序,实现降维。
原始特征互相之间有冗余;正交之后,各个维度信息互不重叠。
② 向量数据库、Embedding语义向量
理想情况下,语义完全无关的句子对应的embedding向量,希望尽量接近正交(内积趋近0);语义相似向量内积大。
正交=信息互不重叠;内积就是相似度。
③ Transformer注意力机制底层数学
注意力本质大量做向量投影。如果基是标准正交,投影计算简化。
在部分模型的归一化、正交初始化权重矩阵,使用正交矩阵初始化,防止梯度爆炸消失。正交矩阵变换,向量长度保持不变。
正交矩阵性质:\\|Q\\boldsymbol x\\|=\\|\\boldsymbol x\\|,变换不改变向量长度,对深度网络梯度传播非常友好。
④ QR矩阵分解
Gram‑Schmidt就是QR分解的推导基础:A=QR
– Q:标准正交列构成的正交矩阵
– R:上三角矩阵
大模型求解最小二乘、矩阵求逆、数值线性代数库大量依赖QR分解。
⑤ 提示词、拒绝采样、RLHF
高维向量空间中,把无用/有害方向,通过正交投影剔除,把向量投影到安全子空间。
📝随堂练习题
给定向量
\\boldsymbol a_1=\\begin{pmatrix} 1 \\\\ -1 \\end{pmatrix},\\quad
\\boldsymbol a_2=\\begin{pmatrix} 2 \\\\ 0 \\end{pmatrix}
1. 使用格拉姆‑施密特求正交向量组\\boldsymbol v_1,\\boldsymbol v_2
2. 再单位化得到标准正交基\\boldsymbol e_1,\\boldsymbol e_2
3. 验证\\boldsymbol e_1^\\mathrm T\\boldsymbol e_2=0,且各自模长等于1。
下一讲预告
正交投影,最小二乘,大模型里面拟合、对齐的核心数学工具。
网硕互联帮助中心


评论前必须登录!
注册