云计算百科
云计算领域专业知识百科平台

AI大模型与数学|第81天 课程:正交向量、正交基、格拉姆‑施密特(Gram‑Schmidt)正交化

前置知识:向量、向量内积、基、向量空间。

在大模型中:正交化用于向量降维、注意力计算、向量数据库、语义向量处理、矩阵分解,是高维AI向量空间的核心工具。

1、什么是两个向量正交

定义

对于两个 n维实向量 \\boldsymbol u,\\boldsymbol v

如果它们的内积等于0:

\\boldsymbol u \\cdot \\boldsymbol v=\\boldsymbol u^\\mathrm T \\boldsymbol v = 0

则称 \\boldsymbol u 和 \\boldsymbol v 相互正交(垂直)。

二维/三维几何直观:就是几何上互相垂直。

高维空间没有直观几何图像,内积为0就是“广义垂直”的数学定义。

例子

\\boldsymbol u=\\begin{pmatrix}1\\\\0\\end{pmatrix},\\quad \\boldsymbol v=\\begin{pmatrix}0\\\\1\\end{pmatrix}

\\boldsymbol u^\\mathrm T\\boldsymbol v=1\\times0+0\\times1=0

两向量正交。

⚠️零向量和任何向量内积都是0,规定零向量不参与正交向量组。

正交向量组

一组非零向量 \\boldsymbol v_1,\\boldsymbol v_2,\\dots,\\boldsymbol v_k,组内两两互相正交:

\\boldsymbol v_i^\\mathrm T \\boldsymbol v_j =0,\\quad i\\neq j

称为正交向量组。

重要定理:正交向量组一定线性无关。

这是巨大优势:只要两两正交,就自动是无关组,不用再算行列式判断线性相关性。

标准正交向量组(单位正交)

正交基础上,每一个向量自身长度(范数)为1:

\\|\\boldsymbol v_i\\|=\\sqrt{\\boldsymbol v_i^\\mathrm T\\boldsymbol v_i}=1

两两内积满足:

\\boldsymbol v_i^\\mathrm T\\boldsymbol v_j=

\\begin{cases}

1,&i=j\\\\

0,&i\\neq j

\\end{cases}

2、正交基 & 标准正交基

基回顾

R^n空间一组基:n个线性无关向量,可以把空间中任意向量,写成这组基的线性组合。

1. 正交基:一组基,同时又是正交向量组。

2. 标准正交基:一组基,两两正交,并且每个向量长度等于1。

标准正交基巨大好处(AI高频)

如果 \\{\\boldsymbol e_1,\\boldsymbol e_2\\dots,\\boldsymbol e_n\\} 是标准正交基。

任意向量 \\boldsymbol x 做分解:

\\boldsymbol x = c_1\\boldsymbol e_1 + c_2\\boldsymbol e_2+\\dots+c_n\\boldsymbol e_n

系数直接用内积算出:

c_i=\\boldsymbol x^\\mathrm T \\boldsymbol e_i

普通基求系数需要解线性方程组;标准正交基直接点积就得到系数,计算量大幅下降。

这就是为什么AI大量追求正交:简化高维向量投影、分解、相似度计算。

矩阵形式:正交矩阵

把标准正交基按列拼成矩阵 Q:

Q=\\begin{bmatrix}\\boldsymbol e_1&\\boldsymbol e_2&\\dots&\\boldsymbol e_n\\end{bmatrix}

满足:

Q^\\mathrm T Q = I

叫正交矩阵。

性质:Q^\\mathrm T=Q^{-1},转置直接等于逆矩阵,求逆几乎零成本。

AI中PCA主成分分析输出的主成分,就是一组标准正交基。

3、格拉姆‑施密特 Gram‑Schmidt 正交化算法

问题:给一组普通线性无关的基,怎么把它变成一组正交基,再变成标准正交基?

Gram‑Schmidt就是这套变换流程。

输入:线性无关向量 \\boldsymbol a_1,\\boldsymbol a_2,\\dots,\\boldsymbol a_k

输出:正交向量 \\boldsymbol v_1,\\boldsymbol v_2,\\dots,\\boldsymbol v_k

步骤公式

1. 第一个向量直接取原向量

\\boldsymbol v_1=\\boldsymbol a_1

2. 第二个向量:把 \\boldsymbol a_2,减去它在 \\boldsymbol v_1 上的投影,得到和\\boldsymbol v_1正交的\\boldsymbol v_2

\\boldsymbol v_2=\\boldsymbol a_2

-\\frac{\\boldsymbol a_2^\\mathrm T\\boldsymbol v_1}{\\boldsymbol v_1^\\mathrm T \\boldsymbol v_1}\\boldsymbol v_1

3. 第三个向量:\\boldsymbol a_3,减去它在\\boldsymbol v_1投影,再减去在\\boldsymbol v_2投影

\\boldsymbol v_3=\\boldsymbol a_3

-\\frac{\\boldsymbol a_3^\\mathrm T\\boldsymbol v_1}{\\boldsymbol v_1^\\mathrm T \\boldsymbol v_1}\\boldsymbol v_1

-\\frac{\\boldsymbol a_3^\\mathrm T\\boldsymbol v_2}{\\boldsymbol v_2^\\mathrm T \\boldsymbol v_2}\\boldsymbol v_2

4. 通用递推公式

\\boldsymbol v_k=\\boldsymbol a_k-\\sum_{i=1}^{k-1}

\\frac{\\boldsymbol a_k^\\mathrm T \\boldsymbol v_i}{\\boldsymbol v_i^\\mathrm T\\boldsymbol v_i}\\boldsymbol v_i

几何理解:每一步,把新向量,减去向前面所有已经得到正交向量上的投影分量,剩下的残差部分就和前面全部正交。

得到正交组\\boldsymbol v_1,\\boldsymbol v_2\\dots之后,做单位化,得到标准正交向量:

\\boldsymbol e_i=\\frac{\\boldsymbol v_i}{\\|\\boldsymbol v_i\\|}

2阶完整手算例题

给定

\\boldsymbol a_1=\\begin{pmatrix}1\\\\1\\end{pmatrix},\\;

\\boldsymbol a_2=\\begin{pmatrix}0\\\\1\\end{pmatrix}

1.\\boldsymbol v_1=\\boldsymbol a_1=\\begin{pmatrix}1\\\\1\\end{pmatrix}

2.计算投影系数

\\frac{\\boldsymbol a_2^\\mathrm T\\boldsymbol v_1}{\\boldsymbol v_1^\\mathrm T\\boldsymbol v_1}

=\\frac{0\\times1+1\\times1}{1^2+1^2}=\\frac12

\\boldsymbol v_2=\\boldsymbol a_2-\\frac12 \\boldsymbol v_1

=\\begin{pmatrix}0\\\\1\\end{pmatrix}-\\frac12\\begin{pmatrix}1\\\\1\\end{pmatrix}

=\\begin{pmatrix}-0.5\\\\0.5\\end{pmatrix}

现在 \\boldsymbol v_1,\\boldsymbol v_2 互相正交。

再各自除以模长,得到标准正交基。

注意:数值计算,传统GS会有精度误差;工程上用修正格拉姆‑施密特(MGS),大模型、数值库实际使用MGS版本。

4、在AI大模型里面,正交/格拉姆施密特用来干什么

① PCA主成分分析

把海量高维语义向量,做正交基变换。新的正交基按方差从大到小排序,实现降维。

原始特征互相之间有冗余;正交之后,各个维度信息互不重叠。

② 向量数据库、Embedding语义向量

理想情况下,语义完全无关的句子对应的embedding向量,希望尽量接近正交(内积趋近0);语义相似向量内积大。

正交=信息互不重叠;内积就是相似度。

③ Transformer注意力机制底层数学

注意力本质大量做向量投影。如果基是标准正交,投影计算简化。

在部分模型的归一化、正交初始化权重矩阵,使用正交矩阵初始化,防止梯度爆炸消失。正交矩阵变换,向量长度保持不变。

正交矩阵性质:\\|Q\\boldsymbol x\\|=\\|\\boldsymbol x\\|,变换不改变向量长度,对深度网络梯度传播非常友好。

④ QR矩阵分解

Gram‑Schmidt就是QR分解的推导基础:A=QR

– Q:标准正交列构成的正交矩阵

– R:上三角矩阵

大模型求解最小二乘、矩阵求逆、数值线性代数库大量依赖QR分解。

⑤ 提示词、拒绝采样、RLHF

高维向量空间中,把无用/有害方向,通过正交投影剔除,把向量投影到安全子空间。

📝随堂练习题

给定向量

\\boldsymbol a_1=\\begin{pmatrix} 1 \\\\ -1 \\end{pmatrix},\\quad

\\boldsymbol a_2=\\begin{pmatrix} 2 \\\\ 0 \\end{pmatrix}

1. 使用格拉姆‑施密特求正交向量组\\boldsymbol v_1,\\boldsymbol v_2

2. 再单位化得到标准正交基\\boldsymbol e_1,\\boldsymbol e_2

3. 验证\\boldsymbol e_1^\\mathrm T\\boldsymbol e_2=0,且各自模长等于1。

下一讲预告

正交投影,最小二乘,大模型里面拟合、对齐的核心数学工具。

赞(0)
未经允许不得转载:网硕互联帮助中心 » AI大模型与数学|第81天 课程:正交向量、正交基、格拉姆‑施密特(Gram‑Schmidt)正交化
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!