本课核心主线:
前面课程我们掌握梯度下降、海森矩阵,目标是在参数空间搜寻损失函数最低点训练大模型。
但真实场景不能无边界搜寻,必须划定搜寻范围,在约束范围内寻找最优解;条件极值与拉格朗日乘数法,就是这套「划定范围、受限寻优」的核心数学工具。
前面课程:梯度下降、海森矩阵,实现无约束寻优——自由在高维参数空间寻找损失最低点。
现实训练不能无限自由搜索,需要划定边界、增加各类限制条件,在规定范围内寻找最优参数。
✅ 条件极值:带边界限制的极值问题
✅ 拉格朗日乘数法:求解条件极值的基础工具
这套理论是正则化、向量归一化、最大熵、受限优化的底层数学根基。
一、基础概念区分
不受任何额外规则束缚,在整个定义域自由寻找极大/极小值。
几何:整片山谷任意行走,自由搜寻谷底。
对应:无正则项、无参数限制的原始损失函数优化。
优化目标:最小化 f(\\boldsymbol x)
同时强制满足约束 g(\\boldsymbol x)=0
几何:你被限制在曲面/曲线之上移动,不能走出边界,只能在划定区域内寻找最低点。
比喻:
梯度下降是整片山区随便找最低点;
条件极值相当于:规定你只能沿着盘山公路行进,只能在这条公路上寻找最低位置。
二、拉格朗日乘数法核心思想
目标函数:f(\\boldsymbol x)
等式约束:g(\\boldsymbol x)=0
构造拉格朗日函数:
L(\\boldsymbol x,\\lambda)=f(\\boldsymbol x)+\\lambda g(\\boldsymbol x)
\\lambda 称为拉格朗日乘子。
核心几何结论(重中之重)
条件极值点位满足:目标函数梯度 \\nabla f,与约束函数梯度 \\nabla g 相互平行。
\\nabla f = -\\lambda \\nabla g
通俗解读:
在约束曲面上,所有可行前进方向都和约束梯度垂直。
倘若 \\nabla f 和 \\nabla g 不平行,沿着约束曲面依然存在下坡方向,还能继续优化;
只有二者平行,沿约束边界再也没有优化空间,抵达条件极值。
三、拓展:多等式约束
多重约束场景 g_1=0,g_2=0\\dots
L=f+\\lambda_1 g_1+\\lambda_2 g_2+\\dots
引入多个乘子,底层逻辑不变。
四、拓展:不等式约束 KKT条件(AI高频拓展)
工程里大量约束为不等式 g(\\boldsymbol x)\\le0
拉格朗日乘数法拓展为KKT条件,是通用带约束优化框架。
后续SVM、参数范围限制、模型正则优化都会用到。
五、大模型落地场景(紧扣主线)
注意力机制、词向量常用约束:向量模长 |x|=1
优化向量相似度,同时锁定向量长度,典型条件极值,依靠拉格朗日乘数推导理论最优解。
L2正则本质:限制模型参数整体规模,防止参数无限变大。
最小化损失 + 参数规模约束,等价条件极值问题。
给定期望约束,求解熵最大的分布,标准解法就是拉格朗日乘数法,可以推导出高斯分布。
训练时限制权重取值上下限,属于受限寻优,理论源头来自本课知识。
六、随堂例题
求 f(x,y)=x2+y2 在约束 x+y=1 下的最小值。
L=x2+y2+\\lambda(x+y-1)
七、课后思考题(贴合你的核心主线)
📚《AI大模型与数学》持续更新
全部课程统一收录专栏,订阅专栏追更全文。
点赞收藏,一起吃透大模型底层数学!
你在学习大模型过程中遇到哪些数学难点?欢迎评论交流。
网硕互联帮助中心



评论前必须登录!
注册