云计算百科
云计算领域专业知识百科平台

准大二学生从0开始学AI——机器学习Day5

type: daily_note

title: Phase 2.1 Day 5 — 特征缩放 + 特征工程 + 多项式回归 + 逻辑回归动机

date: 2026-07-24

person: 吴恩达

phase: "2.1"

day: 5

topics:

  [

    特征缩放,

    Z-score归一化,

    均值归一化,

    学习率选择,

    检查收敛,

    特征工程,

    多项式回归,

    逻辑回归动机,

  ]

 

# 2026-07-24 学习笔记

 

## 笔记区

 

### 核心观点

 

– **特征缩放(Feature Scaling)**:特征取值范围差异大时,梯度下降 zigzag 收敛慢。把特征缩放到相近范围,等高线从椭圆变圆,梯度下降走直线

– **均值归一化 x' = (x-μ)/(max-min)**:先平移(中心化到0),再压缩(值域范围约[-1,1])。受异常值影响大,极值同时拉偏 μ 和 max-min

– **Z-score 归一化 x' = (x-μ)/σ**:表示该点离均值几个标准差。3σ 原则,大部分值在 [-3,3]。受异常值影响小,实际工作默认用这个

– **检查收敛**:画 J(w,b) vs 迭代次数的学习曲线,曲线上升或震荡 → 学习率太大

– **学习率选择**:从 0.001 开始,每次 ×3:0.001→0.003→0.01→0.03→0.1→0.3→1,找到让 J 稳定下降的最大值

– **特征工程**:从已有特征构造新特征(如 frontage×depth = area)。如循环次数×放电深度 = 综合老化指标

– **多项式回归**:数据非线性时用 ŷ = w₁x + w₂x² + w₃x³ + b。做多项式回归必须先做特征缩放,否则 x, x², x³ 取值范围差几个数量级

– **逻辑回归动机**:线性回归做分类的缺陷——异常值拉偏决策边界。需要新算法让输出永远在 [0,1] 之间

 

### 关键方法/流程

 

**特征缩放对比:**

 

| | 均值归一化 | Z-score 归一化 |

| ———- | ———————— | ————– |

| 公式 | (x-μ)/(max-min) | (x-μ)/σ |

| 结果范围 | 约 [-1, 1] | 约 [-3, 3] |

| 异常值影响 | ❌ 大,极值+均值双重影响 | ✅ 小 |

| 使用场景 | 罕见 | ✅ 默认选择 |

 

**学习率调试流程:**

 

```

α = 0.001 → 跑梯度下降 → 画 J 曲线

  曲线下降正常?→ 可以尝试再大一点(×3)

  曲线震荡/上升?→ 减小 3 倍

重复直到找到"最大的让 J 稳定下降的 α"

```

 

**特征缩放的物理意义:** 把不等长量纲的特征放到同一把尺子上量,让梯度下降在每个方向上的步长差不多。

 

### 实战记录

 

– **Lab03(Feature Scaling and Learning Rate)**:对比特征缩放前后的梯度下降路径——缩放前 zigzag 几十步才收敛,缩放后直奔最低点。调 α 观察 J 曲线的变化:α 太小时 J 下降慢,α 太大时 J 震荡上升

– **Lab04(FeatEng_PolyReg)**:用面积²和面积³做多项式回归拟合曲线,发现不做特征缩放梯度下降根本跑不动

 

 

## 线索区(学完后合上材料,自问自答)

 

**Q: 特征缩放解决了什么问题?**

A: 特征取值范围差异大时,代价函数的等高线被压扁成椭圆,梯度下降在陡峭方向来回震荡(zigzag),收敛极慢。特征缩放把等高线变圆,梯度下降走直线。

 

**Q: Z-score 归一化和均值归一化有什么区别?工程上怎么选?**

A: 均值归一化除以极差,Z-score 除以标准差。Z-score 受异常值影响小(极值和均值都会被异常值拉偏),工程上默认用 Z-score(sklearn 的 StandardScaler)。

 

**Q: 为什么多项式回归前必须做特征缩放?**

A: 假设 x=50,则 x²=2500,x³=125000。三个特征取值范围差几千倍,不做缩放梯度下降 zigzag 极其严重,根本收敛不了。

 

**Q: 学习率 α 太大和太小分别有什么现象?**

A: 太大 → J 曲线震荡或上升(发散);太小 → J 曲线稳定下降但速度很慢。调试方法:从 0.001 开始,每次 ×3,观察 J 曲线。

 

**Q: 为什么线性回归不能直接做分类?**

A: 线性回归输出是任意实数。一个异常值就能把决策边界拉偏。分类需要输出 0 到 1 之间的概率,需要新算法(逻辑回归)。

 

**Q: Lab03 里的特征缩放前后的收敛对比具体说明了什么?**

A: 缩放前梯度下降的路径是 zigzag 的,需要很多步才收敛;缩放后路径几乎是直线指向最低点,几步就收敛。同样迭代次数下,缩放后的代价下降快得多。

 

 

## 总结(50字以内)

 

特征缩放解决多特征取值差异大导致梯度下降慢的问题。Z-score 默认用。学习率从 0.001 试起。

 

 

## 复习卡片

 

| 概念 | 一句话 | 我的场景 |

| ———- | ——————————————– | —————————————— |

| 特征缩放 | 把不同范围的特征拉到相近尺度,梯度下降走直线 | 多特征场景(温度×循环次数×电压)训练前必做 |

| Z-score | (x-μ)/σ,离均值几个标准差 | 实际工作默认选择 |

| 均值归一化 | (x-μ)/(max-min),范围约[-1,1] | 异常值少时可用,但不如 Z-score |

| 学习率调试 | 0.001→×3 循环试,看 J 曲线 | 梯度下降不收敛时的标准排查法 |

| 特征工程 | 从旧特征造新特征(面积²、交叉特征) | 储能:循环次数×放电深度=综合老化指标 |

| 多项式回归 | ŷ=wx + w₂x² + w₃x³ + b 拟合曲线 | 电池容量衰减不是直线,需要多项式拟合 |

赞(0)
未经允许不得转载:网硕互联帮助中心 » 准大二学生从0开始学AI——机器学习Day5
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!