📑 本页目录(点开跳转)
附录 A · 数学速查
📌
Ctrl+F搜。不要通读。 这一页的用法:写代码/看论文时卡住 → 搜关键词 → 看到那一行 → 回去继续干活。
🔑 一张表:你用的每个东西的真身
| 你在用的 | 它的真身 | 在哪一章 |
|---|---|---|
| 平方误差 MSE | 高斯噪声假设下的 MLE | 01 |
| 交叉熵 | 伯努利 / 类别分布的 MLE | 01 |
| L1 损失 / Huber | 拉普拉斯分布假设(尾巴厚,抗离群) | 01 |
| 泊松损失 | 计数数据的 MLE | 01 |
| L2 正则 / weight_decay | 高斯先验下的 MAP,λ = σ²/τ² | 02 |
| L1 正则 / Lasso | 拉普拉斯先验的 MAP(0 处尖峰 → 稀疏) | 02 |
| ElasticNet | 高斯 + 拉普拉斯的混合先验 | 02 |
| 感知机的"猜错才更新" | 只有违反间隔的点才有梯度 | 03 |
| kNN 的高斯加权 | RBF 核 | 04、06 |
| SVM 的 C | 正则强度的倒数,C = 1/λ | 07 |
| SVM 只记住支持向量 | 对偶解里大部分 α = 0 | 07 |
| Bagging / 随机森林 | 降方差(Bias 基本不变) | 08 |
| Boosting | 降偏差(Var 可能上升) | 08 |
| 正则化(第四种理解) | 结构风险最小化里的复杂度罚款 | 10 |
| 早停 early stopping | 隐式正则(限制了有效假设空间) | 10 |
| 残差连接 | 梯度公式里的 +I |
12 |
| softmax + 交叉熵 δ = 预测−真实 | 两个导数互相约掉 | 12 |
| K-Means | GMM 的特例(球形等大 + 硬分配) | 13 |
| 集成有效 | 偏差-方差分解的直接推论 | 08 |
🔑 这张表是整份教程的浓缩版。如果只记一样东西,记它。
🧭 「我该翻哪一章」决策表
| 你的问题 | 去哪 |
|---|---|
| 该用什么损失函数? | 01 最大似然 |
| 该用 L1 还是 L2 正则?λ 怎么定? | 02 MAP |
| 数据线性不可分怎么办? | 03 感知机 → 三条出路 |
| kNN 为什么在高维上不行? | 04 + 05 维度灾难 |
| 特征太多要不要降维? | 05 维度灾难 |
| SVM 的 C 和 γ 怎么调? | 06 核技巧 + 07 SVM |
| 模型欠拟合还是过拟合? | 08 偏差方差 |
| 要多少数据才够? | 09 PAC |
| 模型复杂度怎么量化? | 10 VC 维 |
| 为什么没有"最强算法"? | 11 没有免费的午餐 |
| 梯度消失/爆炸的根因? | 12 反向传播 |
| 聚类该用 K-Means 还是 GMM? | 13 EM |
📐 核心公式
概率视角
$$\hat\theta_{MLE} = \arg\max_\theta \sum_i \log p(x_i\mid\theta)$$ $$\hat\theta_{MAP} = \arg\max_\theta \left[\sum_i \log p(x_i\mid\theta) + \log p(\theta)\right]$$
💡 MAP 比 MLE 多的那一项 log p(θ),就是正则项的来源。
贝叶斯定理(EM 的 E 步、朴素贝叶斯都靠它):
$$p(\theta\mid x) = \frac{p(x\mid\theta)\,p(\theta)}{p(x)} \;\propto\; \underbrace{p(x\mid\theta)}_{\text{似然}}\cdot\underbrace{p(\theta)}_{\text{先验}}$$
正则化的四种等价理解 ⭐
| 视角 | 说法 | 章节 |
|---|---|---|
| 贝叶斯 | 加了一个关于参数的先验 | 02 |
| 偏差-方差 | 故意引入偏差,换方差的大幅下降 | 08 |
| 学习理论 | 缩小了有效假设空间,降低样本需求 | 09 |
| 结构风险 | 给复杂度罚款 | 10 |
💡 四者是同一件事的四个面。 哪个视角好用就用哪个。
偏差-方差分解
$$\mathbb{E}[(y-\hat f)^2] = \text{Bias}^2 + \text{Var} + \sigma^2$$
- 加数据 → 只降 Var,不降 Bias
- σ² 是天花板,谁也突破不了
- 诊断口诀:训练误差就高 = 高偏差;训练低测试高 = 高方差
集成的方差
$$\text{Var}(\bar f) = \rho\sigma^2 + \frac{1-\rho}{M}\sigma^2$$
💡 第一项不随 M 减小 → 必须降低相关性 ρ(随机森林随机选特征的理由)
感知机收敛定理
$$\text{错误次数} \le (R/\gamma)^2$$
💡 与数据量、维度都无关;γ 后来成了 SVM 的优化目标
PAC 样本复杂度(有限假设空间)
$$m \ge \frac{1}{\varepsilon}\left(\ln|\mathcal{H}| + \ln\frac{1}{\delta}\right)$$
💡 ε 是反比(精度最贵),|H| 和 δ 都是对数(便宜)
⚠️ agnostic 版本 ε 变成 平方(1/2ε²)——没有完美假设时精度更贵
VC 泛化界
$$\text{err}_{\mathcal{D}} \le \text{err}_S + O\!\left(\sqrt{\frac{d_{VC}\log(m/d_{VC}) + \log(1/\delta)}{m}}\right)$$
💡 经验法则 m ≥ 10·d_VC
SVM 的对偶形式(为什么能用核)
$$\max_\alpha \sum_i\alpha_i - \frac12\sum_{i,j}\alpha_i\alpha_j y_iy_j \,\underbrace{x_i^\top x_j}_{\to\;K(x_i,x_j)}$$
💡 对偶里只剩内积 → 把内积换成核函数即可,这就是核技巧的入口 💡 大部分 α = 0,α > 0 的那些点就是支持向量
反向传播四方程
$$\delta^L = \nabla_a J\odot f'(z^L)$$ $$\delta^l = \left((W^{l+1})^\top\delta^{l+1}\right)\odot f'(z^l)$$ $$\partial J/\partial W^l = \delta^l(a^{l-1})^\top,\qquad \partial J/\partial b^l = \delta^l$$
💡 展开后是 W·f' 的连乘 → 梯度消失/爆炸的来源;残差连接加了个 +I
EM 两步
$$\text{E 步:}\;\gamma_{ik} = \frac{\pi_k\mathcal{N}(x_i\mid\mu_k,\Sigma_k)}{\sum_j\pi_j\mathcal{N}(x_i\mid\mu_j,\Sigma_j)}\qquad \text{M 步:}\;\mu_k=\frac{\sum_i\gamma_{ik}x_i}{\sum_i\gamma_{ik}}$$
💡 E 步就是贝叶斯后验;M 步就是带权重的均值 💡 保证似然单调不减,但只到局部最优 → 多次初始化
📊 VC 维速查
| 模型 | VC 维 |
|---|---|
| d 维线性分类器 | d + 1 |
| 一维区间 | 2 |
| 二维轴对齐矩形 | 4 |
| d 维轴对齐超矩形 | 2d |
| 1-最近邻 | ∞ |
| RBF 核 SVM | ∞ |
| sin(ωx) | ∞(只有 1 个参数!) ⭐ |
⚠️ VC 维 ≠ 参数个数。sin(ωx) 是最好的反例。
🎛️ 核函数速查
| 核 | 公式 | 特点 |
|---|---|---|
| 线性 | $a^\top b$ | 不做映射,n≫d 时首选 |
| 多项式 | $(a^\top b + c)^d$ | d 阶交互 |
| RBF / 高斯 | $\exp(-\gamma\|a-b\|^2)$ | 无穷维,默认首选 |
| Sigmoid | $\tanh(\kappa a^\top b + c)$ | 不总满足 Mercer,少用 |
- γ 大 → 只有极近的点相似 → 边界扭曲 → 过拟合
- γ 小 → 远处也算相似 → 边界平滑 → 欠拟合
- ⭐ C 和 γ 会互相补偿 → 必须联合网格搜索,好模型落在一条对角线上
- Mercer 条件:核矩阵必须半正定
- 代价:核矩阵 n×n,复杂度 O(n²~n³),不 scale(这就是它输给深度学习的原因)
- ⚠️ 用核之前必须标准化特征——否则量纲大的特征会主导距离
🔢 维度灾难速查
| 现象 | 数字 |
|---|---|
| 20 维内切球占立方体 | 0.0000025% |
| 100 维球中最外 5% 壳的体积占比 | 99.4% |
| 500 维时 (最远−最近)/最近 | 0.19 ⭐ |
| 覆盖 20 维需要的样本 | 10²⁰ |
五条出路:降维 / 特征选择 / 加强归纳偏置(最重要) / 正则化 / 流形假设
💡 为什么图像有上万维却能学:流形假设——真实图像只占那个空间里极小的一片弯曲子空间。
⚠️ 十个最容易搞混的地方
| 容易混 | 区别 |
|---|---|
| 训练误差 vs 真实误差 | PAC 里的 err_D 是真实分布上的,不是训练集上的 |
| VC 维 vs 参数个数 | 无关。sin(ωx) 一个参数,VC 维 ∞ |
| 似然 vs 概率 | 似然把数据当已知、参数当变量;概率反过来 |
| 偏差 vs 误差 | 偏差是系统性偏离(多次重训的平均),不是单次误差 |
| Bagging vs Boosting | Bagging 降方差(并行),Boosting 降偏差(串行) |
| SVM 的 C vs 正则 λ | 互为倒数:C 大 = 正则弱 = 容易过拟合 |
| γ(核宽度)vs γ(间隔) | 核里的 γ 是 RBF 宽度;感知机/SVM 里的 γ 是间隔。完全不同 ⭐ |
| 硬间隔 vs 软间隔 | 软间隔允许违规但罚款,现实中几乎总用软间隔 |
| K-Means 的硬分配 vs GMM 的软分配 | 软分配保留"有多像",能做概率异常检测 |
| 局部最优 vs 全局最优 | EM、K-Means、神经网络都只保证局部;SVM、逻辑回归是凸的,保证全局 ⭐ |
📖 术语对照
| 中文 | 英文 | 一句话 |
|---|---|---|
| 似然 | Likelihood | 给定参数,数据出现的概率 |
| 后验 | Posterior | 给定数据,参数的概率 |
| 先验 | Prior | 看数据之前对参数的信念 |
| 共轭先验 | Conjugate Prior | 后验和先验同族,算起来方便 |
| 假设空间 | Hypothesis Space | 模型能表达的所有函数的集合 |
| 打散 | Shattering | 所有 ±标注方式都能实现 |
| 归纳偏置 | Inductive Bias | 模型内建的先验假设 |
| 惰性学习 | Lazy Learning | 训练只存数据,预测时才算(kNN) |
| 间隔 | Margin | 分界线到最近点的距离 |
| 支持向量 | Support Vector | 落在间隔边界上的点,只有它们决定模型 |
| 对偶 | Dual | 换个等价形式,只剩内积 → 能用核 |
| 软间隔 | Soft Margin | 允许违规但要罚,罚款单价 C |
| 结构风险最小化 | SRM | 最小化「训练误差 + 复杂度罚款」 |
| 隐变量 | Latent Variable | 看不见但影响结果的变量 |
| 责任 | Responsibility | EM 的 E 步算出的软分配权重 |
| 证据下界 | ELBO | EM/变分推断实际在优化的那个下界 |
| 流形假设 | Manifold Hypothesis | 高维数据实际分布在低维弯曲子空间上 |
| 双下降 | Double Descent | 参数超过样本数后测试误差再次下降 |
| 可实现 / 不可知 | Realizable / Agnostic | 是否假设存在完美假设 |
| 联合界 | Union Bound | P(A∪B) ≤ P(A)+P(B),PAC 推导的核心工具 |
🧮 需要的数学基础(就这些)
| 工具 | 用在哪 | 在哪补 |
|---|---|---|
| 向量点积 | 核方法、SVM、注意力 | 全景导论第 15 章 |
| 矩阵乘法(会推形状) | 反向传播 | 同上 |
| 链式法则 | 反向传播 | 同上 |
| 条件概率、独立、期望 | MLE / MAP / EM | 同上 |
| 正态分布长什么样 | 到处都是 | 同上 |
| 对数的性质(把乘变加) | 每一个 MLE 推导 ⭐ | 同上 |
不需要:测度论、实分析、矩阵求导推导、凸优化完整理论
💡 一个真相:这份教程里最难的数学工具是链式法则和对数。 剩下的难度全在概念上,不在计算上。
🔗 跨教程速查
| 这里学的 | 在哪里被用到 |
|---|---|
| MLE / 损失函数选择 | ML 基础 03 线性模型、Kaggle 的评价指标 |
| 正则化的四种理解 | ML 基础 10 正则化全家桶 |
| 偏差-方差 | ML 基础 05、Kaggle 的集成 |
| 反向传播 | ML 基础 08、挑战 A 手搓 mini-torch |
| 维度灾难 | 推荐算法的 embedding、向量检索 |
| 没有免费的午餐 | ML 基础 挑战 B 四种解法对决 |
| EM / 隐变量 | 大模型的 MoE 架构、VAE |
👉 回到首页