🏠 总目录📚 本教程 附录A · 数学速查
📑 本页目录(点开跳转)

附录 A · 数学速查

📌 Ctrl+F 搜。不要通读。 这一页的用法:写代码/看论文时卡住 → 搜关键词 → 看到那一行 → 回去继续干活。


🔑 一张表:你用的每个东西的真身

你在用的 它的真身 在哪一章
平方误差 MSE 高斯噪声假设下的 MLE 01
交叉熵 伯努利 / 类别分布的 MLE 01
L1 损失 / Huber 拉普拉斯分布假设(尾巴厚,抗离群) 01
泊松损失 计数数据的 MLE 01
L2 正则 / weight_decay 高斯先验下的 MAP,λ = σ²/τ² 02
L1 正则 / Lasso 拉普拉斯先验的 MAP(0 处尖峰 → 稀疏) 02
ElasticNet 高斯 + 拉普拉斯的混合先验 02
感知机的"猜错才更新" 只有违反间隔的点才有梯度 03
kNN 的高斯加权 RBF 核 04、06
SVM 的 C 正则强度的倒数,C = 1/λ 07
SVM 只记住支持向量 对偶解里大部分 α = 0 07
Bagging / 随机森林 降方差(Bias 基本不变) 08
Boosting 降偏差(Var 可能上升) 08
正则化(第四种理解) 结构风险最小化里的复杂度罚款 10
早停 early stopping 隐式正则(限制了有效假设空间) 10
残差连接 梯度公式里的 +I 12
softmax + 交叉熵 δ = 预测−真实 两个导数互相约掉 12
K-Means GMM 的特例(球形等大 + 硬分配) 13
集成有效 偏差-方差分解的直接推论 08

🔑 这张表是整份教程的浓缩版。如果只记一样东西,记它。


🧭 「我该翻哪一章」决策表

你的问题 去哪
该用什么损失函数? 01 最大似然
该用 L1 还是 L2 正则?λ 怎么定? 02 MAP
数据线性不可分怎么办? 03 感知机 → 三条出路
kNN 为什么在高维上不行? 04 + 05 维度灾难
特征太多要不要降维? 05 维度灾难
SVM 的 C 和 γ 怎么调? 06 核技巧 + 07 SVM
模型欠拟合还是过拟合? 08 偏差方差
要多少数据才够? 09 PAC
模型复杂度怎么量化? 10 VC 维
为什么没有"最强算法"? 11 没有免费的午餐
梯度消失/爆炸的根因? 12 反向传播
聚类该用 K-Means 还是 GMM? 13 EM

📐 核心公式

概率视角

$$\hat\theta_{MLE} = \arg\max_\theta \sum_i \log p(x_i\mid\theta)$$ $$\hat\theta_{MAP} = \arg\max_\theta \left[\sum_i \log p(x_i\mid\theta) + \log p(\theta)\right]$$

💡 MAP 比 MLE 多的那一项 log p(θ),就是正则项的来源。

贝叶斯定理(EM 的 E 步、朴素贝叶斯都靠它):

$$p(\theta\mid x) = \frac{p(x\mid\theta)\,p(\theta)}{p(x)} \;\propto\; \underbrace{p(x\mid\theta)}_{\text{似然}}\cdot\underbrace{p(\theta)}_{\text{先验}}$$

正则化的四种等价理解 ⭐

视角 说法 章节
贝叶斯 加了一个关于参数的先验 02
偏差-方差 故意引入偏差,换方差的大幅下降 08
学习理论 缩小了有效假设空间,降低样本需求 09
结构风险 给复杂度罚款 10

💡 四者是同一件事的四个面。 哪个视角好用就用哪个。

偏差-方差分解

$$\mathbb{E}[(y-\hat f)^2] = \text{Bias}^2 + \text{Var} + \sigma^2$$

集成的方差

$$\text{Var}(\bar f) = \rho\sigma^2 + \frac{1-\rho}{M}\sigma^2$$

💡 第一项不随 M 减小 → 必须降低相关性 ρ(随机森林随机选特征的理由)

感知机收敛定理

$$\text{错误次数} \le (R/\gamma)^2$$

💡 与数据量、维度都无关;γ 后来成了 SVM 的优化目标

PAC 样本复杂度(有限假设空间)

$$m \ge \frac{1}{\varepsilon}\left(\ln|\mathcal{H}| + \ln\frac{1}{\delta}\right)$$

💡 ε 是反比(精度最贵),|H| 和 δ 都是对数(便宜) ⚠️ agnostic 版本 ε 变成 平方1/2ε²)——没有完美假设时精度更贵

VC 泛化界

$$\text{err}_{\mathcal{D}} \le \text{err}_S + O\!\left(\sqrt{\frac{d_{VC}\log(m/d_{VC}) + \log(1/\delta)}{m}}\right)$$

💡 经验法则 m ≥ 10·d_VC

SVM 的对偶形式(为什么能用核)

$$\max_\alpha \sum_i\alpha_i - \frac12\sum_{i,j}\alpha_i\alpha_j y_iy_j \,\underbrace{x_i^\top x_j}_{\to\;K(x_i,x_j)}$$

💡 对偶里只剩内积 → 把内积换成核函数即可,这就是核技巧的入口 💡 大部分 α = 0,α > 0 的那些点就是支持向量

反向传播四方程

$$\delta^L = \nabla_a J\odot f'(z^L)$$ $$\delta^l = \left((W^{l+1})^\top\delta^{l+1}\right)\odot f'(z^l)$$ $$\partial J/\partial W^l = \delta^l(a^{l-1})^\top,\qquad \partial J/\partial b^l = \delta^l$$

💡 展开后是 W·f' 的连乘 → 梯度消失/爆炸的来源;残差连接加了个 +I

EM 两步

$$\text{E 步:}\;\gamma_{ik} = \frac{\pi_k\mathcal{N}(x_i\mid\mu_k,\Sigma_k)}{\sum_j\pi_j\mathcal{N}(x_i\mid\mu_j,\Sigma_j)}\qquad \text{M 步:}\;\mu_k=\frac{\sum_i\gamma_{ik}x_i}{\sum_i\gamma_{ik}}$$

💡 E 步就是贝叶斯后验;M 步就是带权重的均值 💡 保证似然单调不减,但只到局部最优 → 多次初始化


📊 VC 维速查

模型 VC 维
d 维线性分类器 d + 1
一维区间 2
二维轴对齐矩形 4
d 维轴对齐超矩形 2d
1-最近邻
RBF 核 SVM
sin(ωx) ∞(只有 1 个参数!)

⚠️ VC 维 ≠ 参数个数。sin(ωx) 是最好的反例。


🎛️ 核函数速查

公式 特点
线性 $a^\top b$ 不做映射,n≫d 时首选
多项式 $(a^\top b + c)^d$ d 阶交互
RBF / 高斯 $\exp(-\gamma\|a-b\|^2)$ 无穷维,默认首选
Sigmoid $\tanh(\kappa a^\top b + c)$ 不总满足 Mercer,少用

🔢 维度灾难速查

现象 数字
20 维内切球占立方体 0.0000025%
100 维球中最外 5% 壳的体积占比 99.4%
500 维时 (最远−最近)/最近 0.19
覆盖 20 维需要的样本 10²⁰

五条出路:降维 / 特征选择 / 加强归纳偏置(最重要) / 正则化 / 流形假设

💡 为什么图像有上万维却能学:流形假设——真实图像只占那个空间里极小的一片弯曲子空间。


⚠️ 十个最容易搞混的地方

容易混 区别
训练误差 vs 真实误差 PAC 里的 err_D真实分布上的,不是训练集上的
VC 维 vs 参数个数 无关。sin(ωx) 一个参数,VC 维 ∞
似然 vs 概率 似然把数据当已知、参数当变量;概率反过来
偏差 vs 误差 偏差是系统性偏离(多次重训的平均),不是单次误差
Bagging vs Boosting Bagging 降方差(并行),Boosting 降偏差(串行)
SVM 的 C vs 正则 λ 互为倒数:C 大 = 正则弱 = 容易过拟合
γ(核宽度)vs γ(间隔) 核里的 γ 是 RBF 宽度;感知机/SVM 里的 γ 是间隔。完全不同
硬间隔 vs 软间隔 软间隔允许违规但罚款,现实中几乎总用软间隔
K-Means 的硬分配 vs GMM 的软分配 软分配保留"有多像",能做概率异常检测
局部最优 vs 全局最优 EM、K-Means、神经网络都只保证局部;SVM、逻辑回归是的,保证全局 ⭐

📖 术语对照

中文 英文 一句话
似然 Likelihood 给定参数,数据出现的概率
后验 Posterior 给定数据,参数的概率
先验 Prior 看数据之前对参数的信念
共轭先验 Conjugate Prior 后验和先验同族,算起来方便
假设空间 Hypothesis Space 模型能表达的所有函数的集合
打散 Shattering 所有 ±标注方式都能实现
归纳偏置 Inductive Bias 模型内建的先验假设
惰性学习 Lazy Learning 训练只存数据,预测时才算(kNN)
间隔 Margin 分界线到最近点的距离
支持向量 Support Vector 落在间隔边界上的点,只有它们决定模型
对偶 Dual 换个等价形式,只剩内积 → 能用核
软间隔 Soft Margin 允许违规但要罚,罚款单价 C
结构风险最小化 SRM 最小化「训练误差 + 复杂度罚款」
隐变量 Latent Variable 看不见但影响结果的变量
责任 Responsibility EM 的 E 步算出的软分配权重
证据下界 ELBO EM/变分推断实际在优化的那个下界
流形假设 Manifold Hypothesis 高维数据实际分布在低维弯曲子空间上
双下降 Double Descent 参数超过样本数后测试误差再次下降
可实现 / 不可知 Realizable / Agnostic 是否假设存在完美假设
联合界 Union Bound P(A∪B) ≤ P(A)+P(B),PAC 推导的核心工具

🧮 需要的数学基础(就这些)

工具 用在哪 在哪补
向量点积 核方法、SVM、注意力 全景导论第 15 章
矩阵乘法(会推形状) 反向传播 同上
链式法则 反向传播 同上
条件概率、独立、期望 MLE / MAP / EM 同上
正态分布长什么样 到处都是 同上
对数的性质(把乘变加) 每一个 MLE 推导 同上

不需要:测度论、实分析、矩阵求导推导、凸优化完整理论

💡 一个真相:这份教程里最难的数学工具是链式法则和对数。 剩下的难度全在概念上,不在计算上。


🔗 跨教程速查

这里学的 在哪里被用到
MLE / 损失函数选择 ML 基础 03 线性模型、Kaggle 的评价指标
正则化的四种理解 ML 基础 10 正则化全家桶
偏差-方差 ML 基础 05、Kaggle 的集成
反向传播 ML 基础 08挑战 A 手搓 mini-torch
维度灾难 推荐算法的 embedding、向量检索
没有免费的午餐 ML 基础 挑战 B 四种解法对决
EM / 隐变量 大模型的 MoE 架构、VAE

👉 回到首页

打卡记录保存在你的浏览器里,首页能看到总进度