📑 本页目录(点开跳转)
00 · 怎么用这份教程
⏱ 20 分钟
🎯 一句话
这份教程回答一个问题:「为什么这些方法能 work?」 它是《机器学习与深度学习基础》的下一层——那套教你怎么做,这套告诉你凭什么。
🧱 它和基础教程的分工
- 最小二乘:让预测和真实的平方差最小 ✅ 会用了
- L2 正则:加一项 λ‖w‖² 防过拟合 ✅ 会用了
- 偏差方差:训练好、测试差叫过拟合 ✅ 会判断了
为什么加 λ‖w‖² 就能防过拟合?
「偏差 + 方差」是打比方,还是真有这个等式? ↓
- 最小二乘 = 假设噪声服从高斯分布时的最大似然 ⭐
- L2 正则 = 给权重加高斯先验后的 MAP 估计 ⭐
- 偏差方差 = 一个可以严格推导出来的【等式】
补完这层,你会有三种收获:
| 收获 | 具体是什么样 |
|---|---|
| 「记住的规则」变成「能推出来的结论」 | 不再需要背"分类用交叉熵、回归用 MSE"——你能从噪声假设推出来 |
| 遇到新方法能自己判断合不合理 | 看到一个新损失函数,第一反应是"它对应什么噪声假设" |
| 看论文不再被公式劝退 | 论文里那些 argmax Σ log p(...) 你一眼就知道在干嘛 |
📚 八块全新内容(基础教程里完全没有)
| 内容 | 章节 | 为什么值得学 |
|---|---|---|
| 概率视角(最大似然 / MAP) | 01–02 | 一把钥匙打开一堆锁:损失函数为什么长那样、正则化的真身 |
| KL 散度 ⭐ | 01b | 全站被引用最多、却从没定义过的量。它把 01 章那句话补完:最小化 KL = 最小化交叉熵 = 最大化似然 |
| 感知机 | 03 | 第一个学习算法,也是神经网络的祖先 |
| 非参数方法 + 维度灾难 ⭐ | 04–05 | 解释了「为什么高维数据这么难搞」这个贯穿全领域的现象 |
| PCA / SVD 的推导 ⭐ | 05b–05c | 05 章说降维是刚需,这两章说它凭什么这么降、以及实践里真正在算的是 SVD 不是特征分解 |
| 核方法与 SVM ⭐ | 06–07 | 「不用算就能算」的漂亮技巧,深度学习之前的王者 |
| 泛化理论(PAC / VC 维)⭐ | 09–11 | 唯一能回答「要多少数据才够」的理论 |
| EM 与混合模型 | 13 | 有隐变量时怎么学;也是 VAE、MoE 的思想源头 |
⚠️ 三条阅读规则(重要)
① 公式全部可以跳过
每个公式下面都有 💡人话翻译。只看人话翻译,你能拿到 80% 的价值。
数学部分我会放在 <details markdown="1"> 折叠块里,标注 📐 推导(想看再点)——
不点开完全不影响你读下一章。
💡 建议的做法:第一遍全部跳过折叠块,把 17 章通读一遍拿到全景; 第二遍只挑你觉得"这个我想搞清楚"的那两三个推导点开。 一上来就啃推导是最容易半途而废的读法。
② 直觉永远排在公式前面
每章的顺序固定是:先讲这事儿凭什么成立(图/类比)→ 再给公式 → 再说它改变了什么。 如果你在某个公式卡住了,说明前面的直觉没建立好,往回翻,别硬啃。
③ 这份教程主要靠想,不靠跑代码
和基础教程相反——那套必须动手,这套主要靠想明白。 有代码的地方是验证性的(比如亲眼看到维度灾难的数字),不是工程实践。
⚠️ 唯一的例外是第 14 章,那一章全是动手, 而且是全站最难的项目之一(复现双下降、随机标签实验)。
🧩 每章的固定结构(知道了就不会迷路)
🎯 一句话 ← 这章的核心,30 秒读完
正文(直觉 → 公式 → 人话翻译)
📐 折叠推导 ← 想看再点,不点不影响
⭐ 洞察 / 坑表 ← 最有实用价值的部分
🔗 和站内其他章的关系 ← 把新知识挂到已有的知识上
✅ 检查点 ← 答案折叠着,先自己想
🛑 可以停在这里
⚡ 走神救援 ← 整章的浓缩,回来时先读这个 ⭐
⭐ 「走神救援」是为 ADHD 专门设计的: 中断之后回来,不要从头读——直接读上一章的走神救援,30 秒就能接回上下文。
🧮 需要的数学(比你以为的少)
✅ 需要:
· 向量点积、矩阵乘法的形状 (基础教程附录A)
· 求导的链式法则(会用即可,不用推)
· 概率:条件概率、独立、期望
· 正态分布长什么样
· 对数的性质(把乘变成加) ← 每个 MLE 推导都靠它
❌ 不需要:
· 测度论、实分析
· 手推矩阵求导
· 凸优化的完整理论
💡 卡在数学上时,去全景导论第 15 章——那里的核心工具箱只有 5 件(向量点积 / 矩阵乘法 / Softmax / 交叉熵 / 梯度下降),够用。 一个真相:这份教程里最难的数学工具就是链式法则和对数。剩下的难度全在概念上。
🗺️ 教程结构(17 章 + 附录)
【概率视角】 01 最大似然 ⭐ 01b KL散度 ⭐ 02 MAP与正则化的真身 ⭐
【线性分类】 03 感知机
【非参数与维度】 04 非参数方法 05 维度灾难 ⭐
【降维】 05b PCA的推导 ⭐ 05c SVD与实践 ⭐
【核方法】 06 核技巧 ⭐ 07 SVM
【泛化理论】 08 偏差方差分解 09 PAC学习 ⭐
10 VC维 ⭐ 11 没有免费的午餐
【推导补完】 12 反向传播的完整推导 13 EM与高斯混合
【动手】 14 实战与挑战项目
【随时查】 附录A 数学速查
三章是全教程的高光,别跳:
| 章节 | 为什么 |
|---|---|
| ⭐ 第 2 章 MAP | L2 正则的真身是高斯先验。这一章会让你重新理解你已经会的一切 |
| ⭐ 第 5 章 维度灾难 | 一个用数字就能吓到你的现象(500 维时最远和最近的点几乎一样远) |
| ⭐ 第 6 章 核技巧 | 机器学习里最优雅的一个想法:不用算高维映射也能拿到高维的效果 |
⏱️ 五种读法
| 你的情况 | 路线 | 时间 |
|---|---|---|
| 只想要那几个"啊哈"时刻 | 01 → 02 → 05 → 06 → 11 | 2 小时 |
| 想补泛化理论 | 08 → 09 → 10 → 11 | 3 小时 |
| 想补 SVM / 核方法 | 03 → 04 → 05 → 06 → 07 | 3 小时 |
| 想补降维(PCA 凭什么这么降) | 05 → 05b → 05c | 1.7 小时 |
| 想补深度学习的数学 | 01b → 12 → 13(+ 基础教程 07/08) | 2 小时 |
| 完整打牢 | 全部顺读 | 2–3 周 |
🔗 这份教程在整个学习地图里的位置
《机器学习与深度学习基础》 ← 怎么做(必须先有这个)
│
├──→ 《机器学习的数学原理》 ← 你在这里,凭什么这么做
│
├──→ 《推荐算法》 ← 一个完整领域的纵深
├──→ 《Kaggle 竞赛方法论》 ← 把手艺打磨到极致
│
└──→ 《大模型全景导论》 → 《智能体工程教程》 ← 前沿
💡 这份教程不是必经之路,是"回头补"的那一份。 你完全可以先去做推荐算法或 Kaggle,等到某天冒出「为什么是这样」的疑问时再回来。 带着疑问读,比按顺序读有效得多。
✅ 检查点
- 这份教程和基础教程的分工是什么?
- 遇到公式卡住了,正确的做法是什么?
- 中断之后回来,应该先读什么?
- 哪三章是"高光章节"?为什么?
- 只有一小时的话该读哪两章?为什么是这两章?
👀 答案
- 基础教程教怎么做(会用最小二乘、会用 L2 正则),这份教程告诉你凭什么(最小二乘=高斯 MLE、L2=高斯先验的 MAP)。
- 往回翻,别硬啃——卡在公式说明前面的直觉没建立好。也可以直接跳过折叠块,只看 💡人话翻译,能拿到 80% 的价值。
- 上一章的 ⚡走神救援,30 秒接回上下文,不要从头读。
- 第 2 章(正则化的真身=先验,重新理解已会的一切)、第 5 章(维度灾难,用数字吓到你)、第 6 章(核技巧,最优雅的想法)。
- 01 最大似然 + 02 MAP。因为它们是"钥匙",后面很多章是"锁"——损失函数、正则化、EM 都建立在这两章上。
🛑 开始
⚡ 走神救援
这份教程回答「为什么这些方法能 work」——它是基础教程的下一层:那套教你怎么做,这套告诉你凭什么。最小二乘 = 高斯噪声下的最大似然、L2 正则 = 高斯先验下的 MAP、偏差方差 = 能严格推导的等式——「记住的规则」会变成「能推出来的结论」。⚠️三条阅读规则:①公式全部可以跳过,每个都配了💡人话翻译,只看人话就能拿到 80% 的价值,📐折叠推导不点开也不影响下一章;⭐建议第一遍全跳过折叠块、把 17 章通读拿到全景,第二遍只挑那两三个想搞清楚的点开——一上来就啃推导是最容易半途而废的读法;②每章顺序固定是 直觉 → 公式 → 它改变了什么,卡在公式说明前面的直觉没建好,往回翻,别硬啃;③主要靠想不靠跑代码,唯一的例外是第 14 章(全是动手,复现双下降、随机标签)。需要的数学少得出乎意料:链式法则、条件概率、正态分布、对数性质(每个 MLE 推导都靠它)——最难的工具就是链式法则和对数,剩下的难度全在概念上。全书 17 章 + 附录,三个高光别跳:02 MAP(正则化的真身是先验,重新理解你已会的一切)、05 维度灾难(500 维时最远和最近的点几乎一样远)、06 核技巧(不用算高维映射就能拿到高维效果);泛化理论 09–11 是唯一能回答「要多少数据才够」的。八块全新内容里另有三块是后来补的:01b KL 散度(最小化 KL = 最小化交叉熵 = 最大化似然)、05b/05c PCA 与 SVD(05 说降维是刚需,这两章说它凭什么这么降、以及实践里算的是 SVD 不是特征分解)。五种读法:只要那几个「啊哈」时刻走 01→02→05→06→11(2 小时),补泛化理论走 08→11,补核方法走 03→07,补降维走 05→05b→05c(1.7 小时),补深度学习数学走 01b→12→13(2 小时),完整顺读 2–3 周。只有一小时就读 01+02——它们是「钥匙」,后面很多章是「锁」。💡它不是必经之路,是「回头补」的那一份,带着疑问读更有效。⭐走神救援的用法:中断后回来先读上一章的救援,30 秒接回上下文,别从头读。