🏠 总目录📚 本教程 00 · 怎么用这份教程 →
📑 本页目录(点开跳转)

00 · 怎么用这份教程

⏱ 20 分钟


🎯 一句话

这份教程回答一个问题:「为什么这些方法能 work?」 它是《机器学习与深度学习基础》的下一层——那套教你怎么做,这套告诉你凭什么。


🧱 它和基础教程的分工

《机器学习与深度学习基础》
  • 最小二乘:让预测和真实的平方差最小 ✅ 会用了
  • L2 正则:加一项 λ‖w‖² 防过拟合 ✅ 会用了
  • 偏差方差:训练好、测试差叫过拟合 ✅ 会判断了
但是……为什么是平方差?
为什么加 λ‖w‖² 就能防过拟合?
「偏差 + 方差」是打比方,还是真有这个等式? ↓
《机器学习的数学原理》← 你在这里
  • 最小二乘 = 假设噪声服从高斯分布时的最大似然 ⭐
  • L2 正则 = 给权重加高斯先验后的 MAP 估计 ⭐
  • 偏差方差 = 一个可以严格推导出来的【等式】

补完这层,你会有三种收获:

收获 具体是什么样
「记住的规则」变成「能推出来的结论」 不再需要背"分类用交叉熵、回归用 MSE"——你能从噪声假设推出来
遇到新方法能自己判断合不合理 看到一个新损失函数,第一反应是"它对应什么噪声假设"
看论文不再被公式劝退 论文里那些 argmax Σ log p(...) 你一眼就知道在干嘛

📚 八块全新内容(基础教程里完全没有)

内容 章节 为什么值得学
概率视角(最大似然 / MAP) 01–02 一把钥匙打开一堆锁:损失函数为什么长那样、正则化的真身
KL 散度 ⭐ 01b 全站被引用最多、却从没定义过的量。它把 01 章那句话补完:最小化 KL = 最小化交叉熵 = 最大化似然
感知机 03 第一个学习算法,也是神经网络的祖先
非参数方法 + 维度灾难 ⭐ 04–05 解释了「为什么高维数据这么难搞」这个贯穿全领域的现象
PCA / SVD 的推导 ⭐ 05b–05c 05 章说降维是刚需,这两章说它凭什么这么降、以及实践里真正在算的是 SVD 不是特征分解
核方法与 SVM ⭐ 06–07 「不用算就能算」的漂亮技巧,深度学习之前的王者
泛化理论(PAC / VC 维)⭐ 09–11 唯一能回答「要多少数据才够」的理论
EM 与混合模型 13 有隐变量时怎么学;也是 VAE、MoE 的思想源头

⚠️ 三条阅读规则(重要)

① 公式全部可以跳过

每个公式下面都有 💡人话翻译。只看人话翻译,你能拿到 80% 的价值。

数学部分我会放在 <details markdown="1"> 折叠块里,标注 📐 推导(想看再点)—— 不点开完全不影响你读下一章。

💡 建议的做法:第一遍全部跳过折叠块,把 17 章通读一遍拿到全景; 第二遍只挑你觉得"这个我想搞清楚"的那两三个推导点开。 一上来就啃推导是最容易半途而废的读法。

② 直觉永远排在公式前面

每章的顺序固定是:先讲这事儿凭什么成立(图/类比)→ 再给公式 → 再说它改变了什么。 如果你在某个公式卡住了,说明前面的直觉没建立好,往回翻,别硬啃。

③ 这份教程主要靠想,不靠跑代码

和基础教程相反——那套必须动手,这套主要靠想明白。 有代码的地方是验证性的(比如亲眼看到维度灾难的数字),不是工程实践。

⚠️ 唯一的例外是第 14 章,那一章全是动手, 而且是全站最难的项目之一(复现双下降、随机标签实验)。


🧩 每章的固定结构(知道了就不会迷路)

结果对照

🎯 一句话 ← 这章的核心,30 秒读完
正文(直觉→公式→人话翻译)
📐 折叠推导 ← 想看再点,不点不影响
⭐ 洞察 / 坑表 ← 最有实用价值的部分
🔗 和站内其他章的关系 ← 把新知识挂到已有的知识上
✅ 检查点 ← 答案折叠着,先自己想
🛑 可以停在这里
⚡ 走神救援 ← 整章的浓缩,回来时先读这个 ⭐

⭐ 「走神救援」是为 ADHD 专门设计的: 中断之后回来,不要从头读——直接读上一章的走神救援,30 秒就能接回上下文。


🧮 需要的数学(比你以为的少)

对照

✅ 需要:

· 向量点积、矩阵乘法的形状 (基础教程附录A)

· 求导的链式法则(会用即可,不用推)

· 概率:条件概率、独立、期望

· 正态分布长什么样

· 对数的性质(把乘变成加) ← 每个 MLE 推导都靠它

❌ 不需要:

· 测度论、实分析

· 手推矩阵求导

· 凸优化的完整理论

💡 卡在数学上时,去全景导论第 15 章——那里的核心工具箱只有 5 件(向量点积 / 矩阵乘法 / Softmax / 交叉熵 / 梯度下降),够用。 一个真相:这份教程里最难的数学工具就是链式法则和对数。剩下的难度全在概念上。


🗺️ 教程结构(17 章 + 附录)

对照

【概率视角】 01 最大似然 ⭐ 01b KL散度 ⭐ 02 MAP与正则化的真身 ⭐

【线性分类】 03 感知机

【非参数与维度】 04 非参数方法 05 维度灾难 ⭐

【降维】 05b PCA的推导 ⭐ 05c SVD与实践 ⭐

【核方法】 06 核技巧 ⭐ 07 SVM

【泛化理论】 08 偏差方差分解 09 PAC学习 ⭐

10 VC维 ⭐ 11 没有免费的午餐

【推导补完】 12 反向传播的完整推导 13 EM与高斯混合

【动手】 14 实战与挑战项目

【随时查】 附录A 数学速查

三章是全教程的高光,别跳:

章节 为什么
⭐ 第 2 章 MAP L2 正则的真身是高斯先验。这一章会让你重新理解你已经会的一切
⭐ 第 5 章 维度灾难 一个用数字就能吓到你的现象(500 维时最远和最近的点几乎一样远)
⭐ 第 6 章 核技巧 机器学习里最优雅的一个想法:不用算高维映射也能拿到高维的效果

⏱️ 五种读法

你的情况 路线 时间
只想要那几个"啊哈"时刻 01 → 02 → 05 → 06 → 11 2 小时
想补泛化理论 08 → 09 → 10 → 11 1.7 小时
想补 SVM / 核方法 03 → 04 → 05 → 06 → 07 2 小时
想补降维(PCA 凭什么这么降) 05 → 05b → 05c 1.7 小时
想补深度学习的数学 01b → 12 → 13(+ 基础教程 07/08) 2.5 小时
完整打牢 全部顺读 2–3 周

💡 如果只有一小时:读 01 和 02。 这两章的性价比高到不成比例——它们是"钥匙",后面很多章是"锁"。


🔗 这份教程在整个学习地图里的位置

关键信息

💡 这份教程不是必经之路,是"回头补"的那一份。 你完全可以先去做推荐算法或 Kaggle,等到某天冒出「为什么是这样」的疑问时再回来。 带着疑问读,比按顺序读有效得多。


✅ 检查点

  1. 这份教程和基础教程的分工是什么?
  2. 遇到公式卡住了,正确的做法是什么?
  3. 中断之后回来,应该先读什么?
  4. 哪三章是"高光章节"?为什么?
  5. 只有一小时的话该读哪两章?为什么是这两章?
👀 答案
  1. 基础教程教怎么做(会用最小二乘、会用 L2 正则),这份教程告诉你凭什么(最小二乘=高斯 MLE、L2=高斯先验的 MAP)。
  2. 往回翻,别硬啃——卡在公式说明前面的直觉没建立好。也可以直接跳过折叠块,只看 💡人话翻译,能拿到 80% 的价值。
  3. 上一章的 ⚡走神救援,30 秒接回上下文,不要从头读。
  4. 第 2 章(正则化的真身=先验,重新理解已会的一切)、第 5 章(维度灾难,用数字吓到你)、第 6 章(核技巧,最优雅的想法)。
  5. 01 最大似然 + 02 MAP。因为它们是"钥匙",后面很多章是"锁"——损失函数、正则化、EM 都建立在这两章上。

🛑 开始

⚡ 走神救援

这份教程回答「为什么这些方法能 work」——⭐ 它是基础教程的下一层:那套教你怎么做,这套告诉你凭什么。 最小二乘就是高斯噪声下的最大似然、L2 正则就是高斯先验下的 MAP、偏差方差是一个能严格推导的等式——「记住的规则」会变成「能推出来的结论」。

⚠️ 三条阅读规则,第一条最要紧:⭐ 公式全部可以跳过,每个都配了💡人话翻译,只看人话就能拿到大部分价值,折叠的推导不点开也不影响下一章。⭐ 建议第一遍全跳过折叠块、先把全书通读拿到全景,第二遍只挑那两三个想搞清楚的点开——⚠️ 一上来就啃推导是最容易半途而废的读法。 第二条:每章顺序固定是直觉 → 公式 → 它改变了什么,⚠️ 卡在公式说明前面的直觉没建好,往回翻,别硬啃。 第三条:这套主要靠想不靠跑代码,唯一的例外是那一章全是动手的。

⭐ 需要的数学少得出乎意料:链式法则、条件概率、正态分布、对数性质——最难的工具就是链式法则和对数,剩下的难度全在概念上。

三个高光别跳:MAP(⭐ 正则化的真身是先验,会重新理解你已经会的一切)、维度灾难(高维时最远和最近的点几乎一样远)、核技巧(不用算高维映射就拿到高维效果);⭐ 而泛化理论那几章是唯一能回答「要多少数据才够」的。

五种读法按目的分,⭐ 只有一小时就读前两章——它们是「钥匙」,后面很多章是「锁」。

💡 最后一句定位:它不是必经之路,是「回头补」的那一份,带着疑问读更有效。

👉 01-最大似然.md

打卡记录保存在你的浏览器里,首页能看到总进度