🏠 总目录📚 本教程 00 · 怎么用这份教程
📑 本页目录(点开跳转)

00 · 怎么用这份教程

20 分钟


🎯 一句话

这份教程回答一个问题:「为什么这些方法能 work?」 它是《机器学习与深度学习基础》下一层——那套教你怎么做,这套告诉你凭什么


🧱 它和基础教程的分工

《机器学习与深度学习基础》
  • 最小二乘:让预测和真实的平方差最小 ✅ 会用了
  • L2 正则:加一项 λ‖w‖² 防过拟合 ✅ 会用了
  • 偏差方差:训练好、测试差叫过拟合 ✅ 会判断了
但是……为什么是平方差?
为什么加 λ‖w‖² 就能防过拟合?
「偏差 + 方差」是打比方,还是真有这个等式? ↓
《机器学习的数学原理》← 你在这里
  • 最小二乘 = 假设噪声服从高斯分布时的最大似然 ⭐
  • L2 正则 = 给权重加高斯先验后的 MAP 估计 ⭐
  • 偏差方差 = 一个可以严格推导出来的【等式】

补完这层,你会有三种收获

收获 具体是什么样
「记住的规则」变成「能推出来的结论」 不再需要背"分类用交叉熵、回归用 MSE"——你能从噪声假设推出来
遇到新方法能自己判断合不合理 看到一个新损失函数,第一反应是"它对应什么噪声假设"
看论文不再被公式劝退 论文里那些 argmax Σ log p(...) 你一眼就知道在干嘛

📚 八块全新内容(基础教程里完全没有)

内容 章节 为什么值得学
概率视角(最大似然 / MAP) 01–02 一把钥匙打开一堆锁:损失函数为什么长那样、正则化的真身
KL 散度 01b 全站被引用最多、却从没定义过的量。它把 01 章那句话补完:最小化 KL = 最小化交叉熵 = 最大化似然
感知机 03 第一个学习算法,也是神经网络的祖先
非参数方法 + 维度灾难 04–05 解释了「为什么高维数据这么难搞」这个贯穿全领域的现象
PCA / SVD 的推导 05b–05c 05 章说降维是刚需,这两章说它凭什么这么降、以及实践里真正在算的是 SVD 不是特征分解
核方法与 SVM 06–07 「不用算就能算」的漂亮技巧,深度学习之前的王者
泛化理论(PAC / VC 维)⭐ 09–11 唯一能回答「要多少数据才够」的理论
EM 与混合模型 13 有隐变量时怎么学;也是 VAE、MoE 的思想源头

⚠️ 三条阅读规则(重要)

① 公式全部可以跳过

每个公式下面都有 💡人话翻译只看人话翻译,你能拿到 80% 的价值。

数学部分我会放在 <details markdown="1"> 折叠块里,标注 📐 推导(想看再点)—— 不点开完全不影响你读下一章。

💡 建议的做法:第一遍全部跳过折叠块,把 17 章通读一遍拿到全景; 第二遍只挑你觉得"这个我想搞清楚"的那两三个推导点开。 一上来就啃推导是最容易半途而废的读法。

② 直觉永远排在公式前面

每章的顺序固定是:先讲这事儿凭什么成立(图/类比)→ 再给公式 → 再说它改变了什么。 如果你在某个公式卡住了,说明前面的直觉没建立好,往回翻,别硬啃

③ 这份教程主要靠想,不靠跑代码

和基础教程相反——那套必须动手,这套主要靠想明白。 有代码的地方是验证性的(比如亲眼看到维度灾难的数字),不是工程实践。

⚠️ 唯一的例外是第 14 章,那一章全是动手, 而且是全站最难的项目之一(复现双下降、随机标签实验)。


🧩 每章的固定结构(知道了就不会迷路)

   🎯 一句话        ← 这章的核心,30 秒读完
   正文(直觉 → 公式 → 人话翻译)
   📐 折叠推导      ← 想看再点,不点不影响
   ⭐ 洞察 / 坑表   ← 最有实用价值的部分
   🔗 和站内其他章的关系 ← 把新知识挂到已有的知识上
   ✅ 检查点        ← 答案折叠着,先自己想
   🛑 可以停在这里
   ⚡ 走神救援      ← 整章的浓缩,回来时先读这个 ⭐

「走神救援」是为 ADHD 专门设计的: 中断之后回来,不要从头读——直接读上一章的走神救援,30 秒就能接回上下文。


🧮 需要的数学(比你以为的少)

   ✅ 需要:
   · 向量点积、矩阵乘法的形状        (基础教程附录A)
   · 求导的链式法则(会用即可,不用推)
   · 概率:条件概率、独立、期望
   · 正态分布长什么样
   · 对数的性质(把乘变成加)        ← 每个 MLE 推导都靠它

   ❌ 不需要:
   · 测度论、实分析
   · 手推矩阵求导
   · 凸优化的完整理论

💡 卡在数学上时,去全景导论第 15 章——那里的核心工具箱只有 5 件(向量点积 / 矩阵乘法 / Softmax / 交叉熵 / 梯度下降),够用。 一个真相:这份教程里最难的数学工具就是链式法则和对数。剩下的难度全在概念上。


🗺️ 教程结构(17 章 + 附录)

  【概率视角】     01 最大似然 ⭐    01b KL散度 ⭐     02 MAP与正则化的真身 ⭐
  【线性分类】     03 感知机
  【非参数与维度】 04 非参数方法      05 维度灾难 ⭐
  【降维】         05b PCA的推导 ⭐   05c SVD与实践 ⭐
  【核方法】       06 核技巧 ⭐       07 SVM
  【泛化理论】     08 偏差方差分解    09 PAC学习 ⭐
                  10 VC维 ⭐         11 没有免费的午餐
  【推导补完】     12 反向传播的完整推导   13 EM与高斯混合
  【动手】         14 实战与挑战项目
  【随时查】       附录A 数学速查

三章是全教程的高光,别跳

章节 为什么
第 2 章 MAP L2 正则的真身是高斯先验。这一章会让你重新理解你已经会的一切
第 5 章 维度灾难 一个用数字就能吓到你的现象(500 维时最远和最近的点几乎一样远)
第 6 章 核技巧 机器学习里最优雅的一个想法:不用算高维映射也能拿到高维的效果

⏱️ 五种读法

你的情况 路线 时间
只想要那几个"啊哈"时刻 01 → 02 → 05 → 06 → 11 2 小时
想补泛化理论 08 → 09 → 10 → 11 3 小时
想补 SVM / 核方法 03 → 04 → 05 → 06 → 07 3 小时
想补降维(PCA 凭什么这么降) 05 → 05b → 05c 1.7 小时
想补深度学习的数学 01b → 12 → 13(+ 基础教程 07/08) 2 小时
完整打牢 全部顺读 2–3 周

💡 如果只有一小时:读 0102。 这两章的性价比高到不成比例——它们是"钥匙",后面很多章是"锁"。


🔗 这份教程在整个学习地图里的位置

   《机器学习与深度学习基础》 ← 怎么做(必须先有这个)
              │
              ├──→ 《机器学习的数学原理》 ← 你在这里,凭什么这么做
              │
              ├──→ 《推荐算法》         ← 一个完整领域的纵深
              ├──→ 《Kaggle 竞赛方法论》 ← 把手艺打磨到极致
              │
              └──→ 《大模型全景导论》 → 《智能体工程教程》 ← 前沿

💡 这份教程不是必经之路,是"回头补"的那一份。 你完全可以先去做推荐算法或 Kaggle,等到某天冒出「为什么是这样」的疑问时再回来。 带着疑问读,比按顺序读有效得多。


✅ 检查点

  1. 这份教程和基础教程的分工是什么?
  2. 遇到公式卡住了,正确的做法是什么?
  3. 中断之后回来,应该先读什么?
  4. 哪三章是"高光章节"?为什么?
  5. 只有一小时的话该读哪两章?为什么是这两章?
👀 答案
  1. 基础教程教怎么做(会用最小二乘、会用 L2 正则),这份教程告诉你凭什么(最小二乘=高斯 MLE、L2=高斯先验的 MAP)。
  2. 往回翻,别硬啃——卡在公式说明前面的直觉没建立好。也可以直接跳过折叠块,只看 💡人话翻译,能拿到 80% 的价值。
  3. 上一章的 ⚡走神救援,30 秒接回上下文,不要从头读。
  4. 第 2 章(正则化的真身=先验,重新理解已会的一切)、第 5 章(维度灾难,用数字吓到你)、第 6 章(核技巧,最优雅的想法)。
  5. 01 最大似然 + 02 MAP。因为它们是"钥匙",后面很多章是"锁"——损失函数、正则化、EM 都建立在这两章上。

🛑 开始

走神救援

这份教程回答「为什么这些方法能 work」——它是基础教程的下一层:那套教你怎么做,这套告诉你凭什么最小二乘 = 高斯噪声下的最大似然、L2 正则 = 高斯先验下的 MAP、偏差方差 = 能严格推导的等式——「记住的规则」会变成「能推出来的结论」。⚠️三条阅读规则:①公式全部可以跳过,每个都配了💡人话翻译,只看人话就能拿到 80% 的价值,📐折叠推导不点开也不影响下一章;⭐建议第一遍全跳过折叠块、把 17 章通读拿到全景,第二遍只挑那两三个想搞清楚的点开——一上来就啃推导是最容易半途而废的读法;②每章顺序固定是 直觉 → 公式 → 它改变了什么,卡在公式说明前面的直觉没建好,往回翻,别硬啃;③主要靠想不靠跑代码,唯一的例外是第 14 章(全是动手,复现双下降、随机标签)。需要的数学少得出乎意料:链式法则、条件概率、正态分布、对数性质(每个 MLE 推导都靠它)——最难的工具就是链式法则和对数,剩下的难度全在概念上。全书 17 章 + 附录,三个高光别跳:02 MAP(正则化的真身是先验,重新理解你已会的一切)、05 维度灾难(500 维时最远和最近的点几乎一样远)、06 核技巧(不用算高维映射就能拿到高维效果);泛化理论 09–11 是唯一能回答「要多少数据才够」的。八块全新内容里另有三块是后来补的:01b KL 散度(最小化 KL = 最小化交叉熵 = 最大化似然)、05b/05c PCA 与 SVD(05 说降维是刚需,这两章说它凭什么这么降、以及实践里算的是 SVD 不是特征分解)。五种读法:只要那几个「啊哈」时刻走 01→02→05→06→11(2 小时),补泛化理论走 08→11,补核方法走 03→07,补降维走 05→05b→05c(1.7 小时),补深度学习数学走 01b→12→13(2 小时),完整顺读 2–3 周。只有一小时就读 01+02——它们是「钥匙」,后面很多章是「锁」。💡它不是必经之路,是「回头补」的那一份,带着疑问读更有效。⭐走神救援的用法:中断后回来先读上一章的救援,30 秒接回上下文,别从头读。

👉 01-最大似然.md

打卡记录保存在你的浏览器里,首页能看到总进度