机器学习的数学原理
回答一个问题:为什么这些方法能 work?
它是《机器学习与深度学习基础》的下一层—— 那套教你怎么做,这套告诉你凭什么。 最小二乘为什么用平方?L2 正则凭什么能防过拟合?「偏差+方差」是打比方还是真有这个等式?
🎲 从最大似然开始 🔮 直接看最漂亮的一章0%
你的进度(在每章末尾点「打卡」,保存在本浏览器里)
🧱 它补的是哪一层
《机器学习与深度学习基础》
最小二乘:让预测和真实的平方差最小 ✅ 会用了
L2 正则:加一项 λ‖w‖² 防过拟合 ✅ 会用了
偏差方差:训练好测试差叫过拟合 ✅ 会判断了
│
│ 但是……为什么是平方差?
│ 为什么加 λ‖w‖² 就能防过拟合?
│ "偏差+方差" 是打比方还是真有这个等式?
▼
《机器学习的数学原理》← 你在这里
最小二乘 = 假设噪声服从高斯分布时的最大似然
L2 正则 = 给权重加高斯先验后的 MAP 估计,λ = 噪声方差/先验方差
偏差方差 = 一个可以严格推导出来的【等式】
📚 六块全新内容(基础教程里完全没有)
| 内容 | 为什么值得学 |
|---|---|
| 概率视角(最大似然 / MAP) | 一把钥匙开一堆锁:损失函数为什么长那样、正则化的真身 |
| 感知机 | 第一个学习算法,也是神经网络的祖先 |
| 非参数方法 + 维度灾难 ⭐ | 解释「为什么高维数据这么难搞」这个贯穿全领域的现象 |
| 核方法与 SVM ⭐ | 「不用算就能算」的漂亮技巧,深度学习之前的王者 |
| 泛化理论(PAC / VC 维)⭐ | 唯一能回答「要多少数据才够」的理论 |
| EM 与混合模型 | 有隐变量时怎么学;K-Means 的真身 |
⚠️ 三条阅读规则
① 公式全部可以跳过
每个公式下面都有 💡人话翻译,推导放在可折叠的
每个公式下面都有 💡人话翻译,推导放在可折叠的
📐 块里。
只看人话翻译能拿到 80% 的价值。② 直觉永远排在公式前面
顺序固定:先讲凭什么成立(图/类比)→ 再给公式 → 再说它改变了什么。 卡在公式上说明前面直觉没建立好,往回翻别硬啃。
顺序固定:先讲凭什么成立(图/类比)→ 再给公式 → 再说它改变了什么。 卡在公式上说明前面直觉没建立好,往回翻别硬啃。
③ 这份不需要跑代码
和基础教程相反——那套必须动手,这套主要靠想明白。 有代码的地方是验证性的(比如亲眼看到维度灾难的数字)。
和基础教程相反——那套必须动手,这套主要靠想明白。 有代码的地方是验证性的(比如亲眼看到维度灾难的数字)。
⭐ 三章是高光,别跳: 第 2 章(L2 正则的真身是高斯先验——会让你重新理解已经会的一切)、 第 5 章(维度灾难,用数字就能吓到你)、 第 6 章(核技巧,机器学习里最优雅的想法)。