📑 本页目录(点开跳转)
00 · 怎么用这份教程
⏱ 20 分钟 | 建议读,它会告诉你哪些章可以跳
🎯 一句话
这份教程补的是承重墙——站里其他几套教程都默认你会的那一层。
🧱 它填的是哪个洞
站里其他几套教程,其实都从「中间层」开始讲 —— 每一套都假设你已经会了某样东西:
- 机器学习基础
- 深度学习基础
- 树模型
- 线性模型
- 过拟合与评估
- 反向传播
- 优化器
- 正则化
- CNN
- RNN
- 通往 Transformer
- PyTorch 实战
补完这一层再去看那三套,很多「记住的结论」会变成「知道为什么」。
三个具体的例子:
| 常听到的一条结论 | 学完这里你会知道的根因 |
|---|---|
| "推荐系统离线好线上崩" | 第 5 章:数据泄漏 + 分布漂移(还有一个纯噪声数据跑出 76.5% 的实验) |
| "LightGBM 的 learning_rate 要小、n_estimators 要大" | 第 4 章:梯度提升每棵树只走一小步,走得慢才走得稳 |
| "Transformer 里到处是残差连接" | 第 8、12 章:梯度是连乘,残差给了它一条不经过乘法的直通路 |
📏 和其他几套的分工
| 教程 | 回答什么 |
|---|---|
| 本教程 | 「模型内部到底在算什么、为什么能学会」 |
| 机器学习的数学原理 | 「凭什么这么做」(本教程的下一层)⭐ |
| Kaggle 竞赛方法论 | 「这个场景该上什么技术、能提多少分」 |
| 推荐算法 | 「工业推荐系统怎么搭」 |
| 大模型全景导论 | 「大模型领域有哪些方向」 |
| 智能体工程 | 「怎么用大模型搭 Agent」 |
💡 本教程和《数学原理》的区别: 这里说"L2 正则能防过拟合,这么加"; 那边说"L2 正则的真身是给参数加高斯先验,λ = σ²/τ²"。 先学这里,有疑问了再去那边。
🔧 标记系统(和其他教程一致)
| 标记 | 意思 |
|---|---|
| ⏱ | 这节多久,时间不够别开 |
| 🎯 一句话 | 只看这个也懂 60% |
| ⭐ / 🎁 | 核心不能跳 / 加餐随便跳 |
| 🔨 动手 | 有代码,必须跑 |
| 💡 人话翻译 | 公式的白话版 |
| ⚠️ 坑 | 真实会踩的错误 |
| 🔗 和站内其他章的关系 | 这块知识在站内别的板块里是哪个结论的根因 |
| ✅ 检查点 | 答案折叠着,先自己想 |
| 🛑 可以停 | 一个自然的断点 |
| ⚡ 走神救援 | 整章浓缩成一段,中断后回来先读这个 ⭐ |
⭐ 「走神救援」是这套教程里最该用的功能: 三天后回来接着学,不要从头读——直接读上一章的走神救援,30 秒接回上下文。
🗺️ 全教程结构
【阶段1】先跑起来 01-02 ← 10 分钟出结果,建立直觉
【阶段2】经典机器学习 03-06 ← 线性模型 / 树模型(04+04b 推导⭐⭐) / 过拟合 / 无监督
【阶段3】深度学习地基 07-11 ← 神经网络 / 反向传播 / 优化 / 正则 / 调试
【阶段4】三大架构 12-14 ← CNN / RNN / 通往 Transformer
【阶段5】工程实践 15-16 ← PyTorch / 特征工程
【阶段6】动手 17 ← 三个递进项目
【阶段7】终极挑战 18-20 ← 手搓 mini-torch / 四种解法对决 / 过拟合实验室
【随时查】 附录A 术语速查 / 附录B 代码速查 / 附录C 手撕代码速查
⭐ 唯一一个带字母后缀的章:04b · XGBoost 的推导(52 分钟,和第 4 章一样长) 第 4 章故意停在「GBDT 的每棵新树拟合损失的负梯度」,而负梯度只给方向不给步长—— 04b 用二阶泰勒展开把「下一棵树该怎么长」写成有闭式解的目标函数,三巨头对比表也在那里,而且是推出来的不是背的。 🎁 只想会调参可以先跳过(第 4 章末尾有直达第 5 章的岔路),随时回来补都行。
三个附录不是一回事,别搜错门:
| 附录 | 什么时候翻 |
|---|---|
| 附录 A · 术语速查卡 | 你卡住的是一个名词 |
| 附录 B · 代码速查 | 你要把实验跑起来——全是能复制粘贴的 sklearn / PyTorch 模板 |
| 附录 C · 手撕代码速查 ⭐ | 面试官说「白板写一个 MHA」——10 题只用 numpy / 裸 torch 的实现(Softmax+CE 反向 / 注意力 / MHA / LayerNorm / BatchNorm / Dropout / Conv2d / K-means / AUC / 逻辑回归),每题都标了最容易写错的那几行 |
两章是全教程的核心,别跳:
| 章节 | 为什么 |
|---|---|
| ⭐⭐ 第 5 章 · 评估与过拟合 | 机器学习里唯一「学会了终身受用」的一章。不会评估,你所有的分数都是假的 |
| ⭐⭐ 第 11 章 · 训练调试手册 | 最难自学、最值钱的实战能力。模型不 work 时你能不能自己救回来,全看这章 |
💡 为什么是这两章:
其他章教你做加法(多会一个模型、多一种架构)。 这两章教你别做错——而在实践中,"没做错"比"多会一个模型"值钱得多。
⏱️ 五种读法
| 你的情况 | 路线 | 时间 |
|---|---|---|
| 只想补 DL 那块(已会经典 ML) | 01 → 05 → 07-11 → 14 | 1 周 |
| 只想补经典 ML(只做树模型/表格数据) | 01-06(含 04b ⭐)→ 16 → 17 | 1 周 |
| 急着用(只想会调试) | 05 → 11 → 附录B | 1 天 |
| 要面试 | 02 → 04b ⭐ → 05 → 08 → 10 → 11 → 14 → 附录C ⭐ | 3 天 |
| 完整打牢 | 全部顺读 | 3-4 周 |
💡 如果只有一个下午:读第 5 章,跑完里面那个 "纯噪声数据也能跑出 76.5% 准确率" 的实验。 这一个实验的冲击力,抵得上十篇讲过拟合的文章。
🧰 环境(1 分钟)
pip install numpy scikit-learn matplotlib
深度学习部分(第 7 章起)再加:
pip install torch
第 4 章的 XGBoost/LightGBM 是可选的(教程里有 sklearn 替代版本):
pip install xgboost lightgbm
💡 不想装? 用 Google Colab,上面全都预装好了,还送 GPU。 全教程除了第 17 章项目三,都不需要 GPU,笔记本足够。
⚠️ 四条使用规则
① 数学看不懂就跳过公式,看「💡 人话翻译」
本教程的公式全部配了白话版。跳过公式不影响你学会用。 真需要补的那点数学在全景导论第 15 章,核心工具箱只有 5 件(向量点积 / 矩阵乘法 / Softmax / 交叉熵 / 梯度下降)。
② 代码必须跑 ⭐
这份教程和其他几套不同——它的知识必须靠手感建立。 光看「过拟合是训练好测试差」没用,你得亲眼看到那个 100% vs 91.8%。
⭐ 一个判断标准:
如果你能说出一章里的结论,却说不出"我跑出来是多少",
那一章你其实没学
③ 别追求一次全懂
反向传播第一次看懂 50% 很正常。往下走,第 11 章调试实战会把它补上。
❌ 卡在第 8 章两小时,最后放弃整套教程
✅ 第 8 章懂 50% 就往下走,第 17 章手写一遍自然就懂了
④ 每章的 ✅检查点先自己想再看答案
答案是折叠的,这是故意的。 "看着答案觉得自己懂了"是学习里最大的幻觉——先自己答一遍,才知道哪里是空的。
🧠 给 ADHD 的四条具体建议
| 建议 | 怎么做 |
|---|---|
| 一次只开一章 | 每章都标了时间。时间不够就别开,比开了半章更好 |
| 用 🛑 可以停 | 每章末尾有断点。停在那里,比硬撑到失去兴趣好 |
| 回来先读 ⚡走神救援 | 30 秒接回上下文,永远不要从头读 ⭐ |
| 卡住超过 25 分钟就跳过 | 标记一下,往下走。回头看往往就通了——卡死是最大的时间黑洞 |
💡 一个真实有效的技巧:跑完一段代码就在旁边写一行"我看到了什么"。 不是为了记录,是为了给自己一个即时的完成感——这比"学完一章"的反馈快得多。
✅ 检查点
- 这份教程和《机器学习的数学原理》的分工是什么?
- 哪两章是核心?为什么是这两章而不是讲模型的那些?
- 中断之后回来,正确的做法是什么?
- "我能说出结论"和"我学会了"的区别是什么?
- 卡在某个概念上超过 25 分钟该怎么办?
👀 答案
- 本教程讲「模型内部在算什么、怎么用」,《数学原理》讲「凭什么」(L2 正则的真身是高斯先验)。先学这里,有疑问了再去那边。
- 第 5 章评估与过拟合、第 11 章训练调试手册。因为其他章教你做加法(多会一个模型),这两章教你别做错——实践中"没做错"比"多会一个模型"值钱得多。
- 读上一章的 ⚡走神救援,30 秒接回上下文,永远不要从头读。
- 如果你能说出结论却说不出"我跑出来是多少",那一章其实没学。这份教程的知识必须靠手感建立。
- 标记一下,往下走。回头看往往就通了。卡死在一个点上是最大的时间黑洞,也是放弃整套教程最常见的原因。
🛑 开始
⚡ 走神救援
这份教程补的是承重墙——推荐算法直接上 DeepFM、Kaggle 教你调 LightGBM、全景导论讲 Transformer,都默认你已经会了"神经网络怎么训""GBDT 怎么工作""反向传播是什么"。补完之后"记住的结论"会变成"知道为什么":离线好线上崩=第 5 章的数据泄漏;到处是残差=梯度是连乘,残差是那条不经过乘法的直通路。⭐和《数学原理》的分工:这里讲"怎么做",那边讲"凭什么"(L2 的真身是高斯先验)——先学这里,有疑问再去那边。前置几乎为零:numpy+sklearn,第 7 章起加 torch,除第 17 章项目三外全程不用 GPU。⭐⭐两个核心章别跳:第 5 章评估与过拟合、第 11 章训练调试手册——其他章教你做加法,这两章教你别做错,而"没做错"比"多会一个模型"值钱得多。五种读法:补深度学习走 01→05→07-11→14;只做表格数据走 01-06→16→17;⭐急着用只要一天:05→11→附录B;面试三天(02→04b→05→08→10→11→14→附录C);完整三到四周。⭐唯一带字母后缀的章是 04b XGBoost 的推导(52 分钟,和第 4 章一样长)——第 4 章停在「新树拟合负梯度」,而负梯度只给方向不给步长,04b 用二阶泰勒把它写成有闭式解的目标函数;🎁只想调参可以先跳过,随时回来补。从哪开始:正常从第 1 章起(十分钟出结果);⭐只有一个下午就直接读第 5 章,跑那个纯噪声数据也能跑出 76.5% 准确率的实验。四条规则:①公式看不懂就看💡人话翻译 ②⭐代码必须跑——说得出结论却说不出"我跑出来是多少"就是没学(比如那个 100% 对 91.8%)③别追求一次全懂,⚠️卡在第 8 章两小时最后放弃整套是最典型的死法 ④检查点先自己答。ADHD 四建议:一次只开一章、用🛑断点停、回来先读⚡走神救援、永远别从头读、⚠️卡住超 25 分钟就跳过(卡死是最大的时间黑洞)。