🏠 总目录📚 本教程 00 · 怎么用这份教程
📑 本页目录(点开跳转)

00 · 怎么用这份教程

20 分钟 | 建议读,它会告诉你哪些章可以跳


🎯 一句话

这份教程补的是承重墙——站里其他几套教程都默认你会的那一层。


🧱 它填的是哪个洞

站里其他几套教程,其实都从「中间层」开始讲 —— 每一套都假设你已经会了某样东西:

推荐算法
第 8 章直接上 DeepFM
「神经网络怎么训的」
Kaggle
教你 LightGBM 怎么调参
「GBDT 怎么工作的」
全景导论
第 2 章讲 Transformer
「反向传播是什么」
这一层就是本教程要补的
  • 机器学习基础
  • 深度学习基础
  • 树模型
  • 线性模型
  • 过拟合与评估
  • 反向传播
  • 优化器
  • 正则化
  • CNN
  • RNN
  • 通往 Transformer
  • PyTorch 实战

补完这一层再去看那三套,很多「记住的结论」会变成「知道为什么」。

三个具体的例子

常听到的一条结论 学完这里你会知道的根因
"推荐系统离线好线上崩" 第 5 章:数据泄漏 + 分布漂移(还有一个纯噪声数据跑出 76.5% 的实验)
"LightGBM 的 learning_rate 要小、n_estimators 要大" 第 4 章:梯度提升每棵树只走一小步,走得慢才走得稳
"Transformer 里到处是残差连接" 第 8、12 章:梯度是连乘,残差给了它一条不经过乘法的直通路

📏 和其他几套的分工

教程 回答什么
本教程 「模型内部到底在算什么、为什么能学会」
机器学习的数学原理 凭什么这么做」(本教程的下一层)⭐
Kaggle 竞赛方法论 「这个场景该上什么技术、能提多少分」
推荐算法 「工业推荐系统怎么搭」
大模型全景导论 「大模型领域有哪些方向」
智能体工程 「怎么用大模型搭 Agent」

💡 本教程和《数学原理》的区别: 这里说"L2 正则能防过拟合,这么加"; 那边说"L2 正则的真身是给参数加高斯先验,λ = σ²/τ²"。 先学这里,有疑问了再去那边。


🔧 标记系统(和其他教程一致)

标记 意思
这节多久,时间不够别开
🎯 一句话 只看这个也懂 60%
⭐ / 🎁 核心不能跳 / 加餐随便跳
🔨 动手 有代码,必须跑
💡 人话翻译 公式的白话版
⚠️ 坑 真实会踩的错误
🔗 和站内其他章的关系 这块知识在站内别的板块里是哪个结论的根因
✅ 检查点 答案折叠着,先自己想
🛑 可以停 一个自然的断点
走神救援 整章浓缩成一段,中断后回来先读这个

「走神救援」是这套教程里最该用的功能: 三天后回来接着学,不要从头读——直接读上一章的走神救援,30 秒接回上下文。


🗺️ 全教程结构

  【阶段1】先跑起来          01-02   ← 10 分钟出结果,建立直觉
  【阶段2】经典机器学习      03-06   ← 线性模型 / 树模型(04+04b 推导⭐⭐) / 过拟合 / 无监督
  【阶段3】深度学习地基      07-11   ← 神经网络 / 反向传播 / 优化 / 正则 / 调试
  【阶段4】三大架构          12-14   ← CNN / RNN / 通往 Transformer
  【阶段5】工程实践          15-16   ← PyTorch / 特征工程
  【阶段6】动手              17      ← 三个递进项目
  【阶段7】终极挑战          18-20   ← 手搓 mini-torch / 四种解法对决 / 过拟合实验室
  【随时查】                 附录A 术语速查 / 附录B 代码速查 / 附录C 手撕代码速查

唯一一个带字母后缀的章:04b · XGBoost 的推导(52 分钟,和第 4 章一样长) 第 4 章故意停在「GBDT 的每棵新树拟合损失的负梯度」,而负梯度只给方向不给步长—— 04b 用二阶泰勒展开把「下一棵树该怎么长」写成有闭式解的目标函数,三巨头对比表也在那里,而且是推出来的不是背的。 🎁 只想会调参可以先跳过(第 4 章末尾有直达第 5 章的岔路),随时回来补都行

三个附录不是一回事,别搜错门

附录 什么时候翻
附录 A · 术语速查卡 你卡住的是一个名词
附录 B · 代码速查 你要把实验跑起来——全是能复制粘贴的 sklearn / PyTorch 模板
附录 C · 手撕代码速查 面试官说「白板写一个 MHA」——10 题只用 numpy / 裸 torch 的实现(Softmax+CE 反向 / 注意力 / MHA / LayerNorm / BatchNorm / Dropout / Conv2d / K-means / AUC / 逻辑回归),每题都标了最容易写错的那几行

两章是全教程的核心,别跳

章节 为什么
⭐⭐ 第 5 章 · 评估与过拟合 机器学习里唯一「学会了终身受用」的一章。不会评估,你所有的分数都是假的
⭐⭐ 第 11 章 · 训练调试手册 最难自学、最值钱的实战能力。模型不 work 时你能不能自己救回来,全看这章

💡 为什么是这两章

其他章教你做加法(多会一个模型、多一种架构)。 这两章教你别做错——而在实践中,"没做错"比"多会一个模型"值钱得多


⏱️ 五种读法

你的情况 路线 时间
只想补 DL 那块(已会经典 ML) 01 → 05 → 07-11 → 14 1 周
只想补经典 ML(只做树模型/表格数据) 01-06(含 04b ⭐)→ 16 → 17 1 周
急着用(只想会调试) 05 → 11 → 附录B 1 天
要面试 02 → 04b ⭐ → 05 → 08 → 10 → 11 → 14 → 附录C 3 天
完整打牢 全部顺读 3-4 周

💡 如果只有一个下午:读第 5 章,跑完里面那个 "纯噪声数据也能跑出 76.5% 准确率" 的实验。 这一个实验的冲击力,抵得上十篇讲过拟合的文章。


🧰 环境(1 分钟)

pip install numpy scikit-learn matplotlib

深度学习部分(第 7 章起)再加:

pip install torch

第 4 章的 XGBoost/LightGBM 是可选的(教程里有 sklearn 替代版本):

pip install xgboost lightgbm

💡 不想装?Google Colab,上面全都预装好了,还送 GPU。 全教程除了第 17 章项目三,都不需要 GPU,笔记本足够。


⚠️ 四条使用规则

① 数学看不懂就跳过公式,看「💡 人话翻译」

本教程的公式全部配了白话版。跳过公式不影响你学会用。 真需要补的那点数学在全景导论第 15 章,核心工具箱只有 5 件(向量点积 / 矩阵乘法 / Softmax / 交叉熵 / 梯度下降)。

② 代码必须跑 ⭐

这份教程和其他几套不同——它的知识必须靠手感建立。 光看「过拟合是训练好测试差」没用,你得亲眼看到那个 100% vs 91.8%

   ⭐ 一个判断标准:
   如果你能说出一章里的结论,却说不出"我跑出来是多少",
   那一章你其实没学

③ 别追求一次全懂

反向传播第一次看懂 50% 很正常。往下走,第 11 章调试实战会把它补上。

   ❌ 卡在第 8 章两小时,最后放弃整套教程
   ✅ 第 8 章懂 50% 就往下走,第 17 章手写一遍自然就懂了

④ 每章的 ✅检查点先自己想再看答案

答案是折叠的,这是故意的。 "看着答案觉得自己懂了"是学习里最大的幻觉——先自己答一遍,才知道哪里是空的。


🧠 给 ADHD 的四条具体建议

建议 怎么做
一次只开一章 每章都标了时间。时间不够就别开,比开了半章更好
用 🛑 可以停 每章末尾有断点。停在那里,比硬撑到失去兴趣好
回来先读 ⚡走神救援 30 秒接回上下文,永远不要从头读
卡住超过 25 分钟就跳过 标记一下,往下走。回头看往往就通了——卡死是最大的时间黑洞

💡 一个真实有效的技巧跑完一段代码就在旁边写一行"我看到了什么"。 不是为了记录,是为了给自己一个即时的完成感——这比"学完一章"的反馈快得多。


✅ 检查点

  1. 这份教程和《机器学习的数学原理》的分工是什么?
  2. 哪两章是核心?为什么是这两章而不是讲模型的那些?
  3. 中断之后回来,正确的做法是什么?
  4. "我能说出结论"和"我学会了"的区别是什么?
  5. 卡在某个概念上超过 25 分钟该怎么办?
👀 答案
  1. 本教程讲「模型内部在算什么、怎么用」,《数学原理》讲「凭什么」(L2 正则的真身是高斯先验)。先学这里,有疑问了再去那边。
  2. 第 5 章评估与过拟合第 11 章训练调试手册。因为其他章教你做加法(多会一个模型),这两章教你别做错——实践中"没做错"比"多会一个模型"值钱得多。
  3. 读上一章的 ⚡走神救援,30 秒接回上下文,永远不要从头读
  4. 如果你能说出结论却说不出"我跑出来是多少",那一章其实没学。这份教程的知识必须靠手感建立。
  5. 标记一下,往下走。回头看往往就通了。卡死在一个点上是最大的时间黑洞,也是放弃整套教程最常见的原因。

🛑 开始

走神救援

这份教程补的是承重墙——推荐算法直接上 DeepFM、Kaggle 教你调 LightGBM、全景导论讲 Transformer,都默认你已经会了"神经网络怎么训""GBDT 怎么工作""反向传播是什么"。补完之后"记住的结论"会变成"知道为什么":离线好线上崩=第 5 章的数据泄漏;到处是残差=梯度是连乘,残差是那条不经过乘法的直通路。⭐和《数学原理》的分工:这里讲"怎么做",那边讲"凭什么"(L2 的真身是高斯先验)——先学这里,有疑问再去那边前置几乎为零:numpy+sklearn,第 7 章起加 torch,除第 17 章项目三外全程不用 GPU。⭐⭐两个核心章别跳:第 5 章评估与过拟合、第 11 章训练调试手册——其他章教你做加法,这两章教你别做错,而"没做错"比"多会一个模型"值钱得多。五种读法:补深度学习走 01→05→07-11→14;只做表格数据走 01-06→16→17;⭐急着用只要一天:05→11→附录B;面试三天(02→04b→05→08→10→11→14→附录C);完整三到四周。⭐唯一带字母后缀的章是 04b XGBoost 的推导(52 分钟,和第 4 章一样长)——第 4 章停在「新树拟合负梯度」,而负梯度只给方向不给步长,04b 用二阶泰勒把它写成有闭式解的目标函数;🎁只想调参可以先跳过,随时回来补。从哪开始:正常从第 1 章起(十分钟出结果);⭐只有一个下午就直接读第 5 章,跑那个纯噪声数据也能跑出 76.5% 准确率的实验。四条规则:①公式看不懂就看💡人话翻译 ②⭐代码必须跑——说得出结论却说不出"我跑出来是多少"就是没学(比如那个 100% 对 91.8%)③别追求一次全懂,⚠️卡在第 8 章两小时最后放弃整套是最典型的死法 ④检查点先自己答。ADHD 四建议:一次只开一章、用🛑断点停、回来先读⚡走神救援、永远别从头读、⚠️卡住超 25 分钟就跳过(卡死是最大的时间黑洞)。

👉 01-10分钟训练你的第一个模型.md

打卡记录保存在你的浏览器里,首页能看到总进度