🏠 总目录📚 本教程 00 · 怎么用这份教程
📑 本页目录(点开跳转)

00 · 怎么用这份教程

14 分钟


🎯 一句话

本库其他几套教的都是「怎么把模型训出来」。 这一套从模型训完的那一刻开始 —— 因为在真实工作里,训练只占你时间的两成,剩下八成都在这一套里。


🧩 它和其他几套的分工

其他教程停在「模型训好了」,这套从那一刻接手:

ML 基础 05
教你离线怎么评估
「上线后指标变了怎么办」
推荐算法 12
教你 A/B 怎么做
「不能做 A/B 时怎么办」
Kaggle 01
用特征重要性选特征
「它什么时候会骗你」
全景导论 13
LLMOps 讲了个大概
「通用的监控与归因方法」
这一层就是本教程要补的
  • 灰度与回滚
  • 训练/推理一致性
  • 三层监控
  • 数据与概念漂移
  • 无标签退化检测
  • 特征重要性的坑
  • SHAP
  • 线上根因排查
  • A/B 深水区
  • 观察性因果推断
  • 重训练策略
  • 模型卡与审计

🕐 为什么说「训练只占两成」

   一个模型的一生:

   ├─ 想清楚要解什么问题        ← 其他教程讲了
   ├─ 搞数据、做特征            ← 其他教程讲了
   ├─ 训练、调参                ← 其他教程讲了  ← 大部分教程到这就结束了
   │
   ├─ 上线:灰度、影子、回滚      ⭐ 本教程
   ├─ 监控:它还活着吗            ⭐ 本教程
   ├─ 排查:为什么今天不对劲       ⭐ 本教程
   ├─ 证明:这个提升真是我带来的吗  ⭐ 本教程
   ├─ 重训:什么时候该重新训       ⭐ 本教程
   └─ 下线:怎么安全地退役        ⭐ 本教程

   ⭐ 上面那三条你可能做几周;下面这六条要做【几年】

🎭 这一套的思维方式,和训练时完全不同

训练时 上线后
数据 固定的、干净的 一直在变,而且没人通知你
反馈 立刻有指标 标签可能几周后才来 ⭐⭐
失败 loss 不降,一眼看见 静默的:不报错,只是慢慢变差 💀
成功标准 测试集分数 业务指标,且要证明是你造成的
能重来吗 能,重训一次就行 不能,用户已经看到了那个结果

🔑 最关键的是第三行训练时的 bug 会报错,上线后的问题往往不报错。 一个把特征算错的模型照样能返回结果、照样有正常的 QPS 和延迟 —— 它只是答案变差了这就是为什么监控和归因是这一套的核心。


⚠️ 三条阅读规则

① 这套教程假设你已经会训模型

不讲算法、不讲调参。如果你还不会训模型,先去机器学习与深度学习基础

② 每章都有「真实事故」

因为这一套里的规矩(要做影子流量、要监控特征分布、不能只看均值)单独看全是麻烦事, 只有知道不做会死在哪,才不用背。

③ 可以按需跳读

和其他几套不同,这套教程的章节耦合度低。 遇到具体问题时,直接跳到对应那章即可 —— 每章开头的 ⏱ 徽章告诉你要花多久, 🎯 一句话直接给出这一章的结论,30 秒就能判断是不是你要找的那一章。 按问题找章的入口有两个:本章开头那张「它和其他几套的分工」对照表, 以及下面的「⏱️ 四种读法」。


🗺️ 教程结构(21 章 + 附录)

  【坐标系】   00 怎么用   01 训练完才是开始
  【放出去】   02 离线好≠线上好   03 灰度影子回滚   04 训练/推理一致性 ⭐
  【看得见】   05 该监控什么   06 数据与概念漂移
              07 没标签怎么发现退化 ⭐⭐   08 告警为什么没人看
  【说得清】   09 特征重要性的三种谎言 ⭐   10 SHAP 能与不能
              11 从告警到根因 ⭐
  【证得了】   12 A/B 你以为你懂了   13 不能做 A/B 时 ⭐⭐
              14 辛普森悖论与七个陷阱   15 长期效应与代理指标
  【活得久】   16 重训练   17 版本回溯与可复现   18 成本与容量
              19 合规审计与模型卡
  【动手】     20 实战与挑战项目
  【随时查】   附录A 速查

三章是高光

章节 为什么
第 4 章 训练/推理一致性 线上掉点最常见也最难查的一类原因 —— 它不报错,只是悄悄变差
⭐⭐ 第 7 章 没标签怎么发现退化 标签要等几周甚至几个月,这期间你靠什么判断模型还活着
⭐⭐ 第 13 章 不能做 A/B 时 没有实验条件时,怎么从观察数据得出可信的因果结论

⏱️ 四种读法

你的情况 路线 时间
模型刚要上线,怕出事 02 → 03 → 04 → 05 2 小时
线上已经出问题了 11 → 06 → 09 → 04 1.5 小时
要向老板证明效果 12 → 13 → 14 → 15 2 小时
完整打牢 全部顺读 1–2 周

💡 如果只有一小时:读 0407一个是最常见的事故源,一个是最容易被忽略的盲区 —— 这两件事挡住了大部分线上翻车。


🔗 它在整个学习地图里的位置

   《数据这一关》 ← ⭐ 姊妹篇:模型【之前】的那一半
              │      (那套管训之前的数据,这套管训完之后的模型)
              ▼
   《机器学习与深度学习基础》 ← 怎么训出来(先有这个)
              │
              ├──→ 《推荐算法》/《Kaggle》 ← 把它训好
              │
              ▼
   《模型上线之后》 ← 你在这里:训好之后的那几年
              │
              └──→ 对应到具体场景:
                   推荐算法 12/15、智能体工程 16、全景导论 13
去哪 为什么
《数据这一关》00 ⭐⭐ 姊妹篇,成对设计:那套讲「数据进模型之前」出的事,这套讲「模型上线之后」出的事,中间夹着的才是大部分教程讲的东西。两边各有一处直接接口 —— 数据 17 版本与血缘本套 17数据 18 特征存储本套 04

✅ 检查点

  1. 这套教程和其他几套的分工是什么?
  2. 「训练只占两成」指的是什么?
  3. 训练时和上线后,思维方式最关键的差别是哪一条?
  4. 为什么这套教程每章都要写真实事故?
  5. 只有一小时该读哪两章?为什么是这两章?
👀 答案
  1. 其他几套教「怎么把模型训出来」,这套从模型训完那一刻开始:上线、监控、排查、效果证明、重训、下线。
  2. 想问题/搞数据/训练调参可能做几周,而上线后的监控、排查、证明、重训要做几年
  3. 训练时的 bug 会报错,上线后的问题往往不报错——模型照样返回结果、QPS 和延迟都正常,只是答案悄悄变差了。失败是静默的。
  4. 因为这套里的规矩(影子流量、监控特征分布、不能只看均值)单独看全是麻烦事,知道不做会死在哪就不用背。
  5. 第 4 章(训练/推理一致性)和第 7 章(没标签怎么发现退化)。一个是最常见的事故源、一个是最容易被忽略的盲区,这两件事挡住大部分线上翻车。

🛑 开始

走神救援

其他几套教的都是「怎么把模型训出来」这套从模型训完的那一刻开始——因为在真实工作里训练只占你时间的两成,剩下八成都在这一套里分工:ML 基础教你离线怎么评估,不管"上线后指标变了怎么办";推荐算法教你 A/B 怎么做,不管"不能做 A/B 时怎么办"。⭐还有一套姊妹篇《数据这一关》——那套讲数据进模型之前出的事,这套讲模型上线之后出的事,两边在版本血缘(数据 17 ↔ 本套 17)和特征一致性(数据 18 ↔ 本套 04)上直接接口。⭐为什么是两成:想问题、搞数据、训练调参你可能做几周;而上线回滚、监控、排查、证明效果、重训、下线这六件事要做几年。⭐⭐上线后的思维方式完全不同:数据从"固定干净"变成"一直在变而且没人通知你";反馈从"立刻有指标"变成"标签可能几周后才来";成功标准从测试集分数变成"业务指标,且要证明是你造成的";训练能重来,上线后不能,用户已经看到了那个结果。💀最关键的是失败的形态变了:训练时的 bug 会报错,上线后的问题往往不报错——一个把特征算错的模型照样返回结果、照样有正常的 QPS 和延迟,它只是答案变差了这就是为什么监控和归因是这一套的核心。⚠️前置:假设你已经会训模型,不讲算法与调参。每章都有真实事故,因为影子流量、监控特征分布这些规矩单独看全是麻烦事,知道不做会死在哪才不用背;⭐章节耦合度低,可以按需跳读。三个高光:⭐04 训练/推理一致性(最常见也最难查,它不报错,只是悄悄变差)、⭐⭐07 没标签怎么发现退化(标签要等几周,这期间你靠什么判断模型还活着)、⭐⭐13 不能做 A/B 时四种读法刚要上线怕出事走 02→03→04→05;线上已经出问题走 11→06→09→04;要证明效果走 12→13→14→15。⭐只有一小时就读 04 和 07——一个是最常见的事故源,一个是最容易被忽略的盲区。

👉 01-训练完才是开始.md

打卡记录保存在你的浏览器里,首页能看到总进度