📑 本页目录(点开跳转)
00 · 怎么用这份教程
⏱ 14 分钟
🎯 一句话
本库其他几套教的都是「怎么把模型训出来」。 这一套从模型训完的那一刻开始 —— 因为在真实工作里,训练只占你时间的两成,剩下八成都在这一套里。
🧩 它和其他几套的分工
其他教程停在「模型训好了」,这套从那一刻接手:
- 灰度与回滚
- 训练/推理一致性
- 三层监控
- 数据与概念漂移
- 无标签退化检测
- 特征重要性的坑
- SHAP
- 线上根因排查
- A/B 深水区
- 观察性因果推断
- 重训练策略
- 模型卡与审计
🕐 为什么说「训练只占两成」
一个模型的一生:
├─ 想清楚要解什么问题 ← 其他教程讲了
├─ 搞数据、做特征 ← 其他教程讲了
├─ 训练、调参 ← 其他教程讲了 ← 大部分教程到这就结束了
│
├─ 上线:灰度、影子、回滚 ⭐ 本教程
├─ 监控:它还活着吗 ⭐ 本教程
├─ 排查:为什么今天不对劲 ⭐ 本教程
├─ 证明:这个提升真是我带来的吗 ⭐ 本教程
├─ 重训:什么时候该重新训 ⭐ 本教程
└─ 下线:怎么安全地退役 ⭐ 本教程
⭐ 上面那三条你可能做几周;下面这六条要做【几年】
🎭 这一套的思维方式,和训练时完全不同
| 训练时 | 上线后 | |
|---|---|---|
| 数据 | 固定的、干净的 | 一直在变,而且没人通知你 ⭐ |
| 反馈 | 立刻有指标 | 标签可能几周后才来 ⭐⭐ |
| 失败 | loss 不降,一眼看见 | 静默的:不报错,只是慢慢变差 💀 |
| 成功标准 | 测试集分数 | 业务指标,且要证明是你造成的 ⭐ |
| 能重来吗 | 能,重训一次就行 | 不能,用户已经看到了那个结果 |
🔑 最关键的是第三行: 训练时的 bug 会报错,上线后的问题往往不报错。 一个把特征算错的模型照样能返回结果、照样有正常的 QPS 和延迟 —— 它只是答案变差了。这就是为什么监控和归因是这一套的核心。
⚠️ 三条阅读规则
① 这套教程假设你已经会训模型
不讲算法、不讲调参。如果你还不会训模型,先去机器学习与深度学习基础。
② 每章都有「真实事故」
因为这一套里的规矩(要做影子流量、要监控特征分布、不能只看均值)单独看全是麻烦事, 只有知道不做会死在哪,才不用背。
③ 可以按需跳读
和其他几套不同,这套教程的章节耦合度低。 遇到具体问题时,直接跳到对应那章即可 —— 每章开头的 ⏱ 徽章告诉你要花多久, 🎯 一句话直接给出这一章的结论,30 秒就能判断是不是你要找的那一章。 按问题找章的入口有两个:本章开头那张「它和其他几套的分工」对照表, 以及下面的「⏱️ 四种读法」。
🗺️ 教程结构(21 章 + 附录)
【坐标系】 00 怎么用 01 训练完才是开始
【放出去】 02 离线好≠线上好 03 灰度影子回滚 04 训练/推理一致性 ⭐
【看得见】 05 该监控什么 06 数据与概念漂移
07 没标签怎么发现退化 ⭐⭐ 08 告警为什么没人看
【说得清】 09 特征重要性的三种谎言 ⭐ 10 SHAP 能与不能
11 从告警到根因 ⭐
【证得了】 12 A/B 你以为你懂了 13 不能做 A/B 时 ⭐⭐
14 辛普森悖论与七个陷阱 15 长期效应与代理指标
【活得久】 16 重训练 17 版本回溯与可复现 18 成本与容量
19 合规审计与模型卡
【动手】 20 实战与挑战项目
【随时查】 附录A 速查
三章是高光:
| 章节 | 为什么 |
|---|---|
| ⭐ 第 4 章 训练/推理一致性 | 线上掉点最常见也最难查的一类原因 —— 它不报错,只是悄悄变差 |
| ⭐⭐ 第 7 章 没标签怎么发现退化 | 标签要等几周甚至几个月,这期间你靠什么判断模型还活着 |
| ⭐⭐ 第 13 章 不能做 A/B 时 | 没有实验条件时,怎么从观察数据得出可信的因果结论 |
⏱️ 四种读法
| 你的情况 | 路线 | 时间 |
|---|---|---|
| 模型刚要上线,怕出事 | 02 → 03 → 04 → 05 | 2 小时 |
| 线上已经出问题了 | 11 → 06 → 09 → 04 | 1.5 小时 |
| 要向老板证明效果 | 12 → 13 → 14 → 15 | 2 小时 |
| 完整打牢 | 全部顺读 | 1–2 周 |
💡 如果只有一小时:读 04 和 07。 一个是最常见的事故源,一个是最容易被忽略的盲区 —— 这两件事挡住了大部分线上翻车。
🔗 它在整个学习地图里的位置
《数据这一关》 ← ⭐ 姊妹篇:模型【之前】的那一半
│ (那套管训之前的数据,这套管训完之后的模型)
▼
《机器学习与深度学习基础》 ← 怎么训出来(先有这个)
│
├──→ 《推荐算法》/《Kaggle》 ← 把它训好
│
▼
《模型上线之后》 ← 你在这里:训好之后的那几年
│
└──→ 对应到具体场景:
推荐算法 12/15、智能体工程 16、全景导论 13
| 去哪 | 为什么 |
|---|---|
| 《数据这一关》00 | ⭐⭐ 姊妹篇,成对设计:那套讲「数据进模型之前」出的事,这套讲「模型上线之后」出的事,中间夹着的才是大部分教程讲的东西。两边各有一处直接接口 —— 数据 17 版本与血缘↔本套 17,数据 18 特征存储↔本套 04 |
✅ 检查点
- 这套教程和其他几套的分工是什么?
- 「训练只占两成」指的是什么?
- 训练时和上线后,思维方式最关键的差别是哪一条?
- 为什么这套教程每章都要写真实事故?
- 只有一小时该读哪两章?为什么是这两章?
👀 答案
- 其他几套教「怎么把模型训出来」,这套从模型训完那一刻开始:上线、监控、排查、效果证明、重训、下线。
- 想问题/搞数据/训练调参可能做几周,而上线后的监控、排查、证明、重训要做几年。
- 训练时的 bug 会报错,上线后的问题往往不报错——模型照样返回结果、QPS 和延迟都正常,只是答案悄悄变差了。失败是静默的。
- 因为这套里的规矩(影子流量、监控特征分布、不能只看均值)单独看全是麻烦事,知道不做会死在哪就不用背。
- 第 4 章(训练/推理一致性)和第 7 章(没标签怎么发现退化)。一个是最常见的事故源、一个是最容易被忽略的盲区,这两件事挡住大部分线上翻车。
🛑 开始
⚡ 走神救援
其他几套教的都是「怎么把模型训出来」,这套从模型训完的那一刻开始——因为在真实工作里训练只占你时间的两成,剩下八成都在这一套里。分工:ML 基础教你离线怎么评估,不管"上线后指标变了怎么办";推荐算法教你 A/B 怎么做,不管"不能做 A/B 时怎么办"。⭐还有一套姊妹篇《数据这一关》——那套讲数据进模型之前出的事,这套讲模型上线之后出的事,两边在版本血缘(数据 17 ↔ 本套 17)和特征一致性(数据 18 ↔ 本套 04)上直接接口。⭐为什么是两成:想问题、搞数据、训练调参你可能做几周;而上线回滚、监控、排查、证明效果、重训、下线这六件事要做几年。⭐⭐上线后的思维方式完全不同:数据从"固定干净"变成"一直在变而且没人通知你";反馈从"立刻有指标"变成"标签可能几周后才来";成功标准从测试集分数变成"业务指标,且要证明是你造成的";训练能重来,上线后不能,用户已经看到了那个结果。💀最关键的是失败的形态变了:训练时的 bug 会报错,上线后的问题往往不报错——一个把特征算错的模型照样返回结果、照样有正常的 QPS 和延迟,它只是答案变差了,这就是为什么监控和归因是这一套的核心。⚠️前置:假设你已经会训模型,不讲算法与调参。每章都有真实事故,因为影子流量、监控特征分布这些规矩单独看全是麻烦事,知道不做会死在哪才不用背;⭐章节耦合度低,可以按需跳读。三个高光:⭐04 训练/推理一致性(最常见也最难查,它不报错,只是悄悄变差)、⭐⭐07 没标签怎么发现退化(标签要等几周,这期间你靠什么判断模型还活着)、⭐⭐13 不能做 A/B 时。四种读法:刚要上线怕出事走 02→03→04→05;线上已经出问题走 11→06→09→04;要证明效果走 12→13→14→15。⭐只有一小时就读 04 和 07——一个是最常见的事故源,一个是最容易被忽略的盲区。