📑 本页目录(点开跳转)
00 · 怎么用这份教程
⏱ 14 分钟
🎯 一句话
本库其他几套教的都是「怎么把模型训出来」。 这一套从模型训完的那一刻开始 —— 因为在真实工作里,训练只占你时间的两成,剩下八成都在这一套里。
🧩 它和其他几套的分工
其他教程停在「模型训好了」,这套从那一刻接手:
- 灰度与回滚
- 训练/推理一致性
- 三层监控
- 数据与概念漂移
- 无标签退化检测
- 特征重要性的坑
- SHAP
- 线上根因排查
- A/B 深水区
- 观察性因果推断
- 重训练策略
- 模型卡与审计
🕐 为什么说「训练只占两成」
关键信息
- 一个模型的一生:
- 想清楚要解什么问题 其他教程讲了
- 搞数据、做特征 其他教程讲了
- 训练、调参 其他教程讲了 ← 大部分教程到这就结束了
- 上线:灰度、影子、回滚 ⭐ 本教程
- 监控:它还活着吗 ⭐ 本教程
- 排查:为什么今天不对劲 ⭐ 本教程
- 证明:这个提升真是我带来的吗 ⭐ 本教程
- 重训:什么时候该重新训 ⭐ 本教程
- 下线:怎么安全地退役 ⭐ 本教程
- ⭐ 上面那三条你可能做几周;下面这六条要做【几年】
🎭 这一套的思维方式,和训练时完全不同
| 训练时 | 上线后 | |
|---|---|---|
| 数据 | 固定的、干净的 | 一直在变,而且没人通知你 ⭐ |
| 反馈 | 立刻有指标 | 标签可能几周后才来 ⭐ |
| 失败 | loss 不降,一眼看见 | 静默的:不报错,只是慢慢变差 💀 |
| 成功标准 | 测试集分数 | 业务指标,且要证明是你造成的 ⭐ |
| 能重来吗 | 能,重训一次就行 | 不能,用户已经看到了那个结果 |
🔑 最关键的是第三行: 训练时的 bug 会报错,上线后的问题往往不报错。 一个把特征算错的模型照样能返回结果、照样有正常的 QPS 和延迟 —— 它只是答案变差了。这就是为什么监控和归因是这一套的核心。
⚠️ 三条阅读规则
① 这套教程假设你已经会训模型
不讲算法、不讲调参。如果你还不会训模型,先去机器学习与深度学习基础。
② 每章都有「真实事故」
因为这一套里的规矩(要做影子流量、要监控特征分布、不能只看均值)单独看全是麻烦事, 只有知道不做会死在哪,才不用背。
③ 可以按需跳读
和其他几套不同,这套教程的章节耦合度低。 遇到具体问题时,直接跳到对应那章即可 —— 每章开头的 ⏱ 徽章告诉你要花多久, 🎯 一句话直接给出这一章的结论,30 秒就能判断是不是你要找的那一章。 按问题找章的入口有两个:本章开头那张「它和其他几套的分工」对照表, 以及下面的「⏱️ 四种读法」。
🗺️ 教程结构(21 章 + 附录)
坐标系
- 00 怎么用 01 训练完才是开始
放出去
- 02 离线好≠线上好 03 灰度影子回滚 04 训练/推理一致性 ⭐
看得见
- 05 该监控什么 06 数据与概念漂移
- 07 没标签怎么发现退化 ⭐ 08 告警为什么没人看
说得清
- 09 特征重要性的三种谎言 ⭐ 10 SHAP 能与不能
- 11 从告警到根因 ⭐
证得了
- 12 A/B 你以为你懂了 13 不能做 A/B 时 ⭐
- 14 辛普森悖论与七个陷阱 15 长期效应与代理指标
活得久
- 16 重训练 17 版本回溯与可复现 18 成本与容量
- 19 合规审计与模型卡
动手
- 20 实战与挑战项目
随时查
- 附录A 速查
三章是高光:
| 章节 | 为什么 |
|---|---|
| ⭐ 第 4 章 训练/推理一致性 | 线上掉点最常见也最难查的一类原因 —— 它不报错,只是悄悄变差 |
| ⭐ 第 7 章 没标签怎么发现退化 | 标签要等几周甚至几个月,这期间你靠什么判断模型还活着 |
| ⭐ 第 13 章 不能做 A/B 时 | 没有实验条件时,怎么从观察数据得出可信的因果结论 |
⏱️ 四种读法
| 你的情况 | 路线 | 时间 |
|---|---|---|
| 模型刚要上线,怕出事 | 02 → 03 → 04 → 05 | 2.5 小时 |
| 线上已经出问题了 | 11 → 06 → 09 → 04 | 3 小时 |
| 要向老板证明效果 | 12 → 13 → 14 → 15 | 3 小时 |
| 完整打牢 | 全部顺读 | 1–2 周 |
💡 如果只有一小时:读 04 和 07。 一个是最常见的事故源,一个是最容易被忽略的盲区 —— 这两件事挡住了大部分线上翻车。
🔗 它在整个学习地图里的位置
关键信息
- 《数据这一关》 ⭐ 姊妹篇:模型【之前】的那一半
- (那套管训之前的数据,这套管训完之后的模型)
- 《机器学习与深度学习基础》 怎么训出来(先有这个)
- → 《推荐算法》/《Kaggle》 把它训好
- 《模型上线之后》 你在这里:训好之后的那几年
- → 对应到具体场景:
- 推荐算法 12/15、智能体工程 16、全景导论 13
| 去哪 | 为什么 |
|---|---|
| 《数据这一关》00 | ⭐ 姊妹篇,成对设计:那套讲「数据进模型之前」出的事,这套讲「模型上线之后」出的事,中间夹着的才是大部分教程讲的东西。两边各有一处直接接口 —— 数据 17 版本与血缘↔本套 17,数据 18 特征存储↔本套 04 |
✅ 检查点
- 这套教程和其他几套的分工是什么?
- 「训练只占两成」指的是什么?
- 训练时和上线后,思维方式最关键的差别是哪一条?
- 为什么这套教程每章都要写真实事故?
- 只有一小时该读哪两章?为什么是这两章?
👀 答案
- 其他几套教「怎么把模型训出来」,这套从模型训完那一刻开始:上线、监控、排查、效果证明、重训、下线。
- 想问题/搞数据/训练调参可能做几周,而上线后的监控、排查、证明、重训要做几年。
- 训练时的 bug 会报错,上线后的问题往往不报错——模型照样返回结果、QPS 和延迟都正常,只是答案悄悄变差了。失败是静默的。
- 因为这套里的规矩(影子流量、监控特征分布、不能只看均值)单独看全是麻烦事,知道不做会死在哪就不用背。
- 第 4 章(训练/推理一致性)和第 7 章(没标签怎么发现退化)。一个是最常见的事故源、一个是最容易被忽略的盲区,这两件事挡住大部分线上翻车。
🛑 开始
⚡ 走神救援
其他几套教的是「怎么把模型训出来」,⭐ 这套从模型训完的那一刻开始——因为真实工作里训练只占很小一部分时间,剩下大半都在这一套里。
⭐ 为什么占比这么悬殊:想问题、搞数据、训练调参你可能做几周;而上线回滚、监控、排查、证明效果、重训、下线这六件事要做几年。
⭐ 它还有一套姊妹篇:那套讲数据进模型之前出的事,这套讲模型上线之后出的事——两边在版本血缘和特征一致性上直接接口。
⭐⭐ 上线之后的思维方式是全换的:数据从「固定干净」变成「一直在变,而且没人通知你」;反馈从「立刻有指标」变成「标签可能几周后才来」;成功标准从测试集分数变成「业务指标,而且要证明是你造成的」;⚠️ 训练能重来,上线不能——用户已经看到那个结果了。
💀 最关键的是失败的形态变了:训练时的 bug 会报错,而上线后的问题往往不报错——一个把特征算错的模型照样返回结果、照样有正常的 QPS 和延迟,它只是答案变差了。⭐ 这就是为什么监控和归因是这一套的核心。
⚠️ 前置是「你已经会训模型」,这里不讲算法和调参。⭐ 每章都有真实事故,因为影子流量、监控特征分布这些规矩单独看全是麻烦事——知道不做会死在哪,才不用背。 章节之间耦合度低,可以按需跳读。
⭐ 只有一小时就读「训练推理一致性」和「没有标签怎么发现退化」——一个是最常见的事故源,一个是最容易被忽略的盲区。