🏠 总目录📚 本教程 00 · 怎么用这份教程 →
📑 本页目录(点开跳转)

00 · 怎么用这份教程

⏱ 14 分钟


🎯 一句话

本库其他几套教的都是「怎么把模型训出来」。 这一套从模型训完的那一刻开始 —— 因为在真实工作里,训练只占你时间的两成,剩下八成都在这一套里。


🧩 它和其他几套的分工

其他教程停在「模型训好了」,这套从那一刻接手:

ML 基础 05
教你离线怎么评估
「上线后指标变了怎么办」
推荐算法 12
教你 A/B 怎么做
「不能做 A/B 时怎么办」
Kaggle 01
用特征重要性选特征
「它什么时候会骗你」
全景导论 13
LLMOps 讲了个大概
「通用的监控与归因方法」
⬇
这一层就是本教程要补的
  • 灰度与回滚
  • 训练/推理一致性
  • 三层监控
  • 数据与概念漂移
  • 无标签退化检测
  • 特征重要性的坑
  • SHAP
  • 线上根因排查
  • A/B 深水区
  • 观察性因果推断
  • 重训练策略
  • 模型卡与审计

🕐 为什么说「训练只占两成」

关键信息


🎭 这一套的思维方式,和训练时完全不同

训练时 上线后
数据 固定的、干净的 一直在变,而且没人通知你 ⭐
反馈 立刻有指标 标签可能几周后才来 ⭐
失败 loss 不降,一眼看见 静默的:不报错,只是慢慢变差 💀
成功标准 测试集分数 业务指标,且要证明是你造成的 ⭐
能重来吗 能,重训一次就行 不能,用户已经看到了那个结果

🔑 最关键的是第三行: 训练时的 bug 会报错,上线后的问题往往不报错。 一个把特征算错的模型照样能返回结果、照样有正常的 QPS 和延迟 —— 它只是答案变差了。这就是为什么监控和归因是这一套的核心。


⚠️ 三条阅读规则

① 这套教程假设你已经会训模型

不讲算法、不讲调参。如果你还不会训模型,先去机器学习与深度学习基础。

② 每章都有「真实事故」

因为这一套里的规矩(要做影子流量、要监控特征分布、不能只看均值)单独看全是麻烦事, 只有知道不做会死在哪,才不用背。

③ 可以按需跳读

和其他几套不同,这套教程的章节耦合度低。 遇到具体问题时,直接跳到对应那章即可 —— 每章开头的 ⏱ 徽章告诉你要花多久, 🎯 一句话直接给出这一章的结论,30 秒就能判断是不是你要找的那一章。 按问题找章的入口有两个:本章开头那张「它和其他几套的分工」对照表, 以及下面的「⏱️ 四种读法」。


🗺️ 教程结构(21 章 + 附录)

坐标系

  • 00 怎么用 01 训练完才是开始

放出去

  • 02 离线好≠线上好 03 灰度影子回滚 04 训练/推理一致性 ⭐

看得见

  • 05 该监控什么 06 数据与概念漂移
  • 07 没标签怎么发现退化 ⭐ 08 告警为什么没人看

说得清

  • 09 特征重要性的三种谎言 ⭐ 10 SHAP 能与不能
  • 11 从告警到根因 ⭐

证得了

  • 12 A/B 你以为你懂了 13 不能做 A/B 时 ⭐
  • 14 辛普森悖论与七个陷阱 15 长期效应与代理指标

活得久

  • 16 重训练 17 版本回溯与可复现 18 成本与容量
  • 19 合规审计与模型卡

动手

  • 20 实战与挑战项目

随时查

  • 附录A 速查

三章是高光:

章节 为什么
⭐ 第 4 章 训练/推理一致性 线上掉点最常见也最难查的一类原因 —— 它不报错,只是悄悄变差
⭐ 第 7 章 没标签怎么发现退化 标签要等几周甚至几个月,这期间你靠什么判断模型还活着
⭐ 第 13 章 不能做 A/B 时 没有实验条件时,怎么从观察数据得出可信的因果结论

⏱️ 四种读法

你的情况 路线 时间
模型刚要上线,怕出事 02 → 03 → 04 → 05 2.5 小时
线上已经出问题了 11 → 06 → 09 → 04 3 小时
要向老板证明效果 12 → 13 → 14 → 15 3 小时
完整打牢 全部顺读 1–2 周

💡 如果只有一小时:读 04 和 07。 一个是最常见的事故源,一个是最容易被忽略的盲区 —— 这两件事挡住了大部分线上翻车。


🔗 它在整个学习地图里的位置

关键信息

去哪 为什么
《数据这一关》00 ⭐ 姊妹篇,成对设计:那套讲「数据进模型之前」出的事,这套讲「模型上线之后」出的事,中间夹着的才是大部分教程讲的东西。两边各有一处直接接口 —— 数据 17 版本与血缘↔本套 17,数据 18 特征存储↔本套 04

✅ 检查点

  1. 这套教程和其他几套的分工是什么?
  2. 「训练只占两成」指的是什么?
  3. 训练时和上线后,思维方式最关键的差别是哪一条?
  4. 为什么这套教程每章都要写真实事故?
  5. 只有一小时该读哪两章?为什么是这两章?
👀 答案
  1. 其他几套教「怎么把模型训出来」,这套从模型训完那一刻开始:上线、监控、排查、效果证明、重训、下线。
  2. 想问题/搞数据/训练调参可能做几周,而上线后的监控、排查、证明、重训要做几年。
  3. 训练时的 bug 会报错,上线后的问题往往不报错——模型照样返回结果、QPS 和延迟都正常,只是答案悄悄变差了。失败是静默的。
  4. 因为这套里的规矩(影子流量、监控特征分布、不能只看均值)单独看全是麻烦事,知道不做会死在哪就不用背。
  5. 第 4 章(训练/推理一致性)和第 7 章(没标签怎么发现退化)。一个是最常见的事故源、一个是最容易被忽略的盲区,这两件事挡住大部分线上翻车。

🛑 开始

⚡ 走神救援

其他几套教的是「怎么把模型训出来」,⭐ 这套从模型训完的那一刻开始——因为真实工作里训练只占很小一部分时间,剩下大半都在这一套里。

⭐ 为什么占比这么悬殊:想问题、搞数据、训练调参你可能做几周;而上线回滚、监控、排查、证明效果、重训、下线这六件事要做几年。

⭐ 它还有一套姊妹篇:那套讲数据进模型之前出的事,这套讲模型上线之后出的事——两边在版本血缘和特征一致性上直接接口。

⭐⭐ 上线之后的思维方式是全换的:数据从「固定干净」变成「一直在变,而且没人通知你」;反馈从「立刻有指标」变成「标签可能几周后才来」;成功标准从测试集分数变成「业务指标,而且要证明是你造成的」;⚠️ 训练能重来,上线不能——用户已经看到那个结果了。

💀 最关键的是失败的形态变了:训练时的 bug 会报错,而上线后的问题往往不报错——一个把特征算错的模型照样返回结果、照样有正常的 QPS 和延迟,它只是答案变差了。⭐ 这就是为什么监控和归因是这一套的核心。

⚠️ 前置是「你已经会训模型」,这里不讲算法和调参。⭐ 每章都有真实事故,因为影子流量、监控特征分布这些规矩单独看全是麻烦事——知道不做会死在哪,才不用背。 章节之间耦合度低,可以按需跳读。

⭐ 只有一小时就读「训练推理一致性」和「没有标签怎么发现退化」——一个是最常见的事故源,一个是最容易被忽略的盲区。

👉 01-训练完才是开始.md

打卡记录保存在你的浏览器里,首页能看到总进度