🏠 总目录 模型上线之后 · 机器学习生命周期缺掉的那一半

模型上线之后

机器学习生命周期缺掉的那一半。

本库其他几套教的都是「怎么把模型训出来」—— 这一套从模型训完的那一刻开始:怎么安全放出去、怎么知道它还活着、 出问题怎么定位、以及怎么证明「这个提升真的是你带来的」。

🚀 训练完才是开始 🕵️ 直接看最扎心的一章
0%
你的进度(在每章末尾点「打卡」,保存在本浏览器里)

🧩 它和其他几套的分工

其他教程停在「模型训好了」,这套从那一刻接手:

ML 基础 05
教你离线怎么评估
「上线后指标变了怎么办」
推荐算法 12
教你 A/B 怎么做
「不能做 A/B 时怎么办」
Kaggle 01
用特征重要性选特征
「它什么时候会骗你」
全景导论 13
LLMOps 讲了个大概
「通用的监控与归因方法」
这一层就是本教程要补的
  • 灰度与回滚
  • 训练/推理一致性
  • 三层监控
  • 数据与概念漂移
  • 无标签退化检测
  • 特征重要性的坑
  • SHAP
  • 线上根因排查
  • A/B 深水区
  • 观察性因果推断
  • 重训练策略
  • 模型卡与审计

⭐ 三章是高光

第 4 章 · 训练/推理一致性
线上掉点最常见、也最难查的一类原因 —— 它不报错,只是悄悄变差。
第 7 章 · 没有标签怎么发现退化
真实世界里标签常常要等几周甚至几个月。这段时间你靠什么判断模型还活着?
第 13 章 · 不能做 A/B 时
没有实验条件时,怎么从观察数据里得出可信的因果结论。

阶段 0 · 先看清问题两章,30 分钟,搞清「生命周期的另一半」到底有什么

阶段 1 · 放出去⭐ 第 4 章那个 bug 是全站最贵的一类

阶段 2 · 看得见⭐⭐ 第 7 章:标签要等三个月,这期间你怎么知道模型坏了

阶段 3 · 说得清⭐ 全站 39 页在用「特征重要性」,这里讲它什么时候会骗你

阶段 4 · 证得了⭐⭐ 怎么证明「这个提升真的是我带来的」

阶段 5 · 活得久重训练、回溯、成本、合规 —— 让它能一直跑下去

阶段 6 · 动手四个项目,从造一次漂移到复现辛普森悖论

随时查指标、阈值、排查清单