🏠 总目录📚 本教程 怎么用
📑 本页目录(点开跳转)

00 · 怎么用这份教程

24 分钟


🎯 一句话

其他几套教程都从「给定一份数据」开始,这一套讲那之前发生的事。

它和《模型上线之后》是一对: 那一套说「所有教程停在模型训完,事故全在之后」; 这一套说「事故有一大半在数据进模型之前」。


📊 一、为什么要单独开这一套

这不是拍脑袋加的板块。开它之前先数了一遍全站:

   全站提及「标注 / 数据质量 / 脏数据 / 缺失 / 泄漏」的页面:  39 页
   这些词在正文里的总命中次数:                              161 次

   而【专门】讲这件事的页面,只有 1 页:
     Kaggle竞赛方法论 / 01_数据策略与特征工程
     —— 而且是【竞赛视角】:数据已经给你了,你只能做特征

   ⭐ 结论:161 次提及,0 个系统讲法。
      每套教程都在说「数据很重要」,然后立刻跳过它。

「39 页提到、1 页专讲」是一个典型信号: 说明这件事重要到躲不开,但又没重要到有人愿意专门写。 因为它不酷 —— 没有公式、没有架构图、没有 SOTA, 只有一堆看起来很蠢但每年都在发生的事故。


🧩 二、它和其他十个板块的分工

板块 它教你的 它默认已经有的(= 本套要补的)
机器学习与深度学习基础 怎么训出一个模型 训练集是干净的、标签是对的
机器学习的数学原理 为什么这么训是对的 样本 i.i.d.、分布不变
Kaggle 竞赛方法论 给定数据怎么榨干它 数据是主办方给的,不用你造
推荐算法 排序模型怎么做 曝光/点击日志天然存在且口径稳定
大模型全景导论 大模型怎么训、怎么用 语料从哪来、去没去重、有没有污染评测集
智能体工程教程 Agent 怎么搭 评测集是谁写的、覆盖了什么
AI 基础设施 数据管线怎么跑得快 管线里流的是什么、对不对
强化学习基础 从交互中学 环境/奖励信号是可信的
模型上线之后 训完之后的几年 训之前的那几个月
密码学与信息安全 数据怎么保密 数据怎么才算「对」

🔑 一句话概括这张表: 别的板块都在解「给定 D,求 f」; 这一套解的是「D 从哪来、D 是不是你以为的那个 D」。


🕐 三、真实项目里的时间都花在哪

   一个从零到上线的模型项目(14 周)的真实工时分布:

   ├─ 想清楚要解什么问题 ............  5 天
   ├─ 找数据 / 要权限 / 对口径 ......  18 天   ⭐ 本教程
   ├─ 清洗 / 修脏数据 ...............  11 天   ⭐ 本教程
   ├─ 设计标注体系 / 标 / 返工 ......  16 天   ⭐ 本教程
   ├─ 建评测集 / 查泄漏 .............   6 天   ⭐ 本教程
   ├─ 特征工程 ......................   9 天
   ├─ 模型选型 + 调参 ...............   4 天   ← 大部分教程只讲这 4 天
   └─ 上线 / 监控 / 复盘 ............  该做几年(另一套教程)

   ⭐ 数据相关:51 天 / 69 天 = 74%
   ⭐ 模型相关:4 天  / 69 天 = 6%

💀 最反直觉的一条: 在这 14 周里,模型选型只花了 4 天,而且第 1 天就基本定了 —— 剩下 3 天是在调一个已经决定要用的东西。 可数据这条线,磨了三个多月。


🎭 四、这一套的思维方式和建模时不一样

建模时 搞数据时
目标 指标高一点 指标是真的
好消息 AUC 涨了 = 好事 AUC 突然涨了 = 先怀疑泄漏 ⭐⭐
失败长什么样 loss 不降,一眼看见 一切正常,只是结论是错的 💀
谁能验收 测试集 只有业务能验收「这个口径对不对」
主要工作 写代码 对齐口径、追人、写契约 ⚠️
可以重来吗 能,重训一次 标注返工要重新排期和花钱

第二行是整套教程的核心态度: 建模时「指标涨了」是好消息; 搞数据时「指标涨了」首先是一个待排查的异常。 本套里至少有五个章节,讲的都是「某个虚高指标背后的真相」。


🗺️ 五、教程结构(21 章 + 附录 A)

  【阶段0 先看清】 00 怎么用   01 数据才是那个瓶颈
                  02 一份数据集是怎么来的   03 数据契约 ⭐

  【阶段1 质量】   04 脏数据的十种形态   05 缺失不是一种东西 ⭐⭐
                  06 重复与实体解析   07 异常值是错还是真
                  08 数据质量怎么量

  【阶段2 标注】   09 标注体系怎么设计   10 标注一致性怎么量 ⭐
                  11 标签噪声   12 标注预算与主动学习

  【阶段3 评测与泄漏】 13 评测集也是数据
                  14 数据泄漏的七种来源 ⭐⭐
                  15 采样偏差与幸存者偏差   16 合成数据

  【阶段4 工程治理】 17 数据版本与血缘   18 特征存储   19 隐私脱敏与留存

  【阶段5 动手】   20 实战与挑战项目        【随时查】附录A 速查

三章是高光

章节 为什么
⭐⭐ 第 5 章 缺失不是一种东西 缺失有三种成因,用错填法会把偏差直接喂进模型,而离线指标完全正常
⭐⭐ 第 14 章 数据泄漏的七种来源 线下 0.96 线上 0.72 的绝大多数解释都在这一章
第 3 章 数据契约 「上游改字段没人告诉你」是常态,契约是唯一能把它变成会失败的测试的东西

⏱️ 六、四种读法

你的情况 路线 时间
刚接手一份陌生数据 02 → 04 → 05 → 06 → 08 3 小时
离线好线上差 / 指标不可信 14 → 13 → 06 → 15 2.5 小时
要从零建一个标注项目 09 → 10 → 11 → 12 3 小时
在搭数据平台 / 要立规矩 03 → 17 → 18 → 19 2.5 小时
完整打牢 全部顺读 1–2 周

💡 如果只有一小时:读 0514一个是最容易悄悄注入偏差的地方,一个是最容易制造虚假指标的地方 —— 这两件事加起来,能解释你见过的大部分「说不清为什么」的模型问题。


🎒 七、需要什么前置

   必须有的:
   ├─ 会写 Python + pandas(groupby / merge / value_counts 级别)
   └─ 知道什么叫训练集/验证集、什么叫过拟合
        → 没有的话先去《机器学习与深度学习基础》01–05

   最好有的(没有也能读,只是共鸣少一点):
   ├─ 写过 SQL、见过一张真实的业务表
   └─ 参与过一次「指标对不上」的撕扯 ⭐

   不需要的:
   ├─ 深度学习 / Transformer
   ├─ 分布式与大数据框架
   └─ 数学推导 —— 只有少数几章会出现式子(13 章最多),
                    每一处都配了人话翻译和可跑代码

⚠️ 一条反向建议: 如果你从没做过一个真项目,这套教程会显得啰嗦且悲观。 那就先跳到 第 1 章 看那个事故, 看完还觉得夸张的话,就先别读,等你踩到第一个坑再回来 ——那时它会非常好读。


🔗 这一章连到哪里

去哪 为什么
《模型上线之后》00 姊妹篇。那套管「训完之后」,这套管「训之前」,中间夹着的才是大部分教程讲的东西
Kaggle 01 数据策略与特征工程 全站唯一一页专讲数据的,竞赛视角:数据已给定。读完可以对比「工业视角」差在哪
ML 基础 00 怎么用这份教程 本套的前置。先会训模型,再来讨论数据对不对
AI 基础设施 22 数据管线与存储 那边讲管线怎么跑得快,这边讲管线里流的东西对不对

✅ 检查点

  1. 这套教程和其他十个板块的分工,用一句话怎么说?
  2. 立项的量化依据是什么?三个数字分别是多少?
  3. 那个 14 周项目里,数据相关和模型相关各占多少天、多少比例?最反直觉的是哪一条?
  4. 建模时和搞数据时,对「指标涨了」的态度有什么关键差别?
  5. 本套的三个高光章节是哪三章,各自解决什么?
  6. 「离线好线上差」应该走哪条读法路线?只有一小时该读哪两章?
  7. 读这套教程必须有什么前置?什么是不需要的?
👀 答案
  1. 其他板块解「给定 D,求 f」,这一套解「D 从哪来、D 是不是你以为的那个 D」。它是《模型上线之后》的姊妹篇:那套讲训完之后,这套讲训之前。
  2. 全站 39 页提及数据质量/标注相关内容,正文总命中 161 次,但专门讲它的只有 1 页(Kaggle 01),而且是竞赛视角(数据已给定)。
  3. 数据相关 51 天 / 69 天 = 74%,模型相关 4 天 / 69 天 = 6%。最反直觉的是:模型选型第 1 天就基本定了,剩下 3 天只是调一个已决定的东西,而数据线磨了三个多月。
  4. 建模时「AUC 涨了」是好消息;搞数据时「AUC 突然涨了」首先是一个待排查的异常(先怀疑泄漏)。另一条差别:建模失败会报错(loss 不降),数据出问题往往一切正常、只是结论是错的
  5. ⭐⭐ 第 5 章缺失(三种成因,填错把偏差喂进模型而离线指标正常)、⭐⭐ 第 14 章泄漏(线下 0.96 线上 0.72 的主要解释)、⭐ 第 3 章数据契约(把「上游改字段没人告诉你」变成会失败的测试)。
  6. 14 → 13 → 06 → 15(约 2.5 小时)。只有一小时就读 05 + 14:一个是最容易悄悄注入偏差的地方,一个是最容易制造虚假指标的地方。
  7. 必须:Python + pandas、知道训练/验证集与过拟合。不需要:深度学习、分布式框架、数学推导(只有少数几章出现式子,13 章最多,每一处都配了人话翻译和可跑代码)。

🛑 开始

走神救援

定位:其他教程从「给定一份数据」开始,这一套讲那之前发生的事。 它是《模型上线之后》的姊妹篇——那套说「教程都停在模型训完,事故全在之后」,这套说「事故有一大半在数据进模型之前」。⭐立项依据是数出来的:全站 39 页提到标注/数据质量、正文命中 161 次,但专门讲它的只有 1 页(Kaggle 01),还是竞赛视角(数据主办方给你)。⭐分工一句话:别的板块解「给定 D 求 f」,这套解「D 从哪来、D 是不是你以为的那个 D」。💀时间账最扎心:一个 14 周项目里,找数据+对口径 18 天、清洗 11 天、标注 16 天、建评测集查泄漏 6 天,数据相关共 51 天 = 74%;而模型选型只有 4 天,且第 1 天就定了,剩下 3 天在调一个已决定的东西——模型选型一天定了,数据磨几个月,这就是「数据才是那个瓶颈」。⭐⭐思维方式的关键翻转:建模时「AUC 涨了」是好消息,搞数据时「AUC 突然涨了」首先是一个待排查的异常,先怀疑泄漏;而且数据出问题不会报错,一切正常、只是结论是错的。结构是 21 章 + 附录A,分五个阶段:阶段0 先看清(00–03)、阶段1 质量(04–08)、阶段2 标注(09–12)、阶段3 评测与泄漏(13–16)、阶段4 工程治理(17–19)、阶段5 动手(20)。⭐三个高光05 缺失不是一种东西(MCAR/MAR/MNAR 三种成因,填错把偏差直接喂进模型而离线指标完全正常)、14 数据泄漏的七种来源(线下 0.96 线上 0.72 的主要解释)、03 数据契约(把「上游改字段没人告诉你」变成会失败的测试)。四种读法:接手陌生数据 02→04→05→06→08指标不可信 14→13→06→15建标注项目 09→10→11→12搭数据平台 03→17→18→19。⚠️只有一小时就读 05 + 14。前置只要 Python/pandas + 知道训练验证集和过拟合;不需要深度学习、分布式、数学推导。⚠️ 如果你没做过真项目,这套会显得啰嗦悲观——那就先看第 1 章那个事故,看完还觉得夸张就等踩坑之后再回来。

下一节 👉 01-数据才是那个瓶颈.md

打卡记录保存在你的浏览器里,首页能看到总进度