📑 本页目录(点开跳转)
00 · 怎么用这份教程
⏱ 24 分钟
🎯 一句话
其他几套教程都从「给定一份数据」开始,这一套讲那之前发生的事。
它和《模型上线之后》是一对: 那一套说「所有教程停在模型训完,事故全在之后」; 这一套说「事故有一大半在数据进模型之前」。
📊 一、为什么要单独开这一套
这不是拍脑袋加的板块。开它之前先数了一遍全站:
全站提及「标注 / 数据质量 / 脏数据 / 缺失 / 泄漏」的页面: 39 页
这些词在正文里的总命中次数: 161 次
而【专门】讲这件事的页面,只有 1 页:
Kaggle竞赛方法论 / 01_数据策略与特征工程
—— 而且是【竞赛视角】:数据已经给你了,你只能做特征
⭐ 结论:161 次提及,0 个系统讲法。
每套教程都在说「数据很重要」,然后立刻跳过它。
⭐ 「39 页提到、1 页专讲」是一个典型信号: 说明这件事重要到躲不开,但又没重要到有人愿意专门写。 因为它不酷 —— 没有公式、没有架构图、没有 SOTA, 只有一堆看起来很蠢但每年都在发生的事故。
🧩 二、它和其他十个板块的分工
| 板块 | 它教你的 | 它默认已经有的(= 本套要补的) |
|---|---|---|
| 机器学习与深度学习基础 | 怎么训出一个模型 | 训练集是干净的、标签是对的 |
| 机器学习的数学原理 | 为什么这么训是对的 | 样本 i.i.d.、分布不变 |
| Kaggle 竞赛方法论 | 给定数据怎么榨干它 | 数据是主办方给的,不用你造 ⭐ |
| 推荐算法 | 排序模型怎么做 | 曝光/点击日志天然存在且口径稳定 |
| 大模型全景导论 | 大模型怎么训、怎么用 | 语料从哪来、去没去重、有没有污染评测集 |
| 智能体工程教程 | Agent 怎么搭 | 评测集是谁写的、覆盖了什么 |
| AI 基础设施 | 数据管线怎么跑得快 | 管线里流的是什么、对不对 ⭐ |
| 强化学习基础 | 从交互中学 | 环境/奖励信号是可信的 |
| 模型上线之后 | 训完之后的几年 | 训之前的那几个月 |
| 密码学与信息安全 | 数据怎么保密 | 数据怎么才算「对」 |
🔑 一句话概括这张表: 别的板块都在解「给定 D,求 f」; 这一套解的是「D 从哪来、D 是不是你以为的那个 D」。
🕐 三、真实项目里的时间都花在哪
一个从零到上线的模型项目(14 周)的真实工时分布:
├─ 想清楚要解什么问题 ............ 5 天
├─ 找数据 / 要权限 / 对口径 ...... 18 天 ⭐ 本教程
├─ 清洗 / 修脏数据 ............... 11 天 ⭐ 本教程
├─ 设计标注体系 / 标 / 返工 ...... 16 天 ⭐ 本教程
├─ 建评测集 / 查泄漏 ............. 6 天 ⭐ 本教程
├─ 特征工程 ...................... 9 天
├─ 模型选型 + 调参 ............... 4 天 ← 大部分教程只讲这 4 天
└─ 上线 / 监控 / 复盘 ............ 该做几年(另一套教程)
⭐ 数据相关:51 天 / 69 天 = 74%
⭐ 模型相关:4 天 / 69 天 = 6%
💀 最反直觉的一条: 在这 14 周里,模型选型只花了 4 天,而且第 1 天就基本定了 —— 剩下 3 天是在调一个已经决定要用的东西。 可数据这条线,磨了三个多月。
🎭 四、这一套的思维方式和建模时不一样
| 建模时 | 搞数据时 | |
|---|---|---|
| 目标 | 指标高一点 | 指标是真的 ⭐ |
| 好消息 | AUC 涨了 = 好事 | AUC 突然涨了 = 先怀疑泄漏 ⭐⭐ |
| 失败长什么样 | loss 不降,一眼看见 | 一切正常,只是结论是错的 💀 |
| 谁能验收 | 测试集 | 只有业务能验收「这个口径对不对」 |
| 主要工作 | 写代码 | 对齐口径、追人、写契约 ⚠️ |
| 可以重来吗 | 能,重训一次 | 标注返工要重新排期和花钱 |
⭐ 第二行是整套教程的核心态度: 建模时「指标涨了」是好消息; 搞数据时「指标涨了」首先是一个待排查的异常。 本套里至少有五个章节,讲的都是「某个虚高指标背后的真相」。
🗺️ 五、教程结构(21 章 + 附录 A)
【阶段0 先看清】 00 怎么用 01 数据才是那个瓶颈
02 一份数据集是怎么来的 03 数据契约 ⭐
【阶段1 质量】 04 脏数据的十种形态 05 缺失不是一种东西 ⭐⭐
06 重复与实体解析 07 异常值是错还是真
08 数据质量怎么量
【阶段2 标注】 09 标注体系怎么设计 10 标注一致性怎么量 ⭐
11 标签噪声 12 标注预算与主动学习
【阶段3 评测与泄漏】 13 评测集也是数据
14 数据泄漏的七种来源 ⭐⭐
15 采样偏差与幸存者偏差 16 合成数据
【阶段4 工程治理】 17 数据版本与血缘 18 特征存储 19 隐私脱敏与留存
【阶段5 动手】 20 实战与挑战项目 【随时查】附录A 速查
三章是高光:
| 章节 | 为什么 |
|---|---|
| ⭐⭐ 第 5 章 缺失不是一种东西 | 缺失有三种成因,用错填法会把偏差直接喂进模型,而离线指标完全正常 |
| ⭐⭐ 第 14 章 数据泄漏的七种来源 | 线下 0.96 线上 0.72 的绝大多数解释都在这一章 |
| ⭐ 第 3 章 数据契约 | 「上游改字段没人告诉你」是常态,契约是唯一能把它变成会失败的测试的东西 |
⏱️ 六、四种读法
| 你的情况 | 路线 | 时间 |
|---|---|---|
| 刚接手一份陌生数据 | 02 → 04 → 05 → 06 → 08 | 3 小时 |
| 离线好线上差 / 指标不可信 | 14 → 13 → 06 → 15 | 2.5 小时 |
| 要从零建一个标注项目 | 09 → 10 → 11 → 12 | 3 小时 |
| 在搭数据平台 / 要立规矩 | 03 → 17 → 18 → 19 | 2.5 小时 |
| 完整打牢 | 全部顺读 | 1–2 周 |
💡 如果只有一小时:读 05 和 14。 一个是最容易悄悄注入偏差的地方,一个是最容易制造虚假指标的地方 —— 这两件事加起来,能解释你见过的大部分「说不清为什么」的模型问题。
🎒 七、需要什么前置
必须有的:
├─ 会写 Python + pandas(groupby / merge / value_counts 级别)
└─ 知道什么叫训练集/验证集、什么叫过拟合
→ 没有的话先去《机器学习与深度学习基础》01–05
最好有的(没有也能读,只是共鸣少一点):
├─ 写过 SQL、见过一张真实的业务表
└─ 参与过一次「指标对不上」的撕扯 ⭐
不需要的:
├─ 深度学习 / Transformer
├─ 分布式与大数据框架
└─ 数学推导 —— 只有少数几章会出现式子(13 章最多),
每一处都配了人话翻译和可跑代码
⚠️ 一条反向建议: 如果你从没做过一个真项目,这套教程会显得啰嗦且悲观。 那就先跳到 第 1 章 看那个事故, 看完还觉得夸张的话,就先别读,等你踩到第一个坑再回来 ——那时它会非常好读。
🔗 这一章连到哪里
| 去哪 | 为什么 |
|---|---|
| 《模型上线之后》00 | 姊妹篇。那套管「训完之后」,这套管「训之前」,中间夹着的才是大部分教程讲的东西 |
| Kaggle 01 数据策略与特征工程 | 全站唯一一页专讲数据的,竞赛视角:数据已给定。读完可以对比「工业视角」差在哪 |
| ML 基础 00 怎么用这份教程 | 本套的前置。先会训模型,再来讨论数据对不对 |
| AI 基础设施 22 数据管线与存储 | 那边讲管线怎么跑得快,这边讲管线里流的东西对不对 |
✅ 检查点
- 这套教程和其他十个板块的分工,用一句话怎么说?
- 立项的量化依据是什么?三个数字分别是多少?
- 那个 14 周项目里,数据相关和模型相关各占多少天、多少比例?最反直觉的是哪一条?
- 建模时和搞数据时,对「指标涨了」的态度有什么关键差别?
- 本套的三个高光章节是哪三章,各自解决什么?
- 「离线好线上差」应该走哪条读法路线?只有一小时该读哪两章?
- 读这套教程必须有什么前置?什么是不需要的?
👀 答案
- 其他板块解「给定 D,求 f」,这一套解「D 从哪来、D 是不是你以为的那个 D」。它是《模型上线之后》的姊妹篇:那套讲训完之后,这套讲训之前。
- 全站 39 页提及数据质量/标注相关内容,正文总命中 161 次,但专门讲它的只有 1 页(Kaggle 01),而且是竞赛视角(数据已给定)。
- 数据相关 51 天 / 69 天 = 74%,模型相关 4 天 / 69 天 = 6%。最反直觉的是:模型选型第 1 天就基本定了,剩下 3 天只是调一个已决定的东西,而数据线磨了三个多月。
- 建模时「AUC 涨了」是好消息;搞数据时「AUC 突然涨了」首先是一个待排查的异常(先怀疑泄漏)。另一条差别:建模失败会报错(loss 不降),数据出问题往往一切正常、只是结论是错的。
- ⭐⭐ 第 5 章缺失(三种成因,填错把偏差喂进模型而离线指标正常)、⭐⭐ 第 14 章泄漏(线下 0.96 线上 0.72 的主要解释)、⭐ 第 3 章数据契约(把「上游改字段没人告诉你」变成会失败的测试)。
- 走 14 → 13 → 06 → 15(约 2.5 小时)。只有一小时就读 05 + 14:一个是最容易悄悄注入偏差的地方,一个是最容易制造虚假指标的地方。
- 必须:Python + pandas、知道训练/验证集与过拟合。不需要:深度学习、分布式框架、数学推导(只有少数几章出现式子,13 章最多,每一处都配了人话翻译和可跑代码)。
🛑 开始
⚡ 走神救援
⭐定位:其他教程从「给定一份数据」开始,这一套讲那之前发生的事。 它是《模型上线之后》的姊妹篇——那套说「教程都停在模型训完,事故全在之后」,这套说「事故有一大半在数据进模型之前」。⭐立项依据是数出来的:全站 39 页提到标注/数据质量、正文命中 161 次,但专门讲它的只有 1 页(Kaggle 01),还是竞赛视角(数据主办方给你)。⭐分工一句话:别的板块解「给定 D 求 f」,这套解「D 从哪来、D 是不是你以为的那个 D」。💀时间账最扎心:一个 14 周项目里,找数据+对口径 18 天、清洗 11 天、标注 16 天、建评测集查泄漏 6 天,数据相关共 51 天 = 74%;而模型选型只有 4 天,且第 1 天就定了,剩下 3 天在调一个已决定的东西——模型选型一天定了,数据磨几个月,这就是「数据才是那个瓶颈」。⭐⭐思维方式的关键翻转:建模时「AUC 涨了」是好消息,搞数据时「AUC 突然涨了」首先是一个待排查的异常,先怀疑泄漏;而且数据出问题不会报错,一切正常、只是结论是错的。结构是 21 章 + 附录A,分五个阶段:阶段0 先看清(00–03)、阶段1 质量(04–08)、阶段2 标注(09–12)、阶段3 评测与泄漏(13–16)、阶段4 工程治理(17–19)、阶段5 动手(20)。⭐三个高光:05 缺失不是一种东西(MCAR/MAR/MNAR 三种成因,填错把偏差直接喂进模型而离线指标完全正常)、14 数据泄漏的七种来源(线下 0.96 线上 0.72 的主要解释)、03 数据契约(把「上游改字段没人告诉你」变成会失败的测试)。四种读法:接手陌生数据 02→04→05→06→08;指标不可信 14→13→06→15;建标注项目 09→10→11→12;搭数据平台 03→17→18→19。⚠️只有一小时就读 05 + 14。前置只要 Python/pandas + 知道训练验证集和过拟合;不需要深度学习、分布式、数学推导。⚠️ 如果你没做过真项目,这套会显得啰嗦悲观——那就先看第 1 章那个事故,看完还觉得夸张就等踩坑之后再回来。
下一节 👉 01-数据才是那个瓶颈.md