🏠 总目录 数据这一关 · 模型之前的那一半

数据这一关

其他教程从「给定一份数据」开始,这一套讲那之前发生的事。

真实项目里,模型选型往往一天就定了,而数据要磨几个月; 线上出事故时,十次里有七八次根子在数据 —— 口径变了、标注不一致、泄漏、采样偏了、脏数据混进重训。 这一套把那部分单独拿出来讲。

🚀 从「数据才是那个瓶颈」开始 💧 直接看最贵的那一章
0%
你的进度(在每章末尾点「打卡」,保存在本浏览器里)

🧩 它和其他几套的分工

数据这条线,之前是散在各处的 —— 这套把它接成一条:

竞赛视角
给定一份干净数据,怎么榨出特征
业务视角
推荐场景的日志与隐式反馈
工程视角
怎么把数据喂得够快
线上视角
训练和推理拿到的数据为什么不一样
这一套
数据本身
它从哪来、准不准、能不能信、出问题怎么查

阶段 0 · 先看清四章,搞清数据是从哪来的、谁该为它负责

阶段 1 · 质量⭐ 第 5 章:「缺失」有三种,用错填法会直接把偏差喂进模型

阶段 2 · 标注⭐⭐ 标注指南就是产品文档 —— 写不清楚,标注员就替你定义问题

阶段 3 · 评测与泄漏⭐ 第 13 章是全站评测方法论的总入口;第 14 章是最贵的一类 bug

阶段 4 · 工程与治理版本、血缘、特征存储、隐私 —— 让数据能被信任地重复使用

阶段 5 · 动手四个项目,从亲手弄脏一份数据到建一套质量门禁

随时查检查清单、阈值、代码