📑 本页目录(点开跳转)
00 · 怎么用这份教程
⏱ 12 分钟 | ⭐ 其他板块教你从数据里学,这一套教你在【数据很贵】的时候怎么办
🎯 一句话
这套教程讲的是:当一条标签意味着一次真实的实验时,机器学习要怎么改。 不是讲生物学,也不是讲某个具体模型 —— ⭐ 讲的是科学问题变成建模问题的那一步,以及那一步上四个反直觉的地方。
🧭 一、你现在的问题是哪一个
⭐ 按你手上的问题进,不要按技术名词进。 每条路线都从站内真实存在的页开始:
| 你现在的问题 | 第一站 | 最短能走通的路线 |
|---|---|---|
| ⭐ 只是想知道这和普通 ML 差在哪 | 01 · 第一天 | 01 → 07。两章,56 分钟,拿到全套核心直觉 |
| 我的数据只有几十条 | 06 · 小数据这一关 | 06 → 07 → 08(80 分钟) |
| 我的模型指标好得可疑 | 07 · 评测的坑 | ⚠️ 先读这一章,别先调模型 |
| 我要处理序列数据 | 02 · 序列不是文本 | 02 → 03 → 06(74 分钟) |
| 我在做分子/结构相关的东西 | 04 · 从序列到结构 | 04 → 05(62 分钟) |
| 实验做完了,下一批做什么 | 08 · 飞轮 | 08(可先补 06) |
💀 如果你只有时间读一章,读 07。 它讲的那个坑会让你的所有指标都是假的,而且默认设置下你看不出来。
📚 二、八章各讲什么
| 章 | 一句话 | 什么时候需要它 |
|---|---|---|
| 01 · 第一天 | 领域知识和数据可以互换,兑换率能量出来 | ⭐ 入门,也是全板块的钩子 |
| 02 · 序列不是文本 | 五条来自 NLP 的直觉,逐条要改 | 你要处理序列 |
| 03 · 蛋白质语言模型 | 完形填空学到的是共进化,而共进化就是结构约束 | 你想用预训练表示 |
| 04 · 从序列到结构 | 别预测坐标,预测距离 | 你的输出是几何对象 |
| 05 · 等变与不变 | 把对称性写进网络,而不是靠数据增强 | 同上,另一条路 |
| 06 · 小数据这一关 | 冻结 + 小头,让无标注数据出力 | ⭐ 标签只有几十条 |
| 07 · 评测的坑 | 随机划分在这里是作弊 | 💀 所有人都需要 |
| 08 · 飞轮 | 挑候选不是挑分数最高的 | 你能去做新实验 |
外加 附录A · 速查:所有实测数字和判据集中在一页,查表用。
⭐ 全书正文 8 章合计 3.6 小时(连导读和附录 4.0 小时)。
🔬 三、这个板块的四条主张
它们贯穿全部八章,⭐ 每一条都有实跑数字撑着,不是观点。
① 先验和数据可以互换,而且买的是速度不是上限。 01 章实测:一列领域知识特征 ≈ 把训练集翻一倍; 而数据一多,那一列就白给了。06 章在预训练表示上量到同一条曲线。
② 有对称性的问题,要么换目标,要么改结构 —— 别指望数据增强。 04 章走第一条路(预测距离而不是坐标), 05 章走第二条。
③ 随机划分在这里是作弊。 07 章实测:同一份数据、同一个模型,只改划分方式, R² 从 0.707 掉到 −1.199(负数 = 还不如猜均值)。
④ 数据是你去生产的,所以「挑什么去做」本身就是个建模问题。 08 章实测:贪心挑候选 8 次只成功 2 次,UCB 8 次全中。
🚧 四、这份教程刻意不讲什么
⚠️ 写清楚边界,比多写两章有用。
| 不讲 | 为什么 |
|---|---|
| 生物学本身 | 不是教程的目的,也不是我的领域。氨基酸、二级结构这些只给一句够用的 |
| 具体模型的榜单成绩 | 🗓️ 半年就过期。⭐ 全书没有一个榜单数字,模型名一律标「请查最新的」 |
| 具体软件的用法 | 同上。讲的是形状不是 API |
| 神经网络基础 | 站内已有更好的:机器学习与深度学习基础 |
⭐ 留下的是不会过期的那部分:怎么把一个科学问题变成一个建模问题, 以及那一步上会踩的坑。
🧱 五、需要什么基础
必需的很少:会 numpy,知道什么是训练集测试集、什么是过拟合。 ⭐ 全书的代码只用 numpy,没有一行需要 GPU 或安装深度学习框架 —— 每一段都能直接复制到空文件跑。
不确定的话,这两章补一下就够:
| 补什么 | 去哪 |
|---|---|
| 线性回归、正则化(书里到处在用岭回归) | 机器学习与深度学习基础 03 · 线性模型 |
| 训练/测试划分、过拟合、交叉验证 | 机器学习与深度学习基础 05 · 评估与过拟合 |
⚠️ 但注意:第二条里那个「随机划分」在这个板块不能直接用 —— 那正是 07 章的正题。
🔗 这一章连到哪里
| 去哪 | 为什么 |
|---|---|
| 数据这一关 14 · 数据泄漏的七种来源 | ⭐ 本板块 07 章是它 ④ 分组泄漏在科学数据上的实例。区别是「组」给没给你 —— 那边 user_id 是现成一列,这边得自己按相似度聚 |
| 数据这一关 12 · 标注预算与主动学习 | 08 章飞轮的近亲:那边候选池给定,这边样本是你造出来的 |
| 强化学习基础 07 · 探索与利用 | 08 章那个 预测值 + κ × 不确定性 的完整形态 |
| 机器学习与深度学习基础 | ⭐ 承重墙。这个板块假定你会那里前几章的内容 |
✅ 检查点
- 这个板块和其他板块最根本的区别是什么?
- 只有时间读一章的话该读哪一章?为什么?
- 四条主张分别是什么?各由哪一章的什么数字撑着?
- 这份教程刻意不讲哪四类东西?
- 需要什么基础?代码需要装什么?
👀 答案
- 其他板块讲「从给定的数据里学」,这一套讲一条标签意味着一次真实实验时该怎么办 —— 数据贵、量少,而且数据是你去生产的。
- 07 · 评测的坑。 因为它讲的那个坑会让你所有指标都是假的,而且默认设置下看不出来。
- ①先验和数据可互换、买速度不买上限(01:一列特征 ≈ 翻一倍数据;06:同样的曲线)②有对称性要么换目标要么改结构(04 / 05)③随机划分是作弊(07:R² 0.707 → −1.199)④挑什么去做本身是建模问题(08:贪心 2/8,UCB 8/8)。
- 生物学本身、具体模型的榜单成绩(🗓️ 会过期,全书零榜单数字)、具体软件用法、神经网络基础(站内已有更好的)。
- 会 numpy + 知道训练/测试划分和过拟合。⭐ 代码只用 numpy,不需要 GPU 或深度学习框架,每段都能复制到空文件直接跑。
🛑 可以停在这里
⭐ 读完这一页你该做的就一件事:回到第一节那张表,挑一行,点进去。
⚡ 走神救援
先记住这几件事
- 科学数据常由昂贵实验产生,先明确要支持什么判断或下一次实验。
- 按序列、结构、小数据或评测问题选择入口,不必先顺读所有章节。
- 先检查数据独立性、对称性和评估方式,再决定是否增加模型复杂度。
下一节 👉 01-第一天.md