🏠 总目录📚 本教程 00 · 怎么用这份教程 →
📑 本页目录(点开跳转)

00 · 怎么用这份教程

⏱ 12 分钟 | ⭐ 其他板块教你从数据里学,这一套教你在【数据很贵】的时候怎么办


🎯 一句话

这套教程讲的是:当一条标签意味着一次真实的实验时,机器学习要怎么改。 不是讲生物学,也不是讲某个具体模型 —— ⭐ 讲的是科学问题变成建模问题的那一步,以及那一步上四个反直觉的地方。


🧭 一、你现在的问题是哪一个

⭐ 按你手上的问题进,不要按技术名词进。 每条路线都从站内真实存在的页开始:

你现在的问题 第一站 最短能走通的路线
⭐ 只是想知道这和普通 ML 差在哪 01 · 第一天 01 → 07。两章,56 分钟,拿到全套核心直觉
我的数据只有几十条 06 · 小数据这一关 06 → 07 → 08(80 分钟)
我的模型指标好得可疑 07 · 评测的坑 ⚠️ 先读这一章,别先调模型
我要处理序列数据 02 · 序列不是文本 02 → 03 → 06(74 分钟)
我在做分子/结构相关的东西 04 · 从序列到结构 04 → 05(62 分钟)
实验做完了,下一批做什么 08 · 飞轮 08(可先补 06)

💀 如果你只有时间读一章,读 07。 它讲的那个坑会让你的所有指标都是假的,而且默认设置下你看不出来。


📚 二、八章各讲什么

章 一句话 什么时候需要它
01 · 第一天 领域知识和数据可以互换,兑换率能量出来 ⭐ 入门,也是全板块的钩子
02 · 序列不是文本 五条来自 NLP 的直觉,逐条要改 你要处理序列
03 · 蛋白质语言模型 完形填空学到的是共进化,而共进化就是结构约束 你想用预训练表示
04 · 从序列到结构 别预测坐标,预测距离 你的输出是几何对象
05 · 等变与不变 把对称性写进网络,而不是靠数据增强 同上,另一条路
06 · 小数据这一关 冻结 + 小头,让无标注数据出力 ⭐ 标签只有几十条
07 · 评测的坑 随机划分在这里是作弊 💀 所有人都需要
08 · 飞轮 挑候选不是挑分数最高的 你能去做新实验

外加 附录A · 速查:所有实测数字和判据集中在一页,查表用。

⭐ 全书正文 8 章合计 3.6 小时(连导读和附录 4.0 小时)。


🔬 三、这个板块的四条主张

它们贯穿全部八章,⭐ 每一条都有实跑数字撑着,不是观点。

① 先验和数据可以互换,而且买的是速度不是上限。 01 章实测:一列领域知识特征 ≈ 把训练集翻一倍; 而数据一多,那一列就白给了。06 章在预训练表示上量到同一条曲线。

② 有对称性的问题,要么换目标,要么改结构 —— 别指望数据增强。 04 章走第一条路(预测距离而不是坐标), 05 章走第二条。

③ 随机划分在这里是作弊。 07 章实测:同一份数据、同一个模型,只改划分方式, R² 从 0.707 掉到 −1.199(负数 = 还不如猜均值)。

④ 数据是你去生产的,所以「挑什么去做」本身就是个建模问题。 08 章实测:贪心挑候选 8 次只成功 2 次,UCB 8 次全中。


🚧 四、这份教程刻意不讲什么

⚠️ 写清楚边界,比多写两章有用。

不讲 为什么
生物学本身 不是教程的目的,也不是我的领域。氨基酸、二级结构这些只给一句够用的
具体模型的榜单成绩 🗓️ 半年就过期。⭐ 全书没有一个榜单数字,模型名一律标「请查最新的」
具体软件的用法 同上。讲的是形状不是 API
神经网络基础 站内已有更好的:机器学习与深度学习基础

⭐ 留下的是不会过期的那部分:怎么把一个科学问题变成一个建模问题, 以及那一步上会踩的坑。


🧱 五、需要什么基础

必需的很少:会 numpy,知道什么是训练集测试集、什么是过拟合。 ⭐ 全书的代码只用 numpy,没有一行需要 GPU 或安装深度学习框架 —— 每一段都能直接复制到空文件跑。

不确定的话,这两章补一下就够:

补什么 去哪
线性回归、正则化(书里到处在用岭回归) 机器学习与深度学习基础 03 · 线性模型
训练/测试划分、过拟合、交叉验证 机器学习与深度学习基础 05 · 评估与过拟合

⚠️ 但注意:第二条里那个「随机划分」在这个板块不能直接用 —— 那正是 07 章的正题。


🔗 这一章连到哪里

去哪 为什么
数据这一关 14 · 数据泄漏的七种来源 ⭐ 本板块 07 章是它 ④ 分组泄漏在科学数据上的实例。区别是「组」给没给你 —— 那边 user_id 是现成一列,这边得自己按相似度聚
数据这一关 12 · 标注预算与主动学习 08 章飞轮的近亲:那边候选池给定,这边样本是你造出来的
强化学习基础 07 · 探索与利用 08 章那个 预测值 + κ × 不确定性 的完整形态
机器学习与深度学习基础 ⭐ 承重墙。这个板块假定你会那里前几章的内容

✅ 检查点

  1. 这个板块和其他板块最根本的区别是什么?
  2. 只有时间读一章的话该读哪一章?为什么?
  3. 四条主张分别是什么?各由哪一章的什么数字撑着?
  4. 这份教程刻意不讲哪四类东西?
  5. 需要什么基础?代码需要装什么?
👀 答案
  1. 其他板块讲「从给定的数据里学」,这一套讲一条标签意味着一次真实实验时该怎么办 —— 数据贵、量少,而且数据是你去生产的。
  2. 07 · 评测的坑。 因为它讲的那个坑会让你所有指标都是假的,而且默认设置下看不出来。
  3. ①先验和数据可互换、买速度不买上限(01:一列特征 ≈ 翻一倍数据;06:同样的曲线)②有对称性要么换目标要么改结构(04 / 05)③随机划分是作弊(07:R² 0.707 → −1.199)④挑什么去做本身是建模问题(08:贪心 2/8,UCB 8/8)。
  4. 生物学本身、具体模型的榜单成绩(🗓️ 会过期,全书零榜单数字)、具体软件用法、神经网络基础(站内已有更好的)。
  5. 会 numpy + 知道训练/测试划分和过拟合。⭐ 代码只用 numpy,不需要 GPU 或深度学习框架,每段都能复制到空文件直接跑。

🛑 可以停在这里

⭐ 读完这一页你该做的就一件事:回到第一节那张表,挑一行,点进去。

⚡ 走神救援

先记住这几件事

下一节 👉 01-第一天.md

打卡记录保存在你的浏览器里,首页能看到总进度