📑 本页目录(点开跳转)
附录A · 速查
⏱ 10 分钟 | ⭐ 全书的实测数字和判据,集中在一页
🎯 一句话
这一页是查表用的,不是读的。 全书八章的实测数字、判据和红线都在这里,⭐ 每一条都注明出处章节。
📊 一、全书实测数字总表
⭐ 每一个都是真跑出来的,代码在对应章节里,都能复制到空文件直接跑。
| 出处 | 量的是什么 | 结果 |
|---|---|---|
| 01 | 450 条数据,加一列疏水性 | R² 0.319 → 0.515 |
| 01 | 纯 one-hot 翻倍到 900 条 | R² 0.535 ⭐ 和上面相当 → 一列先验 ≈ 一倍数据 |
| 01 | 1800 条时两种方案 | 都是 0.705 ⭐ 优势归零 |
| 01 | 涨到 0.748 就不动 | ⚠️ 模型形式限制,不是数据不够 |
| 02 | 随机两条序列的相同率 | 0.05 = 1/20 背景值 |
| 02 | 每条序列和它最近邻的相同率 | 0.71 ⭐ 有 ≥50% 近亲的占 100% |
| 02 | 200 残基按子词切 | 113.9 个 token |
| 03 | 真实接触对的互信息 | 约 3.5 bit |
| 03 | 其余 777 对的背景 | 0.066 bit ⭐ 五十倍分离 |
| 03 | 💀 间接相关的假接触 | 2.973 bit,排第三 |
| 04 | MDS 恢复的距离矩阵偏差 | 1.07e-14 ⭐ 信息没丢 |
| 04 | 坐标本身偏差 | 23.145 |
| 04 | 刚体对齐之后 | 8.88e-15 ⭐ 差的只是刚体变换 |
| 05 | 坐标模型,64 倍增强数据 | RMSE 0.6521 → 0.3924 |
| 05 | 距离模型,同样的数据 | ⭐ 0.1592 一个数字没动 |
| 05 | 💀 同一分子 32 个朝向,坐标模型预测 std | 0.1861(标签 std 才 0.7182) |
| 06 | 20 条标签,one-hot vs 冻结表示 | 0.374 → 0.696 |
| 06 | 3000 条标签时 | 0.878 vs 0.884 ⭐ 收敛 |
| 07 | 💀 随机划分 vs 按家族划分 | R² 0.707 → −1.199 |
| 07 | 加大正则化 (lam 1→100) | 只从 −1.20 抬到 −0.248,⚠️ 仍是负的 |
| 08 | 贪心挑候选 | 2/8 次成功 |
| 08 | UCB (κ=2) | ⭐ 8/8 次成功,平均第 7 轮 |
🚦 二、判据速查
遇到问题时按这个查该往哪个方向使劲。
| 症状 | 说明什么 | 该做的 | 出处 |
|---|---|---|---|
| 加特征立刻涨 | 数据不够,先验有空间 | 继续挖领域知识(最便宜) | 01 |
| 加特征没反应、加数据还涨 | 先验饱和 | 搞数据,或用预训练表示 | 01 06 |
| 加数据也不涨 | ⚠️ 模型形式表达不了 | 换结构 | 01 |
| 指标好得可疑 | 💀 大概率是同源泄漏 | 按家族重新划分再量 | 07 |
| 标签只有几十条 | n < p |
冻结 + 小头 | 06 |
| 输出是几何对象 | 输出空间有对称性 | 换目标 或 内建等变 | 04 05 |
| 每轮指标都在涨但没突破 | ⚠️ 可能一直在错的区域 | 加大 κ | 08 |
⛔ 三、红线:这些事一做就错
| 💀 别做 | 为什么 | 出处 |
|---|---|---|
| 随机划分训练/测试集 | 同源序列跨集,指标全虚 | 07 |
| 只把测试集按组切、验证集还随机切 | 调参那一步照样泄漏 | 07 |
| 报指标不报相似度阈值 | 30% 和 90% 是两个难度,数字不可比 | 07 |
| 直接回归三维坐标 + MSE | 在惩罚「答对但朝向不同」 | 04 |
| 拿互信息最高的当接触 | 间接相关会伪装成接触(2.973 bit) | 03 |
| 几十条标签做全量微调 | 参数量级配不上样本量 | 06 |
| 随便换个残基当数据增强 | 标签会变,增强必须保标签 | 06 05 |
| 批量挑 top-N 候选 | 会挤在一起,N 次实验只买 1 条信息 | 08 |
| 拿飞轮产生的新数据当测试集 | 分布已经被你的模型筛过 | 08 |
| 试多种划分挑一个好看的 | 测试集已被污染 | 06 |
🧪 四、正确划分的四步
⭐ 全书最要紧的一条操作规范,来自 07 章:
- 先按相似度聚类,再整簇分配到训练/验证/测试。
- 报告时必须同时报相似度阈值,否则数字之间不可比。
- ⚠️ 验证集也要按组切 —— 只切测试集,调参那一步照样泄漏。
- 用别人的公开划分前,先问它是怎么划的。
⭐ 和 数据这一关 14 · 数据泄漏的七种来源 的 ④ 分组泄漏是同一个机制(那边随机切 AUC 0.706、按用户
GroupKFold只剩 0.564)。 ⭐⭐ 唯一的区别是「组」给没给你:那边user_id是现成的一列, 一行len(set(uid_train) & set(uid_test))就能验;这边没有这一列, 「哪些算同一组」得你自己按相似度聚出来,连阈值定在哪都是你的决定。
🗓️ 五、这一页里会过期的东西
⚠️ 几乎没有 —— 这是刻意的。全书不含任何榜单成绩、模型参数量、SOTA 数字。 上面那张总表全是在你自己机器上能重跑出来的合成实验,不依赖任何外部服务或数据集版本。
⭐ 会过期的只有一类:具体该用哪个预训练模型。 书里提到模型名的地方都标了 🗓️ 并写着「请去查最新的」, ⭐ 不变的是用法:先冻结、先量一下它比 one-hot 好多少,再决定要不要投入微调。
🔗 这一章连到哪里
| 去哪 | 为什么 |
|---|---|
| 00 · 怎么用这份教程 | 按你手上的问题选入口的那张表 |
| 07 · 评测的坑 | 💀 上面红线表里前三条的完整论证 |
| 数据这一关 14 · 数据泄漏的七种来源 | 第四节那个「同一个机制、组给没给你」的对照 |
| 数据这一关 12 · 标注预算与主动学习 | 飞轮那一章的近亲,候选池给定的版本 |
| 强化学习基础 07 · 探索与利用 | κ 那个参数的完整来历 |