🏠 总目录📚 本教程 附录A · 术语速查 ← →
📑 本页目录(点开跳转)

附录 A / 术语速查 · 查完即走

只找卡住你的词,
不用从头读到尾。

搜索中文、英文或函数名。所有原有分类、术语表和跨章节链接都保留在下方。

继续探索

原有正文、图解和例子都在下方。按需跳转,不必一次读完。

附录 A · 术语速查卡

📌 Ctrl+F 搜。不要通读。 用法:看论文/读代码卡在一个词上 → 搜它 → 看到那一行 → 回去继续。


🧭 「我该翻哪一章」决策表

你的问题 去哪
完全没跑过模型 01 十分钟第一个模型
这题该用什么模型? 02 机器学习在干什么
表格数据怎么做到最好? 04 决策树 + 04a 集成 + 16 特征工程
我的分数是不是假的? ⭐ 05 评估与过拟合
神经网络训不动 / loss 是 NaN 11 训练调试手册 ⭐
过拟合了该加什么? 10 正则化全家桶
学习率怎么调? 09 优化器与学习率
反向传播到底怎么回事? 08 反向传播 → 数学原理 12
PyTorch 写法忘了 附录B 代码速查
为什么是这样?(原理层) 《机器学习的数学原理》 ⭐

🧱 基础

术语 英文 人话
特征 Feature 用来做判断的输入,通常是矩阵的一列
标签 Label / Target 要预测的答案
样本 Sample / Instance 一条数据,矩阵的一行
监督学习 Supervised 有标准答案(分类/回归/排序)
无监督 Unsupervised 没答案,找结构(聚类/降维)
自监督 Self-supervised 自己造答案(遮词猜词)⭐ 大模型的地基
假设空间 Hypothesis Space 模型允许 f 长什么样,决定能力上限
归纳偏置 Inductive Bias 模型内建的先验假设(CNN=局部+平移,RNN=时序)⭐

🎯 训练

术语 人话
损失函数 衡量预测有多差。MSE(回归) / 交叉熵(分类) / BPR(排序)
梯度下降 蒙眼下山:感受下坡方向,迈一小步,重复
反向传播 链式法则+从后往前算,复用中间结果 ⭐
计算图 记录"谁是谁算出来的",反传时沿着它走
epoch 全部数据过一遍
batch / mini-batch 一次喂给模型的一小撮样本(32~512)
学习率 lr 每步迈多大。最重要的超参 ⭐
优化器 SGD → Momentum → RMSProp → Adam/AdamW(默认)
调度器 Scheduler 让 lr 随训练衰减(Cosine 是常见选择)
Warmup 开头几百步 lr 从 0 慢慢升上去,大模型训练常用
梯度裁剪 梯度太大就按比例缩小,防爆炸
梯度累积 小显存模拟大 batch

⚖️ 评估(第 5 章,最重要)

术语 人话
过拟合 训练好、测试差 = 背答案而非学规律 ⭐
欠拟合 训练集就差,可能容量不足,也需排查优化、特征和数据
偏差 Bias 系统性偏离 → 欠拟合
方差 Variance 对训练数据太敏感 → 过拟合
泛化 在没见过的数据上的表现(真正要的)
交叉验证 CV 训练数据切 K 折,轮流留一折作验证;独立测试集不参与调参
StratifiedKFold 保持类别比例的 K 折,分类默认用它
TimeSeriesSplit 只用过去预测未来,可用于时序;也可按任务设计滚动/留后验证
数据泄漏 用了不该知道的信息 → 离线虚高上线崩 ⭐
准确率 对的比例。⚠️ 类别不平衡时是陷阱
精确率 Precision 说是正的里有多少真的
召回率 Recall 真的正的里抓到多少
F1 精确率和召回率的调和平均
AUC 随机取一正一负,正的排前面的概率
PR-AUC 更聚焦正例检索;类别不平衡时与 ROC-AUC 及业务指标一起看
学习曲线 分数随数据量的变化,判断该加数据还是改模型

🛡️ 正则化(第 10 章)

术语 人话
正则化 一切"故意让模型别学太顺"的手段
L1 / Lasso 惩罚 |w|,会把权重压成 0 → 特征选择
L2 / Ridge / 权重衰减 L2 惩罚权重平方和,通常使系数收缩;解耦权重衰减直接缩小权重,在 Adam 类优化器中不等同于 L2
Dropout 训练时随机置零神经元,逼出冗余表示
BatchNorm 对 batch 内同一特征归一化,CNN 常用
LayerNorm 对样本内指定的特征维归一化;Transformer 常用,也有 RMSNorm 等替代
早停 验证集不降就停,回滚最佳权重。常用,但需保存权重与合理的验证方案 ⭐
数据增强 造数据,注入"这些变化下答案不变"的先验
标签平滑 如把硬标签 [0,1] 改成 [0.05,0.95],缓解过度自信;概率和仍须为 1

🌲 树模型(第 4 章)

术语 人话
基尼不纯度 / 信息熵 衡量节点纯不纯,决定在哪切
Bagging 并行、独立训练、投票 → 降方差(随机森林)
Boosting 串行、每棵新树纠正前面的错 → 降偏差(GBDT)⭐
Stacking 用一个模型学"怎么组合其他模型"
GBDT 新树拟合当前损失的负梯度;平方误差时对应残差,其他损失不宜直接叫残差
XGBoost / LightGBM / CatBoost GBDT 的三个工业实现:稳/快/类别特征强
特征重要性 ⚠️ 三个坑:偏高基数、相关特征分摊、只反映训练集
Permutation Importance 打乱某列看性能掉多少,比自带的可靠

🧠 神经网络(第 7–15 章)

术语 人话
MLP / 全连接 最基础的神经网络:线性层+激活堆叠
激活函数 提供非线性。ReLU 默认,Sigmoid 会梯度消失
梯度消失/爆炸 反向连乘导致指数衰减/增长 ⭐
残差连接 输出 = F(x) + x,梯度高速公路(ResNet→Transformer)⭐
卷积 小窗口滑过全图,局部连接 + 权重共享
感受野 一个输出对应输入的多大区域
池化 降尺寸、扩感受野
迁移学习 用预训练模型换个头再微调。图像/文本的默认做法 ⭐
RNN / LSTM / GRU 用记忆状态处理序列。硬伤:串行 + 遗忘
注意力 动态决定该关注哪些位置
位置编码 告诉注意力顺序信息(它天生没有)
万能近似定理 在合适激活等条件下,足够宽的网络能逼近紧集上的连续函数;不保证训练能找到解或高效

🔧 工程(第 15 章)

术语 人话
张量 Tensor 多维数组,可在不同设备运算;自动求导还需浮点/复数类型及相应梯度设置
zero_grad() 清除累计梯度;独立更新前清零,有意梯度累积则按周期清零
model.train()/eval() 切换 Dropout 和 BN 的行为
no_grad() 不建计算图,验证时用,省显存
detach() 切断梯度
BCEWithLogitsLoss 二分类,输出层别加 Sigmoid
CrossEntropyLoss 多分类,输入原始分数;常规标签用整数索引,也支持同形浮点概率标签
混合精度 AMP 按算子混用 FP16/BF16 与 FP32,可能省显存、提速;收益取决于硬件和模型
num_workers 数据加载并行数,治"GPU 吃不满"

🧹 特征工程(第 16 章)

术语 人话
标准化 按训练集统计量做 (x−μ)/σ;数值型线性模型和 NN 常受益,树模型通常不需要
log1p log(1+x),治长尾分布
分箱 连续值切区间,让模型学非线性
One-Hot 每个类别一列,类别少时用
目标编码 用类别的目标均值代替。必须 OOF + 平滑,否则泄漏 ⭐
频次编码 用出现次数/频率代替类别;频数也应只从允许的训练数据统计,不能默认无泄漏
聚合统计 一对多压成一行(用户的订单数/均值/最大)提分最猛 ⭐

⚠️ 十五个最容易搞混的地方

容易混 区别
偏差 vs 误差 偏差是多次重训的平均偏离,不是单次误差
Bagging vs Boosting Bagging 并行降方差;Boosting 串行降偏差 ⭐
验证集 vs 测试集 验证集用来选(调参/选模型),测试集只用一次报告 ⭐
准确率 vs AUC 准确率看硬预测且受阈值影响;AUC 看排序,与阈值无关
AUC vs PR-AUC ROC-AUC 看正负排序;PR 聚焦正例检索,不平衡时常需一起看。没有通用 5% 分界,PR 基线随正例比例变化
精确率 vs 召回率 精确率=说是正的里对多少;召回率=真正的里抓到多少
model.eval() vs no_grad() 前者切换 Dropout/BN 行为;后者不建计算图省显存。验证时两个都要 ⭐
L1 vs L2 L1 可能把部分权重压到恰好 0(特征选择);L2 通常收缩,不以产生零系数为特点
BatchNorm vs LayerNorm BN 使用批次及适用空间维统计,小有效样本数可能不稳;batch=1 不一定报错。LN 在样本内指定维度归一化
weight_decay vs L2 Adam 里两者不等价,AdamW 才是对的做法 ⭐
epoch vs step/iteration epoch=全部数据一遍;step=一个 batch
学习率 vs batch size 需要联合验证;batch 翻倍、学习率翻倍是有条件的经验规则,并非所有优化器都适用
过拟合 vs 数据泄漏 过拟合是过度适应训练数据;泄漏是使用了预测时不应知道的信息,可能来自划分、预处理或特征设计
微调 vs 冻结主干 数据少时可先试冻结主干;再用验证集比较微调范围,没有每类几百张的通用分界
CrossEntropyLoss vs NLLLoss 前者内含 softmax(输出层别加);后者要你自己先 log_softmax

📊 「该看什么数字」速查

场景 看什么 健康值
CV 分数 均值 ± 标准差 看相同划分下的配对变化与稳定性;标准差不是显著性检验的硬门槛
手写反向传播 梯度检验相对误差 < 1e-6(参考实现 1.49e-08)
训练刚开始 第一个 loss 未加权交叉熵且预测近似均匀时才≈ ln(类别数);10 类约 2.30
小数据过拟合测试 10 个样本的训练 loss 应能降到 ≈ 0
类别不平衡 正例比例 不要只看准确率;同时看基线、精确率、召回率与业务代价
GPU 利用率 nvidia-smi 长期偏低时先定位加载、传输、同步和计算瓶颈

💡 第三行值得单独记:未加权交叉熵、预测接近均匀时,第一个 batch 的 loss 才约等于 ln(类别数) ——因为初始时模型在均匀乱猜。明显偏离时应检查输出分布、损失设置和标签;不能仅凭偏离断言有 bug, 这是第 11 章最省时间的一个自检。


🔗 跨教程速查

这里学的 在哪里被用到
树模型 / GBDT Kaggle 全套的主力
评估与数据泄漏 Kaggle 的 CV 策略、推荐算法的离线/线上一致性
反向传播 / 优化器 数学原理 12、推荐算法的所有深度模型
正则化 数学原理 02(正则化=先验)
CNN / RNN / 注意力 全景导论主线 2 · 模型怎样看懂一句话
特征工程 Kaggle 01、推荐算法的特征体系
迁移学习 全景导论的微调、推荐算法的预训练 Embedding

👉 回到首页

打卡记录保存在你的浏览器里,首页能看到总进度