附录 A · 术语速查卡
📌 用法:看到不懂的词就
Ctrl+F搜这一页。不要通读,那是浪费时间。
🏗️ 架构类
| 术语 | 英文 | 人话解释 |
|---|---|---|
| 召回 | Retrieval / Matching | 从上亿物品里快速捞出几千个候选。求全不求准 |
| 粗排 | Pre-Ranking | 用小模型把几千个砍到几百个,给精排减负 |
| 精排 | Ranking | 用大模型精确打分,全系统最核心的环节 |
| 重排 | Re-Ranking | 调整最终列表:打散、多样性、去重、塞广告 |
| 多路召回 | Multi-channel Retrieval | 同时跑几十路不同逻辑的召回,各管一个角度 |
| 兜底 | Fallback | 出错时返回的保底结果(通常是热门榜) |
| 降级 | Degradation | 系统压力大时主动简化流程(如跳过精排) |
| 链路一致性 | Consistency | 各层优化目标是否对齐,不一致会导致好物品被误杀 |
📊 数据类
| 术语 | 英文 | 人话解释 |
|---|---|---|
| 显式反馈 | Explicit Feedback | 用户明说的偏好:评分、点赞、点踩 |
| 隐式反馈 | Implicit Feedback | 从行为推断的偏好:点击、播放、购买 |
| 交互矩阵 | Interaction Matrix | 用户 × 物品的大表,99.99% 是空的 |
| 稀疏性 | Sparsity | 矩阵里有值的格子占比极低 |
| 长尾 | Long Tail | 少数物品占大部分流量,大量物品几乎无人问津 |
| 冷启动 | Cold Start | 新用户/新物品没有数据,推不了 |
| 数据泄漏 | Data Leakage | 用未来信息训练,离线好看上线暴死 |
| 特征穿越 | Feature Leakage | 用了预测时刻拿不到的特征,同上 |
| 样本拼接 | Sample Joining | 把曝光日志和后续的点击/转化关联起来 |
| 特征快照 | Feature Snapshot | 把在线推理时实际用的特征值原样存下来 ⭐ |
🧮 算法类
| 术语 | 英文 | 人话解释 |
|---|---|---|
| 协同过滤 | Collaborative Filtering (CF) | 靠「大家的行为」推荐,不看物品内容 |
| UserCF | User-based CF | 和你像的人喜欢啥就推啥 |
| ItemCF | Item-based CF | 你喜欢的东西像啥就推啥 |
| 矩阵分解 | Matrix Factorization (MF) | 把大矩阵拆成用户向量 × 物品向量 |
| Embedding | 嵌入 / 向量表示 | 用一串数字代表一个东西,相似的东西数字也相近 ⭐ |
| 隐向量 / 隐因子 | Latent Factor | 同上,MF 语境下的叫法 |
| BPR | Bayesian Personalized Ranking | 不预测分数,只学「正样本分 > 负样本分」 |
| ALS | Alternating Least Squares | 交替固定一边求另一边,MF 的一种解法 |
| FM | Factorization Machine | 用隐向量点积表示任意两特征的交叉权重 |
| 双塔 | Two-Tower / DSSM | 用户塔和物品塔分开算,最后点积。召回标配 |
| DIN | Deep Interest Network | 用注意力让用户表示随候选物品而变 |
| MMoE | Multi-gate Mixture-of-Experts | 多专家+门控,解决多目标任务冲突 |
| SASRec | Self-Attentive Seq Rec | 单向 Transformer 做序列推荐,最强 baseline |
| Semantic ID | 语义 ID | 把物品 ID 换成有层次含义的码字序列 |
| HSTU | Hierarchical Seq Transduction Unit | Meta 的生成式推荐架构,首次展示 Scaling Law |
🎯 训练类
| 术语 | 英文 | 人话解释 |
|---|---|---|
| Pointwise | — | 逐个样本预测分数(用 MSE/LogLoss) |
| Pairwise | — | 学两个样本谁更好(用 BPR) |
| Listwise | — | 优化整个列表的排序 |
| 负采样 | Negative Sampling | 从没交互的物品里采一些当负样本 |
| In-batch 负采样 | — | 同批次里其他人的正样本当我的负样本 |
| LogQ 校正 | LogQ Correction | 修正 in-batch 负采样中热门物品被过度惩罚 |
| 困难负样本 | Hard Negative | 长得像正样本但其实是负的,训练价值高 |
| 蒸馏 | Distillation | 大模型当老师教小模型,用于粗排/推理加速 |
| 多目标 | Multi-task | 同时预估点击、时长、点赞等多个目标 |
| 正则化 | Regularization | 限制模型复杂度,防止死记硬背(过拟合) |
| 过拟合 | Overfitting | 训练集完美、测试集拉胯 |
| 增量训练 | Incremental Training | 在昨天的模型上用新数据继续训 |
📏 指标类
| 术语 | 全称 | 人话解释 |
|---|---|---|
| CTR | Click-Through Rate | 点击率 = 点击数 / 曝光数 |
| CVR | Conversion Rate | 转化率 = 转化数 / 点击数 |
| AUC | Area Under ROC Curve | 随机取一正一负,正样本分更高的概率 |
| GAUC | Group AUC | 按用户分组算 AUC 再加权平均 ⭐ 推荐更该看这个 |
| LogLoss | 对数损失 | 概率预测的准确度,需要校准时看它 |
| Recall@K | 召回率 | 相关物品有多少被召回进前 K 个 |
| Precision@K | 准确率 | 前 K 个里有多少是相关的 |
| NDCG@K | Normalized DCG | 考虑位置折损的排序质量,0~1 |
| HitRate@K | 命中率 | 前 K 个里有没有命中(0 或 1) |
| MRR | Mean Reciprocal Rank | 第一个正确答案位置的倒数的平均 |
| Coverage | 覆盖率 | 推荐结果覆盖了多少比例的物品库 |
| ILD | Intra-List Diversity | 列表内两两不相似度的平均 |
| Novelty | 新颖度 | 推荐物品的平均流行度(越低越新颖) |
| Serendipity | 惊喜度 | 「意外但相关」的程度 |
| PSI | Population Stability Index | 特征分布漂移的度量 |
🧪 实验类
| 术语 | 英文 | 人话解释 |
|---|---|---|
| A/B 实验 | A/B Test | 随机分两组跑不同策略,比较指标 |
| AA 测试 | A/A Test | 两组跑一样的策略,验证分流系统没 bug ⭐ |
| 分层实验 | Layered / Overlapping Experiments | 不同层的实验共用流量,层间正交 |
| 护栏指标 | Guardrail Metric | 不能跌的底线指标(延迟、举报率、多样性)⭐ |
| 核心指标 | North Star Metric | 决定上不上线的指标(留存、时长) |
| 反转实验 | Holdback / Reverse Test | 全量后留 1-5% 跑老策略,观察长期效应 |
| 偷看结果 | Peeking | 每天看一眼一显著就停,会让假阳性率飙升 ❌ |
| MDE | Minimum Detectable Effect | 最小可检测提升,用来算需要多少样本 |
| 统计功效 | Statistical Power | 真有效果时能检测出来的概率(通常取 0.8) |
| 新奇效应 | Novelty Effect | 新东西前几天天然指标好,之后回落 |
🐛 偏差类(⭐ 面试爱问)
| 术语 | 英文 | 人话解释 |
|---|---|---|
| 热门偏置 | Popularity Bias | 越热门越被推,越被推越热门 |
| 位置偏差 | Position Bias | 排第 1 位天然点击率高,和内容无关 |
| 曝光偏差 | Exposure Bias | 数据里只有系统推过的东西,没推过的没标签 ⭐ |
| 选择偏差 | Selection Bias | 训练样本不能代表真实分布 |
| 反馈循环 | Feedback Loop | 推荐→点击→训练→推得更窄,自我强化 |
| 信息茧房 | Filter Bubble | 只看到自己喜欢的,信息世界越来越窄 |
| 回音室 | Echo Chamber | 只看到同类观点,观点极化 |
| 幸存者偏差 | Survivorship Bias | 只统计留下的用户,流失的没算进来 |
| 延迟反馈 | Delayed Feedback | 转化可能几天后才发生,当时只能先标负样本 |
⚙️ 工程类
| 术语 | 英文 | 人话解释 |
|---|---|---|
| ANN | Approximate Nearest Neighbor | 近似最近邻检索,牺牲一点精度换大量速度 |
| HNSW | Hierarchical Navigable Small World | 多层图索引,目前 ANN 的主流方案 |
| IVF | Inverted File Index | 先聚类再只搜相关的簇 |
| PQ | Product Quantization | 把向量压缩成几个字节,省内存 |
| Faiss | — | Meta 的向量检索库,工业标准 |
| 特征平台 | Feature Store | 保证离线训练和在线服务用同一份特征 ⭐ |
| Training-Serving Skew | 训练服务偏差 | 离线和在线特征计算不一致导致效果差 |
| 参数服务器 | Parameter Server | 把巨大的 Embedding 表分片存到多台机器 |
| QPS | Queries Per Second | 每秒请求数 |
| P99 延迟 | — | 99% 的请求在这个时间内完成(比平均值有用得多) |
| 影子流量 | Shadow Traffic | 新模型跑真实流量但结果不展示,只观察 |
| 灰度 | Canary Release | 先给小比例用户上线,观察后再全量 |
| 一致性校验 | Consistency Check | 用线上真实请求跑离线模型,对比打分是否一致 ⭐ |
🎰 探索类
| 术语 | 英文 | 人话解释 |
|---|---|---|
| E&E | Explore & Exploit | 探索与利用的权衡 |
| 利用 | Exploit | 推模型认为最好的,短期收益高 |
| 探索 | Explore | 推不确定的,短期可能亏但换来信息 |
| 多臂老虎机 | Multi-Armed Bandit | E&E 问题的经典建模 |
| ε-greedy | — | 以 ε 的概率随机探索,其余选最优 |
| UCB | Upper Confidence Bound | 给试得少的物品加不确定性奖励 |
| Thompson Sampling | 汤普森采样 | 从收益分布里采样再排序,探索自适应 ⭐ |
| Contextual Bandit | 上下文老虎机 | 考虑用户特征的 bandit |
| IPS | Inverse Propensity Scoring | 用倾向得分加权纠正曝光偏差 |
| OPE | Off-Policy Evaluation | 用旧策略的数据评估新策略 |