📑 本页目录(点开跳转)
附录 B · 资源清单
⚠️ ADHD 警告:这一页最危险。 收藏 20 个资源 = 一个都不看。 规则:从每一类里只挑 1 个,看完了再回来挑第二个。
🥇 如果只能选三样
| 类型 | 选这个 | 为什么 |
|---|---|---|
| 中文书 | 《深度学习推荐系统》王喆 | 中文圈最好的入门书,架构讲得清楚 |
| 视频课 | 王树森《推荐系统》(B站/YouTube) | 基于小红书真实业务,短视频形式,ADHD 友好 ⭐ |
| 代码 | RecBole | 100+ 算法统一实现,做对比实验必备 |
其他的先别碰。 真的。
📚 书(挑一本,别买三本)
| 书 | 适合 | 备注 |
|---|---|---|
| 《深度学习推荐系统》王喆 ⭐ | 中文入门首选 | 从架构到模型到工程,覆盖面最好。有第二版 |
| 《推荐系统实践》项亮 | 更早的经典 | 协同过滤讲得透,但深度学习部分已过时。当作 CF 补充读物 |
| 《Recommender Systems: The Textbook》Aggarwal | 学术完整性 | 英文,最全的教科书,当字典查 |
| 《Practical Recommender Systems》Falk | 工程视角 | Manning 出版,偏实践 |
| 《Trustworthy Online Controlled Experiments》 | A/B 实验 | ⭐ 微软的 A/B 实验圣经,做实验的人必读 |
🎥 视频课(挑一个)
| 课 | 时长 | 备注 |
|---|---|---|
| 王树森《推荐系统》 ⭐ | ~10 小时,切成小段 | 基于小红书真实场景,短视频形式最适合 ADHD。B 站/YouTube 搜「王树森 推荐系统」 |
| 李宏毅《机器学习》 | 长 | 不是推荐专项,但基础打得好,讲得极其清楚 |
| Google MLCC Recommendation Systems | 2 小时 | 免费,官方,快速过一遍概念 |
| Stanford CS246 / CS224W | 长 | 学术向,图神经网络推荐 |
💻 开源库(按用途挑)
快速上手
pip install implicit # ALS/BPR,工业级,快
pip install lightfm # 混合推荐,适合冷启动
pip install surprise # 经典 CF 算法(教学用,别上生产)
做实验
pip install recbole # ⭐ 100+ 算法统一框架,跑对比实验神器
pip install torch-rechub # 中文社区,深度推荐模型
pip install deepctr-torch # CTR 模型合集
向量检索
pip install faiss-cpu # ⭐ Meta 出品,工业标准
pip install hnswlib # 更轻量,支持增量插入
# 向量数据库: Milvus / Qdrant / pgvector
大规模
- NVIDIA Merlin —— 端到端 GPU 推荐流水线
- TorchRec —— PyTorch 官方的大规模推荐库(分布式 Embedding)
- meta-recsys/generative-recommenders —— HSTU 官方实现 ⭐
- OpenOneRec —— 快手开源的生成式推荐基础模型
📊 数据集
| 数据集 | 规模 | 用途 | 链接 |
|---|---|---|---|
| MovieLens 100K/1M | 小 | ⭐ 入门首选,秒级迭代 | grouplens.org |
| MovieLens 32M | 3200 万评分,20 万用户 | 练性能 | ml-32m |
| Amazon Reviews 2023 | 5.7 亿评论,33 类目 | ⭐ 有丰富文本/图片元数据,适合练冷启动 | HuggingFace |
| Criteo | 4500 万 | CTR 预估、特征工程 | Kaggle |
| Avazu | 4000 万 | CTR 预估 | Kaggle |
| Taobao UserBehavior | 1 亿 | 序列推荐 | 阿里天池 |
| RetailRocket / Diginetica / Yoochoose | 中 | 会话推荐 | Kaggle |
| Steam / Yelp / Last.fm | 中 | 多样场景 | 各官网 |
数据集大全:RUCAIBox/RecSysDatasets
📄 必读论文(8 篇,按顺序)
| # | 论文 | 年份 | 一句话 |
|---|---|---|---|
| 1 | Item-to-Item Collaborative Filtering (Amazon) | 2003 | ItemCF 的工业实践 |
| 2 | Matrix Factorization Techniques (Koren) | 2009 | MF 的集大成综述 |
| 3 | BPR: Bayesian Personalized Ranking | 2009 | pairwise 排序思想 |
| 4 | Wide & Deep Learning (Google) | 2016 | 记忆 vs 泛化 |
| 5 | Deep Neural Networks for YouTube Recommendations ⭐ | 2016 | 工业落地范式,工程细节最多 |
| 6 | Deep Interest Network (DIN) (Alibaba) ⭐ | 2018 | 注意力,概念最重要 |
| 7 | Self-Attentive Sequential Recommendation (SASRec) | 2018 | 序列推荐标杆 |
| 8 | Actions Speak Louder than Words (HSTU) (Meta) ⭐ | 2024 | 生成式推荐 + Scaling Law · arXiv:2402.17152 |
💡 读法:Abstract + Intro + 图 → 搞清楚「解决什么问题」→ 决定要不要读细节。 80% 的论文读到这就够了。
进阶(想做研究再看): - DeepFM (2017)、DCN-V2 (2020) —— 特征交叉 - MMoE (2018)、PLE (2020)、ESMM (2018) —— 多目标 - TIGER (2023) —— Semantic ID 生成式检索 - OneRec Technical Report (2025) —— 端到端生成式推荐的工业落地
🌐 持续跟踪(前沿变化快)
| 渠道 | 内容 |
|---|---|
| RecSys 会议 | 推荐系统顶会,每年 9 月 |
| KDD / SIGIR / WWW / CIKM / WSDM | 相关顶会 |
| Doragd/Algorithm-Practice-in-Industry | ⭐ 中文工业界实践文章合集 |
| awesome-generative-recsys | 生成式推荐论文自动更新列表 |
| Awesome-Item-ID-Gen-RecSys | Semantic ID / item tokenization 综述 |
| 各厂技术博客 | Netflix Tech Blog、Meta Engineering、美团技术团队、DataFunTalk |
| 知乎「推荐系统」话题 | 中文讨论最活跃的地方,注意甄别质量 |
🧰 工程栈参考
| 环节 | 选择 |
|---|---|
| 消息队列 | Kafka / Pulsar |
| 流处理 | Flink(主流)/ Spark Streaming |
| 批处理 | Spark / Ray |
| 在线 KV | Redis Cluster / Aerospike |
| 向量检索 | Faiss / hnswlib / Milvus / Qdrant / pgvector |
| 训练 | PyTorch / TorchRec |
| 服务 | Triton / TorchServe / ONNX Runtime |
| 特征平台 | Feast / Tecton |
| 实验平台 | 自研 / GrowthBook |
| 监控 | Prometheus + Grafana |
💡 小团队最小方案:PostgreSQL(+pgvector) + Redis + Python + cron。 别一上来就 Kafka + Flink + Feast。
🧭 ADHD 专属:怎么用这一页
❌ 错误用法:
打开这一页 → 收藏 15 个链接 → 关掉 → 再也不看
✅ 正确用法:
1. 现在只做一件事:从「如果只能选三样」里挑 1 个
2. 把它加进日程(不是收藏夹)
3. 看完了、用了,再回到这一页挑下一个
收藏夹是 ADHD 的黑洞。 加进日程才有用。