🏠 总目录📚 本教程 附录B · 资源清单
📑 本页目录(点开跳转)

附录 B · 资源清单

⚠️ ADHD 警告:这一页最危险。 收藏 20 个资源 = 一个都不看。 规则:从每一类里只挑 1 个,看完了再回来挑第二个。


🥇 如果只能选三样

类型 选这个 为什么
中文书 《深度学习推荐系统》王喆 中文圈最好的入门书,架构讲得清楚
视频课 王树森《推荐系统》(B站/YouTube) 基于小红书真实业务,短视频形式,ADHD 友好 ⭐
代码 RecBole 100+ 算法统一实现,做对比实验必备

其他的先别碰。 真的。


📚 书(挑一本,别买三本)

适合 备注
《深度学习推荐系统》王喆 中文入门首选 从架构到模型到工程,覆盖面最好。有第二版
《推荐系统实践》项亮 更早的经典 协同过滤讲得透,但深度学习部分已过时。当作 CF 补充读物
《Recommender Systems: The Textbook》Aggarwal 学术完整性 英文,最全的教科书,当字典查
《Practical Recommender Systems》Falk 工程视角 Manning 出版,偏实践
《Trustworthy Online Controlled Experiments》 A/B 实验 ⭐ 微软的 A/B 实验圣经,做实验的人必读

🎥 视频课(挑一个)

时长 备注
王树森《推荐系统》 ~10 小时,切成小段 基于小红书真实场景,短视频形式最适合 ADHD。B 站/YouTube 搜「王树森 推荐系统」
李宏毅《机器学习》 不是推荐专项,但基础打得好,讲得极其清楚
Google MLCC Recommendation Systems 2 小时 免费,官方,快速过一遍概念
Stanford CS246 / CS224W 学术向,图神经网络推荐

💻 开源库(按用途挑)

快速上手

pip install implicit          # ALS/BPR,工业级,快
pip install lightfm           # 混合推荐,适合冷启动
pip install surprise          # 经典 CF 算法(教学用,别上生产)

做实验

pip install recbole           # ⭐ 100+ 算法统一框架,跑对比实验神器
pip install torch-rechub      # 中文社区,深度推荐模型
pip install deepctr-torch     # CTR 模型合集

向量检索

pip install faiss-cpu         # ⭐ Meta 出品,工业标准
pip install hnswlib           # 更轻量,支持增量插入
# 向量数据库: Milvus / Qdrant / pgvector

大规模


📊 数据集

数据集 规模 用途 链接
MovieLens 100K/1M ⭐ 入门首选,秒级迭代 grouplens.org
MovieLens 32M 3200 万评分,20 万用户 练性能 ml-32m
Amazon Reviews 2023 5.7 亿评论,33 类目 ⭐ 有丰富文本/图片元数据,适合练冷启动 HuggingFace
Criteo 4500 万 CTR 预估、特征工程 Kaggle
Avazu 4000 万 CTR 预估 Kaggle
Taobao UserBehavior 1 亿 序列推荐 阿里天池
RetailRocket / Diginetica / Yoochoose 会话推荐 Kaggle
Steam / Yelp / Last.fm 多样场景 各官网

数据集大全RUCAIBox/RecSysDatasets


📄 必读论文(8 篇,按顺序)

# 论文 年份 一句话
1 Item-to-Item Collaborative Filtering (Amazon) 2003 ItemCF 的工业实践
2 Matrix Factorization Techniques (Koren) 2009 MF 的集大成综述
3 BPR: Bayesian Personalized Ranking 2009 pairwise 排序思想
4 Wide & Deep Learning (Google) 2016 记忆 vs 泛化
5 Deep Neural Networks for YouTube Recommendations 2016 工业落地范式,工程细节最多
6 Deep Interest Network (DIN) (Alibaba) ⭐ 2018 注意力,概念最重要
7 Self-Attentive Sequential Recommendation (SASRec) 2018 序列推荐标杆
8 Actions Speak Louder than Words (HSTU) (Meta) ⭐ 2024 生成式推荐 + Scaling Law · arXiv:2402.17152

💡 读法:Abstract + Intro + 图 → 搞清楚「解决什么问题」→ 决定要不要读细节。 80% 的论文读到这就够了。

进阶(想做研究再看): - DeepFM (2017)、DCN-V2 (2020) —— 特征交叉 - MMoE (2018)、PLE (2020)、ESMM (2018) —— 多目标 - TIGER (2023) —— Semantic ID 生成式检索 - OneRec Technical Report (2025) —— 端到端生成式推荐的工业落地


🌐 持续跟踪(前沿变化快)

渠道 内容
RecSys 会议 推荐系统顶会,每年 9 月
KDD / SIGIR / WWW / CIKM / WSDM 相关顶会
Doragd/Algorithm-Practice-in-Industry ⭐ 中文工业界实践文章合集
awesome-generative-recsys 生成式推荐论文自动更新列表
Awesome-Item-ID-Gen-RecSys Semantic ID / item tokenization 综述
各厂技术博客 Netflix Tech Blog、Meta Engineering、美团技术团队、DataFunTalk
知乎「推荐系统」话题 中文讨论最活跃的地方,注意甄别质量

🧰 工程栈参考

环节 选择
消息队列 Kafka / Pulsar
流处理 Flink(主流)/ Spark Streaming
批处理 Spark / Ray
在线 KV Redis Cluster / Aerospike
向量检索 Faiss / hnswlib / Milvus / Qdrant / pgvector
训练 PyTorch / TorchRec
服务 Triton / TorchServe / ONNX Runtime
特征平台 Feast / Tecton
实验平台 自研 / GrowthBook
监控 Prometheus + Grafana

💡 小团队最小方案:PostgreSQL(+pgvector) + Redis + Python + cron。 别一上来就 Kafka + Flink + Feast。


🧭 ADHD 专属:怎么用这一页

  ❌ 错误用法:
     打开这一页 → 收藏 15 个链接 → 关掉 → 再也不看

  ✅ 正确用法:
     1. 现在只做一件事:从「如果只能选三样」里挑 1 个
     2. 把它加进日程(不是收藏夹)
     3. 看完了、用了,再回到这一页挑下一个

收藏夹是 ADHD 的黑洞。 加进日程才有用。


👉 回到 README

打卡记录保存在你的浏览器里,首页能看到总进度