🏠 总目录📚 本教程 10c · 语音与视频 ← →
📑 本页目录(点开跳转)

10c · 语音与视频

⏱ 20 分钟 | ⭐ 两个模态,一个共同的走向:也被 token 化了


🎯 一句话

语音和视频这两年的共同变化是:它们也被切成 token,进了同一个 Transformer。 语音因此有了端到端对话(不再走「语音→文字→LLM→文字→语音」那条长链路), 视频则撞上了 token 爆炸这堵墙。

⚠️ 这一页不依赖前两页,可以直接看。


🔊 三、语音

关键信息

💡 注意那个趋势:语音也被「token 化」了——又回到了第一句话:万物皆 token。


🎬 四、视频

关键信息

理解:把视频当"一串图片 + 时间维度"
挑战是 token 爆炸(1 分钟视频可能上万 token)
关键技术是时空压缩、关键帧抽取
生成:扩散模型 + 时间维度一致性
挑战是"物体在帧间不能乱变"
时空注意力、3D VAE

视频是当前算力消耗最大、进展最快的方向之一。


📦 深挖的话要学什么

📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。 ⚠️ 先说结论:这一章是全导论「要外找」比例最高的一章。 本库是一套以语言模型为主干的教程,图像生成、语音、视频这三块站内几乎是空白—— 与其让你按图索骥扑空,不如在这里说清楚。

视觉理解(📗 = 本组前几页已讲):ViT 原理 | 📗 CLIP 的 InfoNCE 与温度系数(10d)| 📗 投影层两条路线:LLaVA 的 MLP vs BLIP-2 的 Q-Former(10d)| 高分辨率处理(切图 / AnyRes 策略)、SigLIP 之后的编码器演进、多模态对齐的数据配方、视频理解、OCR 与文档理解、多模态 RAG

→ 📙 半有(只有 ViT 这一项):ML基础 14 · 通往Transformer 讲了 ViT 最该先知道的那件事——归纳偏置强弱和数据量的关系:ImageNet(1.3M) 上 ResNet 赢、拐点在 ImageNet-21k(14M) 附近、300M 时 ViT 赢,"苦涩的教训"的但书是「数据和算力足够」。

Kaggle 09 · 任务类型与模型架构 的表里有 ViT 的参数量和「Patch Embedding」一行,以及数据量 >50K 才考虑 ViT/Swin 的选型判据。

但 ViT 的完整架构(patch 怎么切、cls token、位置编码怎么加)站内没有。

→ 📕 其余全部要外找:AnyRes 切图、SigLIP、多模态对齐数据配方、OCR 与文档理解、多模态 RAG,站内一个字都没有。⚠️ 其中「OCR 与文档理解 + 多模态 RAG」值得单独提醒——08d · RAG 进阶方向 的深挖清单里「文档解析(PDF/表格/扫描件)」同样是 📕,这两章在这一点上是同一个空洞,做文档问答的话要有心理准备。

语音:梅尔频谱、Whisper 架构、音频 token 化(残差量化——和推荐算法第 14 章的 Semantic ID 是同一个技术!)、TTS 声码器、端到端语音对话、实时流式处理

→ 📙 半有(只有残差量化这一项,但它讲得很透):推荐算法 14 · 生成式推荐 的「Semantic ID」一节讲的就是 RQ-VAE 残差量化——把连续向量逐层逼近、每层挑一个码字,得到 <c₁=42, c₂=17, c₃=203, c₄=88> 这样从粗到细的离散码。音频 token 化用的是同一套机制,只是被量化的向量来自音频编码器而不是物品编码器。 ⭐ 这是全站跨度最大的一条同构,值得专门去一趟。

→ 📕 其余要外找:梅尔频谱、Whisper 架构、TTS 声码器、端到端语音对话,站内没有。

视频:时空注意力、3D VAE、关键帧策略、视频生成的一致性

→ 📕 整块要外找:站内没有任何一章涉及视频。这是本库最外侧的边界。

需要的前置:第 2 章 Transformer。图像生成部分需要一点概率论(扩散过程),是本导论里数学要求最高的一块。


⚖️ 要不要深挖

你的情况 建议
只做文本应用 ⛔ 知道 VLM 怎么工作、图片吃 token 就够
要做图像/设计/创意工具 ✅ 深挖扩散模型
要做语音助手/客服/播客工具 ✅ 深挖 ASR/TTS + 端到端语音
要做文档处理(PDF/表格/图表) ✅ 深挖 VLM + 多模态 RAG(和第 8 章配合)
想全面了解 AI ✅ 至少把视觉理解那部分学了

🔑 我的判断:这块独立性最强——它和站内其余几套的重叠很少,可以完全独立成一套。

⭐ 但有一个重要的例外:如果你做过推荐或搜索,CLIP 的对比学习你其实已经会了——它就是推荐算法 08 · 深度学习推荐模型的双塔 in-batch 负采样 + 温度系数。 所以「视觉理解」这半边的入门成本比它看起来低得多;真正陌生的是「图像生成」那半边。

但也正因为独立,它的优先级取决于你的业务方向,而不是技术逻辑: - 做文本应用 → 优先级最低 - 做内容/设计/语音产品 → 优先级最高

另外它内部还能再拆:视觉理解(偏应用,容易)和图像生成(偏原理,需要概率论)是两个不同难度的东西。


🔗 想再深一层,去哪一套

去哪 为什么
主线 1 · 文字怎样进入模型 「万物皆 token」的原版:文字是怎么被切成 token 的,音频和视频照抄的是这套思路
推荐算法 14 · 生成式推荐 ⭐ 音频的残差量化和那一章的 Semantic ID 是同一个技术
AI基础设施 16 · KV Cache 视频「1 分钟上万 token」为什么是硬约束:每个 token 都要占一份缓存
AI全栈 05 · 流式输出 端到端语音对话「延迟低、可打断」在工程上靠什么实现

✅ 检查点

  1. 语音领域「token 化」的趋势体现了什么共同思想?
  2. 端到端语音对话相比「语音→文字→LLM→文字→语音」那条链路,好在哪三点?
  3. 视频理解的主要挑战是什么?靠哪两类技术缓解?
  4. 视频生成比图像生成多了一个什么约束?
👀 答案
  1. 万物皆 token——把不同模态离散化成 token 后,都能交给同一个 Transformer 处理。(音频的残差量化和推荐算法 Semantic ID 是同一技术。)
  2. 延迟低、能保留语气情绪、可打断。因为音频 token 直接进 LLM,不再经过文字这个中转 —— 而文字这一步恰恰会把语气和情绪丢掉。
  3. token 爆炸:1 分钟视频可能上万 token。靠时空压缩和关键帧抽取两类技术缓解。
  4. 时间维度的一致性 —— 物体在帧间不能乱变。对应技术是时空注意力和 3D VAE。

🛑 多模态到这里就讲完了

⚡ 走神救援

先记住这几件事

下一节 👉 11-评测体系.md

打卡记录保存在你的浏览器里,首页能看到总进度