📑 本页目录(点开跳转)
10c · 语音与视频
⏱ 20 分钟 | ⭐ 两个模态,一个共同的走向:也被 token 化了
🎯 一句话
语音和视频这两年的共同变化是:它们也被切成 token,进了同一个 Transformer。 语音因此有了端到端对话(不再走「语音→文字→LLM→文字→语音」那条长链路), 视频则撞上了 token 爆炸这堵墙。
⚠️ 这一页不依赖前两页,可以直接看。
🔊 三、语音
关键信息
- ASR 语音识别(听)
- Whisper 类:音频 → 梅尔频谱图 → Encoder-Decoder → 文字
- 实际上把音频当"图"处理,再用序列模型转文字
- TTS 语音合成(说)
- 文本 → 声学特征 → 声码器 → 波形
- 现在流行:直接把音频离散化成 token,用 LLM 的方式生成 ⭐
- 端到端语音对话(2024+)
- 不再走 语音→文字→LLM→文字→语音 的链路
- 而是音频 token 直接进 LLM
- ✅ 延迟低、能保留语气情绪、可打断
💡 注意那个趋势:语音也被「token 化」了——又回到了第一句话:万物皆 token。
🎬 四、视频
关键信息
视频是当前算力消耗最大、进展最快的方向之一。
📦 深挖的话要学什么
📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。 ⚠️ 先说结论:这一章是全导论「要外找」比例最高的一章。 本库是一套以语言模型为主干的教程,图像生成、语音、视频这三块站内几乎是空白—— 与其让你按图索骥扑空,不如在这里说清楚。
视觉理解(📗 = 本组前几页已讲):ViT 原理 | 📗 CLIP 的 InfoNCE 与温度系数(10d)| 📗 投影层两条路线:LLaVA 的 MLP vs BLIP-2 的 Q-Former(10d)| 高分辨率处理(切图 / AnyRes 策略)、SigLIP 之后的编码器演进、多模态对齐的数据配方、视频理解、OCR 与文档理解、多模态 RAG
→ 📙 半有(只有 ViT 这一项):ML基础 14 · 通往Transformer 讲了 ViT 最该先知道的那件事——归纳偏置强弱和数据量的关系:ImageNet(1.3M) 上 ResNet 赢、拐点在 ImageNet-21k(14M) 附近、300M 时 ViT 赢,"苦涩的教训"的但书是「数据和算力足够」。
Kaggle 09 · 任务类型与模型架构 的表里有 ViT 的参数量和「Patch Embedding」一行,以及数据量 >50K 才考虑 ViT/Swin 的选型判据。
但 ViT 的完整架构(patch 怎么切、cls token、位置编码怎么加)站内没有。
→ 📕 其余全部要外找:AnyRes 切图、SigLIP、多模态对齐数据配方、OCR 与文档理解、多模态 RAG,站内一个字都没有。⚠️ 其中「OCR 与文档理解 + 多模态 RAG」值得单独提醒——08d · RAG 进阶方向 的深挖清单里「文档解析(PDF/表格/扫描件)」同样是 📕,这两章在这一点上是同一个空洞,做文档问答的话要有心理准备。
语音:梅尔频谱、Whisper 架构、音频 token 化(残差量化——和推荐算法第 14 章的 Semantic ID 是同一个技术!)、TTS 声码器、端到端语音对话、实时流式处理
→ 📙 半有(只有残差量化这一项,但它讲得很透):推荐算法 14 · 生成式推荐 的「Semantic ID」一节讲的就是 RQ-VAE 残差量化——把连续向量逐层逼近、每层挑一个码字,得到 <c₁=42, c₂=17, c₃=203, c₄=88> 这样从粗到细的离散码。音频 token 化用的是同一套机制,只是被量化的向量来自音频编码器而不是物品编码器。 ⭐ 这是全站跨度最大的一条同构,值得专门去一趟。
→ 📕 其余要外找:梅尔频谱、Whisper 架构、TTS 声码器、端到端语音对话,站内没有。
视频:时空注意力、3D VAE、关键帧策略、视频生成的一致性
→ 📕 整块要外找:站内没有任何一章涉及视频。这是本库最外侧的边界。
需要的前置:第 2 章 Transformer。图像生成部分需要一点概率论(扩散过程),是本导论里数学要求最高的一块。
⚖️ 要不要深挖
| 你的情况 | 建议 |
|---|---|
| 只做文本应用 | ⛔ 知道 VLM 怎么工作、图片吃 token 就够 |
| 要做图像/设计/创意工具 | ✅ 深挖扩散模型 |
| 要做语音助手/客服/播客工具 | ✅ 深挖 ASR/TTS + 端到端语音 |
| 要做文档处理(PDF/表格/图表) | ✅ 深挖 VLM + 多模态 RAG(和第 8 章配合) |
| 想全面了解 AI | ✅ 至少把视觉理解那部分学了 |
🔑 我的判断:这块独立性最强——它和站内其余几套的重叠很少,可以完全独立成一套。
⭐ 但有一个重要的例外:如果你做过推荐或搜索,CLIP 的对比学习你其实已经会了——它就是推荐算法 08 · 深度学习推荐模型的双塔 in-batch 负采样 + 温度系数。 所以「视觉理解」这半边的入门成本比它看起来低得多;真正陌生的是「图像生成」那半边。
但也正因为独立,它的优先级取决于你的业务方向,而不是技术逻辑: - 做文本应用 → 优先级最低 - 做内容/设计/语音产品 → 优先级最高
另外它内部还能再拆:视觉理解(偏应用,容易)和图像生成(偏原理,需要概率论)是两个不同难度的东西。
🔗 想再深一层,去哪一套
| 去哪 | 为什么 |
|---|---|
| 主线 1 · 文字怎样进入模型 | 「万物皆 token」的原版:文字是怎么被切成 token 的,音频和视频照抄的是这套思路 |
| 推荐算法 14 · 生成式推荐 | ⭐ 音频的残差量化和那一章的 Semantic ID 是同一个技术 |
| AI基础设施 16 · KV Cache | 视频「1 分钟上万 token」为什么是硬约束:每个 token 都要占一份缓存 |
| AI全栈 05 · 流式输出 | 端到端语音对话「延迟低、可打断」在工程上靠什么实现 |
✅ 检查点
- 语音领域「token 化」的趋势体现了什么共同思想?
- 端到端语音对话相比「语音→文字→LLM→文字→语音」那条链路,好在哪三点?
- 视频理解的主要挑战是什么?靠哪两类技术缓解?
- 视频生成比图像生成多了一个什么约束?
👀 答案
- 万物皆 token——把不同模态离散化成 token 后,都能交给同一个 Transformer 处理。(音频的残差量化和推荐算法 Semantic ID 是同一技术。)
- 延迟低、能保留语气情绪、可打断。因为音频 token 直接进 LLM,不再经过文字这个中转 —— 而文字这一步恰恰会把语气和情绪丢掉。
- token 爆炸:1 分钟视频可能上万 token。靠时空压缩和关键帧抽取两类技术缓解。
- 时间维度的一致性 —— 物体在帧间不能乱变。对应技术是时空注意力和 3D VAE。
🛑 多模态到这里就讲完了
⚡ 走神救援
先记住这几件事
- 语音要区分识别、合成和实时对话,三者的输入输出与延迟要求不同。
- 视频不仅有画面,还必须保留时间顺序和跨帧一致性。
- 压缩、采样与端到端处理都在节省成本与保留信息之间取舍。
下一节 👉 11-评测体系.md