📑 本页目录(点开跳转)
07 · 本地部署与开源生态
⏱ 32 分钟 | ⭐ 门槛最低、见效最快的一块
🎯 一句话
现在在自己电脑上跑一个能用的大模型,门槛已经低到「装个软件、下个文件」。真正的问题不是「能不能跑」,而是「什么时候值得跑」。
🚦 决策:什么时候该自建
✅ 该本地/自建的场景
├─ 数据不能出内网(医疗、金融、政务、法务)
├─ 稳定大流量,自建单价远低于 API
├─ 需要微调后的专有模型(第 5 章)
├─ 需要极低延迟(本地无网络往返)
├─ 离线环境
└─ 学习和实验(免费随便玩 ⭐)
⛔ 不该的场景
├─ 流量小且不稳定 → API 按量付费更划算
├─ 需要最强能力 → 顶尖闭源模型仍有优势
├─ 团队没有运维能力 → 自建的隐性成本是人力
└─ 快速验证想法阶段 → 先用 API 跑通再说
💰 粗算一笔账:一张 24GB 消费级显卡 ≈ 几千到万把块。 如果你每月 API 花费不到几百块,自建在经济上不成立——但作为学习投资另说。
💸 自建的"隐性成本"清单(算账时最容易漏)
显性成本:显卡 / 云 GPU 租金
⭐ 隐性成本(往往更贵):
├─ 运维人力:模型更新、故障排查、扩容(这是最大的一笔)
├─ 闲置成本:GPU 按小时计费,流量低谷时也在烧钱
├─ 能力差距:自建模型效果不如顶尖闭源,可能需要更多工程弥补
├─ 迭代速度:闭源模型每几个月免费变强,自建的不会
└─ 机会成本:花在运维上的时间没花在产品上
🔑 一个反直觉的结论:自建往往不是"更便宜",而是"用钱换控制权"。 如果你的真实需求是合规、隐私、可控,自建就值; 如果只是"觉得 API 贵",先去做 Prefix Caching 和提示词优化(第 6 章), 那些的投入产出比高得多。
🧰 三档工具(按易用度排)
① Ollama —— 最简单,一行命令
ollama run qwen3
✅ 自动下载、自动量化、自带 OpenAI 兼容 API
✅ Mac/Windows/Linux 通吃
👉 个人使用、开发调试、第一次尝试,选它
② llama.cpp / LM Studio —— 更可控
✅ GGUF 格式,CPU+GPU 混合推理(显存不够可以卸载到内存)
✅ LM Studio 有图形界面,适合不想碰命令行的人
👉 硬件受限、要精细控制量化档位时
③ vLLM / SGLang —— 生产级
✅ 连续批处理、PagedAttention(第 6 章)、高并发
❌ 要 Linux + NVIDIA 卡,配置复杂
👉 真正对外提供服务时
💾 硬件对照表(量级参考)
| 模型规模 | 4bit 量化后显存 | 能跑的设备 |
|---|---|---|
| 1–4B | 1–3 GB | 几乎任何设备,手机也行 |
| 7–8B | 4–6 GB | 主流游戏显卡、M 系列 Mac ⭐ 甜点区 |
| 14B | 8–10 GB | 12GB+ 显卡 |
| 32B | 18–22 GB | 24GB 显卡(4090 等) |
| 70B | 35–45 GB | 双卡 / A100 / 大内存 Mac |
| 200B+ MoE | 100GB+ | 多卡服务器 |
⚠️ 最后一行最容易让人算错账,值得单独说一句。 MoE 的宣传口径是「激活参数只有 37B」,于是很多人以为它能塞进 70B 那一档的机器——不能。 ⭐ 权重要全部驻留显存,路由才有得选:这一步激活哪几个专家是运行时才知道的, 而且同一个 batch 里不同 token 会路由到不同专家,你没法预先只加载一部分。 所以显存按总参数算,算力按激活参数算——这就是这一行「100GB+」的由来。 🔗 02d · MoE 混合专家 讲清了为什么只替换 FFN、Top-k 路由怎么选、 以及「便宜」到底便宜在哪一项(省的是 FLOPs 和推理延迟,不是显存和采购成本)。
💡 Mac 的特殊优势:统一内存架构,M 系列大内存机型可以跑很大的模型(虽然速度不如独显)。 甜点区是 7–14B:能力够用日常任务,硬件门槛低。
🌍 开源模型生态(会变,记结构别记名字)
主要开源系列(2026 年前后的格局)
├─ Qwen(阿里) —— 中文强、尺寸齐全、生态活跃
├─ DeepSeek —— 推理和代码能力突出、MoE 架构
├─ Llama(Meta) —— 生态最广、工具链最全
├─ Mistral —— 欧洲、效率导向
├─ Gemma(Google) —— 小尺寸质量高
└─ 各种垂直微调版本 —— 代码/医疗/法律等
选型看四点: 1. 许可证 ⭐ —— 能不能商用?有没有用户数限制?这是最容易踩的坑 2. 中文能力 —— 中文场景优先看国产系列 3. 尺寸 —— 有没有适合你硬件的档位 4. 生态 —— 有没有现成的量化版本、微调脚本、社区支持
⚠️ 时效警告:模型名字和排名几个月就变。上面的列表只用来理解「有哪几类玩家」。 实际选型时去看当前的开源榜单(第 11 章讲怎么正确看榜)。
🔌 关键实践:OpenAI 兼容接口
几乎所有本地推理框架都提供 OpenAI 兼容的 API。这意味着:
# 你写的代码几乎不用改,只改 base_url
client = OpenAI(
base_url="http://localhost:11434/v1", # 本地 Ollama
api_key="ollama" # 随便填
)
🔑 实用建议:写代码时把模型接口抽象一层(智能体教程第 1 章那个
MockModel就是这个思路), 就能在「本地模型 / 云 API / 不同厂商」之间随意切换,避免被锁死。
⚠️ 但"兼容"不等于"等价"——四个会咬你的差异:
| 差异 | 表现 |
|---|---|
| 工具调用格式 ⭐ | 开源模型的 function calling 支持参差不齐,有的要靠提示词模拟 |
| 系统提示词的遵循度 | 小模型经常"忘了"系统提示词里的约束 |
| 上下文窗口和实际可用长度 | 标称 128K,实际超过 32K 就明显退化 |
| 输出格式稳定性 | 让它输出 JSON,闭源模型基本不会崩,小模型经常多个逗号 |
💡 所以切换模型后必须重跑评测(第 11 章)—— "接口兼容"只保证代码能跑,不保证效果一样。
🚀 30 分钟上手路线(真的建议做一次)
① 装 Ollama(5 分钟)
② ollama run qwen3:8b ← 聊两句,感受一下速度
③ 换个小的:ollama run qwen3:1.7b ← 对比质量和速度差距 ⭐
④ 用 Python 连上去(OpenAI 兼容),跑一个你熟悉的提示词
⑤ 打开任务管理器看显存占用 ← 把第 6 章的抽象概念变成具体数字 ⭐
💡 第 ③ 和 ⑤ 步是重点: 亲眼看到"8B 和 1.7B 差多少"、"4bit 量化到底占多少显存", 比读十篇文章都管用。这就是本章说的"体验价值"。
🔗 和你已知的关系
左列有的来自日常用 LLM 的经验,有的在站内别的板块讲过——碰上过哪几条就从哪几条接进来,一条没碰过也不影响读这一章。
| 你可能已经知道的 | 这一章的对应 |
|---|---|
| MockModel 可替换的设计(智能体第 1 章) | 抽象一层就能切换本地/云 |
| 量化、vLLM(第 6 章) | 这一章是它的落地工具 |
| 数据不出内网的合规需求 | 本地部署是唯一解 |
想接着深挖,去这几处:
| 去哪 | 为什么 |
|---|---|
| AI基础设施 20 | 自建之后真正要做的事:服务化、限流、降级路径 |
| AI基础设施 03 | ⭐ 硬件对照表背后的那笔账 —— 显存到底被什么占满了 |
| 上线之后 18 | 「隐性成本清单」的容量侧:峰值该按什么算 |
📦 深挖的话要学什么
📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。 (这份清单以前只列词不说去哪,指到的坑有些站内根本没挖过,按图索骥会扑空。)
- 部署工程:Docker 化、多卡张量并行、负载均衡、健康检查、模型热切换 → 📙 半有:多卡张量并行在 AI基础设施 12 · 张量并行(一台机器装不下 70B 时,权重具体怎么切、切完要付多少通信代价——这正是本章硬件对照表背后的那笔账);健康检查和负载均衡在 AI基础设施 20 · 推理服务化 的「生产必备的五件事」里,⚠️ 那里点出两个反直觉的点:健康检查不能只 ping,要真跑一次推理;客户端断开必须立刻停止生成并释放 KV Cache(用户关了页面服务器还在生成 2000 token,占着槽位不放,高并发下显著吃容量)。只有 Docker 化和模型热切换的具体做法站内没有,要外找
- 性能压测:吞吐/TTFT/TPOT 测量、容量规划、成本建模 → 📗 本库有:AI基础设施 20 · 推理服务化 的「先定 SLO 再谈优化」+「压测:画出你的延迟-吞吐曲线」,该监控什么也在同一章(⭐ KV Cache 使用率是最该盯的容量预警信号);成本模型在 AI基础设施 23 · 可观测性与成本。本章那张"隐性成本清单"是提醒你别漏项,这两章是教你怎么把每一项算成数字
- 量化实操:不同量化档位的质量-速度实测对比(自己跑一遍最有说服力) → 📗 本库有:AI基础设施 18 · 量化 的「质量评估:这一步不能省」。⚠️ 里面有一条直接关系到你自建成败的坑:"别人测 AWQ 几乎无损,到我这里就掉了",通常不是方法问题,是校准集不是你的分布——所以质量评估必须用你自己的业务数据跑,抄别人的档位结论没用
- 多 LoRA 服务:一个基座热挂多个适配器(配合第 5 章)。 🔗 这一条不用等「深挖」,AI基础设施 20 · 推理服务化 已经写了: 它省的是「每个租户开一份完整实例」的显存,而且主流引擎大多支持,但要在选型时单独确认—— 这是那一章明确点出的一个「容易漏掉的能力」,等部署完再发现引擎不支持就要重来。 同一节还有七个推理引擎的横评 + 一棵四问决策树,回答的正是这一章刻意没展开的「决定自建之后,到底用 vLLM 还是 SGLang 还是 TensorRT-LLM」。 ⚠️ 顺带纠一个常见误判:引擎之间通常只差 20–50%,而配置有没有调对差的是几倍——先调配置再换引擎。 (即 📗 本库有。)
- 边缘部署:手机/嵌入式设备、ONNX/CoreML/TensorRT 转换 → 📕 要外找:站内只在 推荐算法 15 · 工程落地 的工具表里出现过 ONNX 这个词(一行,说的是"编译期优化能提 1.5–3×"),没有任何一章讲模型怎么转、转完精度掉多少、手机端怎么跑。这是本导论覆盖最薄的角落之一,别指望在站内找到答案
- 私有化整套方案:模型 + 向量库 + 网关 + 监控的完整内网架构 → 📙 半有:这套架构的每一块站内都有——模型服务在 AI基础设施 20,向量库选型在 推荐算法 10 · 向量检索与ANN,监控在 AI基础设施 23 · 可观测性与成本 和 模型上线之后 05 · 该监控什么。缺的恰恰是"把它们接起来"的那张图:网关层怎么设计、内网怎么隔离、各组件之间的失败怎么兜——这部分要外找
需要的前置:Linux + Docker 基础。几乎不需要理论,纯工程。
⚖️ 要不要深挖
| 你的情况 | 建议 |
|---|---|
| 从没跑过本地模型 | ✅ 强烈建议花 30 分钟装个 Ollama 跑一次——认知冲击很大,且免费 |
| 有合规/隐私硬需求 | ✅ 必须深挖,配合第 6 章 |
| 想省 API 钱 | 🟡 先算账,多数个人场景自建不划算 |
| 做企业私有化交付 | ✅ 这是核心交付能力 |
| 纯做应用、用云 API | ⛔ 知道有这回事就行 |
🔑 我的判断:这块知识密度最低但体验价值最高。 它不值得单独做一整套教程(内容撑不满,且工具变化快), 但「花半小时跑一次本地模型」这件事本身,对建立直觉很有用—— 你会立刻理解量化、显存、速度这些抽象概念到底意味着什么。
建议:并入第 6 章推理优化,作为它的实操部分。
✅ 检查点
- 什么情况下该自建、什么情况下不该?
- 自建的"隐性成本"有哪些?为什么说自建往往不是"更便宜"而是"用钱换控制权"?
- 只是觉得 API 贵,第一步该做什么?
- 个人用户想第一次跑本地模型,用什么工具最简单?
- 7B 模型 4bit 量化后大概要多少显存?甜点区在哪?
- 开源模型选型要看哪四点?哪一点最容易踩坑?
- 为什么建议把模型接口抽象一层?"OpenAI 兼容"有哪四个不等价的地方?
- 30 分钟上手路线里,哪两步最有价值?
👀 答案
- 该:数据不出内网、稳定大流量、需要专有微调模型、极低延迟、离线、学习实验。不该:流量小不稳定、需要最强能力、团队没运维能力、快速验证阶段。
- 隐性成本:运维人力(最大一笔)、GPU 闲置成本、能力差距、迭代速度落后、机会成本。之所以说是换控制权,是因为算上隐性成本后经济优势往往消失——真实价值在合规、隐私、可控。
- 先做 Prefix Caching 和提示词优化(第 6 章)——投入产出比高得多,而且不需要任何运维。
- Ollama,一行命令
ollama run <model>,自动下载量化并提供 OpenAI 兼容 API。 - 约 4–6 GB,主流游戏显卡或 M 系列 Mac 都能跑。甜点区是 7–14B——能力够用日常任务,硬件门槛低。
- 许可证、中文能力、尺寸档位、生态支持。许可证最容易踩坑(能否商用、有无用户数限制)。
- 能在本地模型/不同云厂商之间自由切换,避免被单一供应商锁死。四个不等价:①工具调用格式(开源支持参差,有的靠提示词模拟)②系统提示词遵循度(小模型经常"忘了")③标称窗口 ≠ 实际可用长度(标 128K,超 32K 就退化)④输出格式稳定性(小模型 JSON 经常崩)。所以换模型后必须重跑评测。
- 第 ③ 步(8B vs 1.7B 对比)和第 ⑤ 步(看显存占用)——亲眼看到差距和数字,比读十篇文章管用,这就是本章的"体验价值"。
🛑 可以停在这里
⚡ 走神救援
本地部署门槛已极低。工具三档:Ollama(一行命令,个人首选)→llama.cpp/LM Studio(GGUF,CPU+GPU混合)→vLLM/SGLang(生产级)。硬件:7-14B是甜点区(4-10GB显存),Mac统一内存可跑大模型。⭐算账要算隐性成本:运维人力(最大一笔)/GPU闲置/能力差距/迭代速度落后/机会成本——自建往往不是"更便宜"而是"用钱换控制权";只是觉得API贵的话,先去做Prefix Caching和提示词优化,投入产出比高得多。开源生态Qwen/DeepSeek/Llama/Mistral/Gemma,选型看许可证(最易踩坑)/中文/尺寸/生态。都提供OpenAI兼容接口→代码抽象一层可自由切换,⚠️但"兼容"≠"等价":工具调用格式、系统提示词遵循度、标称窗口≠实际可用长度(标128K超32K就退化)、JSON输出稳定性——换模型后必须重跑评测。⭐强烈建议花30分钟跑一次:重点是对比8B vs 1.7B、看显存占用——把抽象概念变成具体数字。
下一节 👉 08-RAG深水区.md