📑 本页目录(点开跳转)
07b · 开源生态怎么选,以及要不要自建
⏱ 26 分钟 | ⭐ 自建往往不是「更便宜」,而是「用钱换控制权」
🎯 一句话
上一页证明了「能跑」,这一页回答「值不值得一直这么跑」。 把隐性成本算进去之后,多数场景自建并不更省钱——它买的是合规、隐私和可控;而真要在开源模型里挑一个,最容易踩的坑不是能力,是许可证。
🚦 决策:什么时候该自建
关键信息
- ✅ 该本地/自建的场景
- 数据不能出内网(医疗、金融、政务、法务)
- 稳定大流量,自建单价远低于 API
- 需要微调后的专有模型(第 5 章)
- 需要极低延迟(本地无网络往返)
- 离线环境
- 学习和实验(免费随便玩 ⭐)
- ⛔ 不该的场景
- 流量小且不稳定 → API 按量付费更划算
- 需要最强能力 → 顶尖闭源模型仍有优势
- 团队没有运维能力 → 自建的隐性成本是人力
- 快速验证想法阶段 → 先用 API 跑通再说
💰 粗算一笔账:一张 24GB 消费级显卡 ≈ 几千到万把块。 如果你每月 API 花费不到几百块,自建在经济上不成立——但作为学习投资另说。
💸 自建的"隐性成本"清单(算账时最容易漏)
关键信息
- 显性成本:显卡 / 云 GPU 租金
- ⭐ 隐性成本(往往更贵):
- 运维人力:模型更新、故障排查、扩容(这是最大的一笔)
- 闲置成本:GPU 按小时计费,流量低谷时也在烧钱
- 能力差距:自建模型效果不如顶尖闭源,可能需要更多工程弥补
- 迭代速度:闭源模型每几个月免费变强,自建的不会
- 机会成本:花在运维上的时间没花在产品上
🔑 一个反直觉的结论:自建往往不是"更便宜",而是"用钱换控制权"。 如果你的真实需求是合规、隐私、可控,自建就值; 如果只是"觉得 API 贵",先去做 Prefix Caching 和提示词优化(06d · 降延迟与指标), 那些的投入产出比高得多。
🌍 开源模型生态(会变,记结构别记名字)
关键信息
- 主要开源系列(2026 年前后的格局)
- Qwen(阿里) —— 中文强、尺寸齐全、生态活跃
- DeepSeek —— 推理和代码能力突出、MoE 架构
- Llama(Meta) —— 生态最广、工具链最全
- Mistral —— 欧洲、效率导向
- Gemma(Google) —— 小尺寸质量高
- 各种垂直微调版本 —— 代码/医疗/法律等
选型看四点: 1. 许可证 ⭐ —— 能不能商用?有没有用户数限制?这是最容易踩的坑 2. 中文能力 —— 中文场景优先看国产系列 3. 尺寸 —— 有没有适合你硬件的档位 4. 生态 —— 有没有现成的量化版本、微调脚本、社区支持
⚠️ 时效警告:模型名字和排名几个月就变。上面的列表只用来理解「有哪几类玩家」。 实际选型时去看当前的开源榜单(第 11 章讲怎么正确看榜)。
🔗 想再深一层,去哪一套
| 去哪 | 为什么 |
|---|---|
| AI基础设施 20 · 推理服务化 | ⭐ 这一页回答「要不要自建」,那一章回答决定自建之后用哪个引擎:引擎横评 + 一棵四问决策树 |
| 模型上线之后 18 · 成本与容量 | 「隐性成本清单」的容量侧:峰值该按什么算、闲置到底烧掉多少,把每一项变成数字 |
| 全景导论 11 · 评测体系 | 「时效警告」的兑现方式:榜单该怎么看、为什么不能照着排名直接选 |
| 密码学与信息安全 22 · 云密码学 | 「数据不能出内网又想借云端算力」的另一条路(同态加密 / 安全多方计算)——⚠️ 那一章自己也说,现实里多数场景本地部署便宜好几个数量级,所以先在这里算完账再去看 |
📦 深挖的话要学什么
📍 每条后面标了它在哪: 📗 本库有 = 站内已经讲透,点进去就行;📙 半有 = 站内讲了一半,另一半得外找; 📕 要外找 = 站内没有,得去论文或别处。 (这份清单以前只列词不说去哪,指到的坑有些站内根本没挖过,按图索骥会扑空。)
- 部署工程:Docker 化、多卡张量并行、负载均衡、健康检查、模型热切换 → 📙 半有:多卡张量并行在 AI基础设施 12 · 张量并行(一台机器装不下 70B 时,权重具体怎么切、切完要付多少通信代价——这正是上一页那张硬件对照表背后的那笔账);健康检查和负载均衡在 AI基础设施 20 · 推理服务化 的「生产必备的五件事」里,⚠️ 那里点出两个反直觉的点:健康检查不能只 ping,要真跑一次推理;客户端断开必须立刻停止生成并释放 KV Cache(用户关了页面服务器还在生成 2000 token,占着槽位不放,高并发下显著吃容量)。只有 Docker 化和模型热切换的具体做法站内没有,要外找
- 性能压测:吞吐/TTFT/TPOT 测量、容量规划、成本建模 → 📗 本库有:AI基础设施 20 · 推理服务化 的「先定 SLO 再谈优化」+「压测:画出你的延迟-吞吐曲线」,该监控什么也在同一章(⭐ KV Cache 使用率是最该盯的容量预警信号);成本模型在 AI基础设施 23 · 可观测性与成本。本页那张"隐性成本清单"是提醒你别漏项,这两章是教你怎么把每一项算成数字
- 量化实操:不同量化档位的质量-速度实测对比(自己跑一遍最有说服力) → 📗 本库有:AI基础设施 18 · 量化 的「质量评估:这一步不能省」。⚠️ 里面有一条直接关系到你自建成败的坑:"别人测 AWQ 几乎无损,到我这里就掉了",通常不是方法问题,是校准集不是你的分布——所以质量评估必须用你自己的业务数据跑,抄别人的档位结论没用
- 多 LoRA 服务:一个基座热挂多个适配器(配合第 5 章)。 🔗 这一条不用等「深挖」,AI基础设施 20 · 推理服务化 已经写了: 它省的是「每个租户开一份完整实例」的显存,而且主流引擎大多支持,但要在选型时单独确认—— 这是那一章明确点出的一个「容易漏掉的能力」,等部署完再发现引擎不支持就要重来。 同一节还有七个推理引擎的横评 + 一棵四问决策树,回答的正是这一章刻意没展开的「决定自建之后,到底用 vLLM 还是 SGLang 还是 TensorRT-LLM」。 ⚠️ 顺带纠一个常见误判:引擎之间通常只差 20–50%,而配置有没有调对差的是几倍——先调配置再换引擎。 (即 📗 本库有。)
- 边缘部署:手机/嵌入式设备、ONNX/CoreML/TensorRT 转换
→ 📙 半有:「怎么把模型导出成一个文件」站内有了 —— PyTorch 这个框架本身 10 · 把模型交出去 讲了
torch.save存模型和存state_dict的区别、TorchScript 的 trace 与 script、ONNX 导出(含 onnxruntime 实跑对拍) 以及torch.compile到底做了什么。⚠️ 但「转完之后」那半段仍要外找:CoreML / TensorRT 怎么转、量化后精度掉多少、手机端 runtime 怎么选、端侧内存怎么压 —— 站内没有 - 私有化整套方案:模型 + 向量库 + 网关 + 监控的完整内网架构 → 📙 半有:这套架构的每一块站内都有——模型服务在 AI基础设施 20,向量库选型在 推荐算法 10 · 向量检索与ANN,监控在 AI基础设施 23 · 可观测性与成本 和 模型上线之后 05 · 该监控什么。缺的恰恰是"把它们接起来"的那张图:网关层怎么设计、内网怎么隔离、各组件之间的失败怎么兜——这部分要外找
需要的前置:Linux + Docker 基础。几乎不需要理论,纯工程。
⚖️ 要不要深挖
| 你的情况 | 建议 |
|---|---|
| 从没跑过本地模型 | ✅ 强烈建议按上一页那条 30 分钟路线跑一次——认知冲击很大,且免费 |
| 有合规/隐私硬需求 | ✅ 必须深挖,配合第 6 章 |
| 想省 API 钱 | 🟡 先算账,多数个人场景自建不划算 |
| 做企业私有化交付 | ✅ 这是核心交付能力 |
| 纯做应用、用云 API | ⛔ 知道有这回事就行 |
🔑 我的判断:这块知识密度最低但体验价值最高。 它不值得单独做一整套教程(内容撑不满,且工具变化快), 但「花半小时跑一次本地模型」这件事本身,对建立直觉很有用—— 你会立刻理解量化、显存、速度这些抽象概念到底意味着什么。
建议:并入第 6 章推理优化,作为它的实操部分。
✅ 检查点
- 什么情况下该自建、什么情况下不该?
- 自建的「隐性成本」有哪些?为什么说自建往往不是「更便宜」而是「用钱换控制权」?
- 只是觉得 API 贵,第一步该做什么?
- 开源模型选型要看哪四点?哪一点最容易踩坑?
- 为什么这一页的模型名单只让你「记结构别记名字」?实际选型该看什么?
👀 答案
- 该:数据不出内网(医疗/金融/政务/法务)、稳定大流量、需要微调后的专有模型、需要极低延迟、离线环境、学习和实验。不该:流量小且不稳定、需要最强能力、团队没有运维能力、还在快速验证想法的阶段。
- 隐性成本:运维人力(最大的一笔)、GPU 闲置成本、能力差距、迭代速度落后、机会成本。算上它们之后经济优势往往就没了——真实价值在合规、隐私、可控,所以是用钱换控制权而不是省钱。
- 先做 Prefix Caching 和提示词优化(06d · 降延迟与指标)——投入产出比高得多,而且不需要任何运维。
- 许可证、中文能力、尺寸档位、生态支持。⭐ 许可证最容易踩坑(能不能商用、有没有用户数限制)。
- 因为模型名字和排名几个月就变,名单只用来理解「有哪几类玩家」(中文强的、推理和代码强的、生态最全的、效率导向的、小尺寸质量高的)。实际选型要去看当前的开源榜单,而怎么正确看榜是第 11 章的事。
🛑 可以停在这里
到这里你能给出一个有依据的答案:这件事该自建还是该继续用 API,以及要自建的话从哪个开源系列起步。
⚠️ 什么时候回来:账算完、模型也选好了,但你发现真正的问题是「模型答不上我们自己的资料」——那不是部署问题,是检索问题,去 08 系列。
⚡ 走神救援
先记住这几件事
- 自建的价值可能是控制权、内网需求或稳定负载,不只是省调用费。
- 把运维、人力、闲置资源与效果差距算进总成本。
- 选型同时检查许可证、语言与任务表现、硬件适配和维护条件。
下一节 👉 08-RAG深水区.md