本地大模型部署:从 PC 到服务器,五种方案摆在一起看
这两年大模型便宜到本地跑得起,「本地部署」从极客专属变成了普通玩家也能玩的事。我自己在桌面这一层用过一些——从 MacBook 到 PC,到 30B 量级。服务器那边的方案更多是文档调研和社区反馈的整理,没有真正部署过大集群。最深的感受是:没有"最好的方案",只有"最适合你的方案"。
下面把几条典型路径摆开对比,按你能拿到什么硬件、要服务多少人,先快速对号入座。
先回答三个问题再选方案
动手之前先想清楚三件事:
- 谁用?(就你 / 几个朋友 / 一整个团队)
- 多频繁?(偶尔 / 每天 / 24/7)
- 跑多大?(7B / 14B / 70B / 100B+)
答案不一样,方案天差地别。
形态上分成三层:
- 桌面应用层:Mac/PC 上装个 GUI 工具就能聊,LM Studio、Jan、GPT4All
- 本地服务层:跑成后台服务,HTTP API 暴露——Ollama、llama.cpp server
- 生产服务层:专业 GPU 服务器 + 推理框架——vLLM、TGI、SGLang
一、桌面应用层(最省心)
LM Studio、Jan、GPT4All,这一类。
优点:
- 下载、浏览模型、对话、调参数,全 UI 化
- 不懂命令也能上手
- 模型自动下到本地,内置常见量化版本
缺点:
- 通常只能一个人用,没有公开 API
- 常驻进程会跟其他应用抢资源
- 模型一大(30B+)基本跑不动,受硬件天花板限制
适合:刚入门、想体验、偶尔写点东西。
二、本地服务层(最实用)
Ollama 是这层的代表,llama.cpp server 是更底层的选项。
Ollama
- 一条命令拉模型起服务:
ollama run qwen3:14b - 默认 11434 端口,OpenAI 兼容 API 开箱即用
- Modelfile 支持自定义 prompt 模板和参数
- 模型库大,社区活跃
llama.cpp server
- 比 Ollama 更贴底层
- 显存不够可以 CPU + 部分 GPU 卸载
- 自带 OpenAI 兼容 API 和一个简陋的 Web UI
优点:
- 一份本地服务,多端可调(CLI、IDE 插件、自家脚本)
- 切换模型快
- 完全离线,网络不是依赖
缺点:
- 单 GPU / 单机部署,并发一高就堵
- 选哪个量化版,得自己做功课
适合:个人 + 团队内几个人的小场景。
三、生产服务层(最专业)
这一层我没有真正部署过,下面更多是基于官方文档、社区反馈和公开 benchmark 的整理,请当作参考资料而不是操作手册,不要照搬。如果你要上生产,请先读一遍各自官方文档的最新版本说明。
vLLM、TGI、SGLang 三足鼎立。
vLLM
- 主力推理框架,PagedAttention 的发明者
- 高吞吐、低延迟,连续批处理
- 生产部署的事实标准
TGI(Hugging Face Text Generation Inference)
- Rust 写的,比 vLLM 更稳
- 多卡支持好,模型兼容面广
- 跟 HF 生态结合深
SGLang
- 后起之秀,专门为复杂 LLM 程序设计(多轮、tool use、structured output)
- 学术资源多,性能调优文档详细
优势:
- 显存利用率优化(vLLM 的 PagedAttention 解决了 KV cache 碎片化)
- 并发吞吐顶得住
- 监控 / 部署 / 日志工具链齐
劣势:
- 学习曲线陡——Python 生态为主,没界面
- 硬件门槛高(80G 起步)
- 启动参数比 Ollama 复杂一截
适合:服务真实用户、性能和成本敏感的活。
四、量化策略:谁都躲不过
不管你选哪层,量化这关都得面对。原版模型动不动几十 GB,没那么大显存。
常见档位:
- Q4_K_M:质量还行,体积压到 1/4,最常用
- Q5_K_M:比 Q4 再好一点,体积也大一点
- Q8_0:几乎无损,体积减半
- FP16 / BF16:原始精度,服务器才扛得住
经验粗判:
- 桌面 + ≥24G 显存 → 跑 30B Q4,14B Q8
- 单卡 80G → 70B Q4,30B FP16
- 多卡 / 80G+ → 70B FP16,100B+ 量力而行
五、按场景对号入座
| 场景 | 选 | 理由 |
|---|---|---|
| 入门体验 | LM Studio / Jan | 零命令行 |
| 个人日常 | Ollama | 一行起服务,生态全 |
| 低显存折腾 | llama.cpp | CPU/GPU 混合卸载 |
| 团队内部用 | Ollama + Docker | 简单,能隔离环境 |
| 并发要求高 | vLLM | PagedAttention 抗并发 |
| HF 模型对接 | TGI | HuggingFace 模型即插即用 |
| 复杂 LLM 程序 | SGLang | 多轮 / 工具调用友好 |
六、几条通用建议
- 别一上来追最大模型。在多数公开 benchmark 和定性反馈上,14B Q4 和 70B Q4 差距没那么夸张,前者速度通常是后者的 3-4 倍。
- 量化版别只看排行榜,看社区下载量、看实际用户反馈。
- 桌面应用和服务器框架是两件事。同一套硬件跑不同工具,资源调度、显存管理、上下文利用率都可能很不一样——具体差别以各自官方说明为准。
- 模型 50GB+ 时 SSD 才有意义。机械盘加载模型会非常慢,首 token 出时间差别巨大。
- 公网暴露前先加 token + 限流。Ollama/vLLM 默认是裸奔的,不加保护会把接口直接敞开给所有访问者。
一点总结
本地部署真正的价值不是"省 API 钱"——那点钱其实杯水车薪。真正的价值是 数据不出门、模型可定制、延迟可控。当你的业务越需要这三件事,你自然会从"云端用 API"走到"本地起一个"。
工具是给需求服务的,不是反过来。先想清楚要解决什么,再看哪个方案最契合。