Skip to content

本地大模型部署:从 PC 到服务器,五种方案摆在一起看

这两年大模型便宜到本地跑得起,「本地部署」从极客专属变成了普通玩家也能玩的事。我自己在桌面这一层用过一些——从 MacBook 到 PC,到 30B 量级。服务器那边的方案更多是文档调研和社区反馈的整理,没有真正部署过大集群。最深的感受是:没有"最好的方案",只有"最适合你的方案"

下面把几条典型路径摆开对比,按你能拿到什么硬件、要服务多少人,先快速对号入座。

先回答三个问题再选方案

动手之前先想清楚三件事:

  • 谁用?(就你 / 几个朋友 / 一整个团队)
  • 多频繁?(偶尔 / 每天 / 24/7)
  • 跑多大?(7B / 14B / 70B / 100B+)

答案不一样,方案天差地别。

形态上分成三层:

  • 桌面应用层:Mac/PC 上装个 GUI 工具就能聊,LM Studio、Jan、GPT4All
  • 本地服务层:跑成后台服务,HTTP API 暴露——Ollama、llama.cpp server
  • 生产服务层:专业 GPU 服务器 + 推理框架——vLLM、TGI、SGLang

一、桌面应用层(最省心)

LM Studio、Jan、GPT4All,这一类。

优点:

  • 下载、浏览模型、对话、调参数,全 UI 化
  • 不懂命令也能上手
  • 模型自动下到本地,内置常见量化版本

缺点:

  • 通常只能一个人用,没有公开 API
  • 常驻进程会跟其他应用抢资源
  • 模型一大(30B+)基本跑不动,受硬件天花板限制

适合:刚入门、想体验、偶尔写点东西。

二、本地服务层(最实用)

Ollama 是这层的代表,llama.cpp server 是更底层的选项。

Ollama

  • 一条命令拉模型起服务:ollama run qwen3:14b
  • 默认 11434 端口,OpenAI 兼容 API 开箱即用
  • Modelfile 支持自定义 prompt 模板和参数
  • 模型库大,社区活跃

llama.cpp server

  • 比 Ollama 更贴底层
  • 显存不够可以 CPU + 部分 GPU 卸载
  • 自带 OpenAI 兼容 API 和一个简陋的 Web UI

优点:

  • 一份本地服务,多端可调(CLI、IDE 插件、自家脚本)
  • 切换模型快
  • 完全离线,网络不是依赖

缺点:

  • 单 GPU / 单机部署,并发一高就堵
  • 选哪个量化版,得自己做功课

适合:个人 + 团队内几个人的小场景。

三、生产服务层(最专业)

这一层我没有真正部署过,下面更多是基于官方文档、社区反馈和公开 benchmark 的整理,请当作参考资料而不是操作手册,不要照搬。如果你要上生产,请先读一遍各自官方文档的最新版本说明。

vLLM、TGI、SGLang 三足鼎立。

vLLM

  • 主力推理框架,PagedAttention 的发明者
  • 高吞吐、低延迟,连续批处理
  • 生产部署的事实标准

TGI(Hugging Face Text Generation Inference)

  • Rust 写的,比 vLLM 更稳
  • 多卡支持好,模型兼容面广
  • 跟 HF 生态结合深

SGLang

  • 后起之秀,专门为复杂 LLM 程序设计(多轮、tool use、structured output)
  • 学术资源多,性能调优文档详细

优势:

  • 显存利用率优化(vLLM 的 PagedAttention 解决了 KV cache 碎片化)
  • 并发吞吐顶得住
  • 监控 / 部署 / 日志工具链齐

劣势:

  • 学习曲线陡——Python 生态为主,没界面
  • 硬件门槛高(80G 起步)
  • 启动参数比 Ollama 复杂一截

适合:服务真实用户、性能和成本敏感的活。

四、量化策略:谁都躲不过

不管你选哪层,量化这关都得面对。原版模型动不动几十 GB,没那么大显存。

常见档位:

  • Q4_K_M:质量还行,体积压到 1/4,最常用
  • Q5_K_M:比 Q4 再好一点,体积也大一点
  • Q8_0:几乎无损,体积减半
  • FP16 / BF16:原始精度,服务器才扛得住

经验粗判:

  • 桌面 + ≥24G 显存 → 跑 30B Q4,14B Q8
  • 单卡 80G → 70B Q4,30B FP16
  • 多卡 / 80G+ → 70B FP16,100B+ 量力而行

五、按场景对号入座

场景理由
入门体验LM Studio / Jan零命令行
个人日常Ollama一行起服务,生态全
低显存折腾llama.cppCPU/GPU 混合卸载
团队内部用Ollama + Docker简单,能隔离环境
并发要求高vLLMPagedAttention 抗并发
HF 模型对接TGIHuggingFace 模型即插即用
复杂 LLM 程序SGLang多轮 / 工具调用友好

六、几条通用建议

  1. 别一上来追最大模型。在多数公开 benchmark 和定性反馈上,14B Q4 和 70B Q4 差距没那么夸张,前者速度通常是后者的 3-4 倍。
  2. 量化版别只看排行榜,看社区下载量、看实际用户反馈。
  3. 桌面应用和服务器框架是两件事。同一套硬件跑不同工具,资源调度、显存管理、上下文利用率都可能很不一样——具体差别以各自官方说明为准。
  4. 模型 50GB+ 时 SSD 才有意义。机械盘加载模型会非常慢,首 token 出时间差别巨大。
  5. 公网暴露前先加 token + 限流。Ollama/vLLM 默认是裸奔的,不加保护会把接口直接敞开给所有访问者。

一点总结

本地部署真正的价值不是"省 API 钱"——那点钱其实杯水车薪。真正的价值是 数据不出门、模型可定制、延迟可控。当你的业务越需要这三件事,你自然会从"云端用 API"走到"本地起一个"。

工具是给需求服务的,不是反过来。先想清楚要解决什么,再看哪个方案最契合。