本地部署实践:Ollama / vLLM / llama.cpp 对比与保姆级教程
在本地或小服务器跑大模型的三大工具对比,含安装、量化选型、消费级显卡(RTX 3060/4090)跑 7B/13B 的实战指南。
#本地部署#Ollama#vLLM#llama.cpp#量化更新于 2026-08-12
想在自己电脑/服务器跑大模型?先想清楚:你是要“最快上手”,还是要“最高吞吐”,还是要“极致轻量/省资源”? 三个答案对应三个工具。
三巨头对比
| 维度 | Ollama | vLLM | llama.cpp |
|---|---|---|---|
| 定位 | 一键上手,开发者友好 | 高并发推理服务 | 极致轻量、边缘/量化 |
| 上手难度 | ⭐ 最简单 | ⭐⭐⭐ | ⭐⭐ |
| 推理框架 | 底层 llama.cpp | PagedAttention(高吞吐) | C++ 原生 |
| 适合场景 | 个人/开发/聊天 | 生产 API 服务 | 嵌入式/低配/量化 |
| 显存占用 | 中 | 中高 | 最低 |
选择建议:
- 个人日常用、想快速跑起来 → Ollama
- 要对外提供高并发 API → vLLM
- 显存极小、边缘设备、要极致省 → llama.cpp
保姆级:Ollama 上手(最推荐入门)
Ollama 一条命令就能跑模型,自动处理量化、下载、运行。
# 1. 安装(macOS/Linux)
curl -fsSL https://ollama.com/install.sh | sh
# 2. 拉取并运行模型(7B 对话)
ollama run qwen2.5:7b
# 3. 查看已安装模型
ollama list
# 4. 作为 API 服务(默认端口 11434)
ollama serve
curl http://localhost:11434/api/generate -d '{"model":"qwen2.5:7b","prompt":"你好"}'
关键:Ollama 背后就是 llama.cpp 的量化能力,对新手零门槛。
模型量化:怎么选 GGUF / AWQ
大模型参数是 FP16(每参数 2 字节)。量化就是把精度降低、换显存。
| 量化 | 精度 | 7B 显存约 | 适用 |
|---|---|---|---|
| FP16 | 高 | ~14GB | 显存充裕 |
| Q8 | 高 | ~8GB | 权衡好 |
| Q4_K_M | 中高 | ~4.5GB | 性价比之王,首选 |
| Q2 | 低 | ~2.5GB | 显存极限 |
- GGUF:llama.cpp/Ollama 的量化格式,量化在文件层
- AWQ:另一种量化算法,精度略好,配 vLLM/特定引擎
消费级显卡实战
RTX 3060 12GB:
- 推荐跑 7B 模型 Q4(约 4.5GB,轻松)
- 13B Q4(约 8GB)勉强可跑,速度一般
- 命令:
ollama run qwen2.5:7b(Ollama 自动选 Q4)
RTX 4090 24GB:
- 可跑 13B Q8 / 14B,甚至 32B Q4
- 13B Q4 全速无压力
# 指定量化版本拉取
ollama run qwen2.5:7b-q4_K_M
搭建 Web 聊天界面
Open WebUI(功能全,带 RAG/多用户):
# Docker 一键起(若装 Docker)
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
--name open-webui --restart always ghcr.io/open-webui/open-webui:main
NextChat(轻量,直接配 API):前端填 http://localhost:11434 即可对话。
一句话总结
本地跑模型 = 选对工具(个人用 Ollama / 生产用 vLLM / 极省用 llama.cpp)+ 选对量化(无脑 Q4_K_M 起步)+ 量好显存。3060 跑 7B、4090 跑 13B-32B,都能流畅跑起来。
继续学习
模型社区与资源:Hugging Face、ModelScope、Replicate、CivitAI
去哪找模型、怎么下模型?盘点主流模型社区:Hugging Face、魔搭 ModelScope、Replicate、CivitAI 的功能与直达教程。
多模态模型简介:CLIP、GPT-4V 与视觉语言模型
多模态模型让 AI 同时理解文字和图像。从 CLIP 的对比学习,到 GPT-4V 的图文对话,讲清它们如何对齐不同模态。
扩散模型简介:图像生成背后的原理(去噪的魔法)
Midjourney、Stable Diffusion 背后的扩散模型是怎么工作的?用最直观的方式讲清'从噪声到图像'的过程。
提示工程心法:Few-shot、Chain-of-Thought 等实用技巧
不堆术语,讲清提示工程最实用的几个核心方法:Few-shot、CoT、角色设定、结构化输出,附可直接套用的模板。