本地跑大模型,显卡到底怎么选?先把显存这笔账算清楚

想在自己的电脑上跑大模型,你搜一圈攻略,大概率会看到一堆显卡型号:RTX 3060、3090、4090、A6000……看得人头晕。

#显卡#大模型#显存#知识库更新于 2026-08-19
📑 本页目录

想在自己的电脑上跑大模型,你搜一圈攻略,大概率会看到一堆显卡型号:RTX 3060、3090、4090、A6000……看得人头晕。

但今天我想先拦你一下:别急着选显卡,先回答一个问题——你打算跑多大的模型?

这个问题才是决定一切的前提。显卡的显存大小,决定了你能跑多大的模型;显存带宽,决定跑得快不快。模型大小和显存,是这整件事的两条主线。

一、先把显存这笔账算明白

模型文件需要多大的显存,有个大概的换算公式:

精度 每 10 亿参数约占用
FP16 2GB
INT8 1GB
INT4 0.5GB

举个直观的例子:

  • 7B 模型 INT4 量化:约 4-5GB 显存
  • 14B 模型 INT4 量化:约 8-10GB 显存
  • 70B 模型 INT4 量化:约 40GB 显存

另外,上下文越长,额外显存占用越多——通常还要预留 1-4GB 给 KV Cache(就是模型“记住前面说过的话”所需要的缓存)。

一句话记住:显存大小决定你能跑多大的模型,显存带宽决定跑得快不快。

二、按需求分三档,对号入座

入门档:跑 7B-14B 量化模型

推荐显卡:

  • RTX 3060 12GB
  • RTX 4060 Ti 16GB
  • 二手 RTX 3090 24GB(性价比很高)

能做什么: 流畅跑 Llama 3 8B、Qwen2.5 7B、Mistral 7B;16GB 显存可以跑 14B 模型 INT4 量化。适合体验、聊天、本地助手、简单代码补全。

整机建议: i5/R5 CPU、32GB DDR5 内存、1TB NVMe SSD、650W-850W 电源。

中端主力:跑 14B-34B 量化模型

推荐显卡:

  • RTX 3090 24GB
  • RTX 4090 24GB
  • RTX 4080 Super 16GB

24GB 显存是甜点配置。

能做什么: 7B/8B/14B 非常流畅;20B-34B 模型 INT4 量化能跑;70B INT4 比较勉强(INT2/INT3 能试但质量下降明显)。适合本地知识库、长文本摘要、代码助手、Agent。

整机建议: i7/R7 CPU、64GB DDR5、2TB NVMe SSD、电源 1000W(尤其 4090)。

高端多卡:跑 70B 或更大

推荐方案:

  • 2 × RTX 3090 24GB = 48GB 显存
  • 2 × RTX 4090 24GB = 48GB 显存
  • 4 × RTX 3090/4090 = 96GB 显存

能做什么: 48GB 舒服跑 70B INT4;96GB 跑 70B 更高质量量化或 Mixtral 8x7B 这类 MoE 模型;也可以尝试 120B 低比特量化。

注意事项: 主板 PCIe 通道要够(尽量选支持双卡 x8/x16 的主板或工作站平台);电源 1600W 以上;注意散热和机箱空间;日常用 llama.cpp、vLLM 支持多卡张量并行。

三、另一条路线:Apple Silicon

如果你不想折腾多卡,Mac 是另一个选择:

推荐:

  • Mac Studio M2 Ultra 128GB / 192GB
  • MacBook Pro M3 Max 64GB / 128GB

优势: 192GB 统一内存可以跑 70B 甚至 120B 量化版;安静、省电、不用折腾多卡;适合长期开机做本地服务。

劣势: 推理速度通常不如高端 NVIDIA 显卡;软件生态略弱(不过 llama.cpp、Ollama 支持已经不错了);价格较高。

四、预算最低方案:CPU + 大内存

手上暂时没有好显卡,也可以跑——只是慢:

  • 128GB DDR5 双通道或四通道
  • AMD Threadripper / EPYC 多通道内存平台更合适
  • 用 llama.cpp 的 CPU 推理

能跑 70B INT4 模型,但速度可能只有每秒几个 token。适合验证、测试,不适合日常流畅使用。

五、如果你要微调 / 训练模型

只做推理,上面配置够用了。但想微调:

  • 24GB 显存起步
  • 用 LoRA / QLoRA 微调 7B/14B 模型
  • 全参微调 7B 至少 24GB 以上
  • 全参微调 70B——基本要多张 A100/H100 服务器级 GPU

专业卡参考:RTX A6000 48GB、RTX 6000 Ada 48GB、A100 80GB、H100 80GB。

六、我的个人推荐

只选一个配置: RTX 3090 24GB 或 RTX 4090 24GB + 64GB 内存 + 2TB NVMe SSD。本地玩大模型最平衡的配置,7B-34B 通吃,70B 低量化也能体验。

预算紧张: RTX 4060 Ti 16GB + 32GB 内存。跑 7B/14B 量化,完全够入门。

想跑 70B: 双 RTX 3090/4090(48GB 显存),或者 Mac Studio 192GB 统一内存。

最后泼盆冷水:像 DeepSeek-R1 671B 这种超大 MoE 模型,就算 INT4 量化也需要约 350-400GB 显存——家用单机基本不现实。普通人本地跑的主流区间就是 7B-70B 的开源模型或蒸馏版。

买之前,先想清楚你要跑多大的模型,再决定花多少钱。 别一上来就冲 4090——4060 Ti 可能就是你的答案。