最近研究了大模型以及 GPU 服务器配置等问题。结论是 7B-70B 大模型最合适个人本地部署。以下是详细配置建议。
一、基础硬件配置
CPU
建议 32-64 核(可降级,没有显存重要)。多核有助于数据预处理和并行推理任务。
内存
128GB - 512GB。内存一般在显存的两倍左右,显存不够,内存来凑。大模型加载时若显存不足,部分层会卸载到系统内存,速度会显著下降。
硬盘
4TB - 12 TB SSD。模型文件体积较大,且需要高速读写以支持快速加载。推荐 NVMe SSD。
操作系统
Debian 12 >= Ubuntu 24.04 LTS > Windows 11。Linux 环境对 CUDA 支持和稳定性通常优于 Windows。
二、GPU 核心配置
重点是 GPU。大模型时代,显存当然越大越好。但合理显存估算也很重要。
显存估算公式
以 x B 大模型 y bit 量化为例,推理的显存至少为 x * y / 8 GB。
- 7B 单精度(16bit): 至少需要 14G 显存。
- 7B 8bit 量化: 至少需要 8GB 显存。
- 70B 单精度: 需要至少 140G 显存。
- 70B 8bit 量化: 至少需要 70GB 显存。
- 405B 单精度: 需要至少 810G 显存。
- 405B 8bit 量化: 至少需要 405GB 显存。
- 405B 4bit 量化: 至少需要 200GB 显存。
这里不推荐尬上 4bit,精度损失严重,效果很不好。当然以上只是显存最小化估计,实际运行时,除了模型参数还需要考虑 Context(上下文窗口)等因素,实际显存占用只会更高。
微调显存需求
对于大模型微调,全量的话就要至少两倍的推理显存。当然可以采用 PEFT 如 Lora 进行微调,实际上是对模型参数的稀疏化,这样需要的显存会大幅度下降,代价是最后出来的效果可能不太好,需要权衡一下。
预算与显卡推荐(预算只含 GPU)
| 预算范围 | 推荐配置 |
|---|---|
| 1 万以内 | 1 * RTX 3090 24GB |
| 1-2 万 | 1 * RTX 4090 24GB |
| 3 万 | 1 * RTX A6000 48GB,或 2 * RTX 4090 24GB |
| 5 万 | 1 * RTX 6000 Ada,L40/L40s 48GB,或 2 * RTX A6000 48GB + NVLink |
| 10-15 万 | 2* L40/L40s 48GB,4 * RTX A6000 48GB + NVLink,2* RTX 6000 Ada 48GB |
| 20-30 万 | 2 * A100 80GB + NVLink,2* L40/L40s 48GB,4 * RTX 6000 Ada 48GB |
| 30-50 万 | 2 * H100 80GB + NVLink,4 * A100 80GB + NVLink |
| 50-100 万 | 4 * H100 80GB + NVLink,8 * A100 80GB + NVLink |
对于比较拮据的朋友,使用单张 3090/4090 运行 7-13B 的大模型是不错的选择。但大模型时代,4090 因为显存小,面临显存不足的问题,更容易过时。而且,由于再考虑,大功率以及大尺寸等因素,组超过 4 张的多卡 4090 可能不太划算。
另外 RTX 6000 Ada 没有 NVLink,但是通信可以走 P2P。在服务器端,L40s 可取代。L40s 是被动散热,而 RTX 6000 Ada 相对安静,因此后者用在工作站中比较合适。
最后,不管是推理还是训练,多卡效率比单卡低很多,可能损失 1/3 以上的性能。预算高推荐上 A100/H100。
三、实测案例:双卡 RTX 6000 Ada 工作站
我目前在使用双卡 RTX 6000 Ada 48GB 工作站,比较适合 70B 8bit 量化的大模型,单卡可以运行 70B 4bit 版或 7-13B 16bit 版。
开源 LLM 测试
目前著名的开源大模型有 Mixtral (Mistral AI), Llama (Meta), Gemma (Google) 等。
- Llama 3 7B 8bit 量化: 显存占用大约为 7.8GB。
- Mixtral 8x7B 8bit 量化: 显存占用大约为 51GB。Mixtral 8x7B int8 量化版兼具速度与效果,很不错。
- Qwen2-72B 8bit 量化: 显存占用大约为 75.6GB。
Stable Diffusion 测试
用 Stable Diffusion 实测单卡效率在 H100 的 60% 左右,可以跑最高分辨率 2048*2048,显存占用在 30GB 左右。双卡算力和总显存应该稍胜 H100。
四、软件环境与优化建议
驱动与框架
确保安装最新的 NVIDIA 驱动程序。推荐使用 PyTorch 2.x 版本以获得更好的 CUDA 支持。推理引擎可选择 vLLM、llama.cpp 或 Ollama,根据具体场景选择。
电源与散热
多卡部署对电源要求极高。建议配备 1600W 以上的钛金级电源,并预留足够的功率余量。散热方面,需保证机箱风道通畅,特别是多卡堆叠时,建议使用专业散热方案或液冷,防止降频。
PCIe 插槽
多卡互联需注意 PCIe 带宽。RTX 系列消费级显卡通常不支持物理 NVLink,依赖 PCIe 总线通信,延迟较高。企业级卡如 A100/H100 支持 NVLink,适合大规模集群。主板需支持足够的 PCIe 通道数,避免带宽瓶颈。
五、总结
本地部署大模型的核心在于显存容量与带宽。根据预算选择合适的显卡组合,注意多卡通信损耗。对于个人用户,双卡 48GB 显存是目前性价比最高的 70B 模型运行方案。随着技术发展,未来可关注支持更大显存的新一代显卡架构。

