Llama3-8B 本地部署:vLLM 和 Open-WebUI 直装方案
为什么是 Llama3-8B
本地跑大模型,最先撞上的通常不是'模型够不够强',而是显存、速度和折腾成本。Meta-Llama-3-8B-Instruct 的好处在于,它把门槛压得比较低:80 亿参数,单卡可跑,指令遵循也比很多同级模型更稳,8k 上下文和 Apache 2.0 许可也都够实用。
别被'80 亿'吓住。fp16 完整模型大约要 16GB 显存,换成 GPTQ-INT4 量化后,4GB 左右就能启动。也就是说,RTX 3060 这类 12GB 卡就能把推理任务扛起来,消费级机器不再只是'能加载',而是真的能聊。
它比较适合这几类场景:
- 英文指令问答、代码重构、注释生成
- 长文摘要和文档问答
- 日常技术助手,或者轻量级代码协作者
中文当然不是它的强项,但配合合适的提示词,日常问答和文案润色已经够用。要拿它直接做高质量中文写作,不太现实;如果目标是'能用、稳定、别太折腾',它很合适。
为什么我更偏向 vLLM + Open-WebUI
模型选对了,体验也未必好。启动慢、响应慢、界面难用,这些问题最后都会落到日常使用上。
vLLM 负责推理层,重点是吞吐和延迟。它用 PagedAttention 和连续批处理把显存利用率拉高,多个请求并发时也不容易乱掉。Open-WebUI 则负责交互层,界面干净,支持会话管理、历史记录、自定义系统提示词,上传 PDF 或 Markdown 这类文件也比较顺手。
这里真正省事的地方,不是'功能多',而是这套组合已经被做成了预置镜像。镜像里模型、vLLM、Open-WebUI 和接口都已经连好,不需要你再去配反向代理、对齐 config,甚至不用先理解一堆启动参数。对多数人来说,这比自己拼装稳得多。
部署过程
先确认机器和环境
先看硬件。NVIDIA 显卡是前提,12GB 显存比较稳。系统里需要 Docker 和 NVIDIA Container Toolkit,版本太老的话,后面跑 GPU 容器容易出莫名其妙的问题。
Ubuntu 上装 Docker 可以直接用:
curl -fsSL https://get.docker.com | sh
sudo usermod -aG docker $USER
然后重新登录终端,或者执行 newgrp docker 让权限生效。
再装 NVIDIA Container Toolkit,让 Docker 能看到 GPU:
curl -sL https://nvidia.github.io/nvidia-docker/gpgkey | sudo apt-key add -
distribution=$(.
/etc/os-release;echo $ID$VERSION_ID)
curl -sL https://nvidia.github.io/nvidia-docker/$distribution/nvidia-docker.list | sudo tee /etc/apt/sources.list.d/nvidia-docker.list
sudo apt-get update && sudo apt-get install -y nvidia-docker2
sudo systemctl restart docker
验证时直接跑:
docker run --rm --gpus all nvidia/cuda:12.1.1-runtime-ubuntu22.04 nvidia-smi
能看到显卡信息,说明这一步过了。
启动镜像
镜像已经放在公开仓库里,直接拉就行,不需要本地构建:
