跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

AMD AI MAX+395 迷你主机基于 ROCm 部署 vLLM 大模型实践

详细记录了在 AMD AI MAX+395 迷你主机上,基于 Ubuntu 24.04.3 系统,通过安装 ROCm 7.1 驱动、配置 Conda 及编译适配版 PyTorch,完成 vLLM 框架的构建与大模型部署的全过程。内容包括环境依赖安装、Flash Attention 编译、vLLM 源码构建以及模型服务启动命令,适用于具备一定 Linux 操作经验的开发者进行本地大模型推理测试。

GopherDev发布于 2026/4/5更新于 2026/9/17103 浏览

AMD AI MAX+395 迷你主机 vLLM 部署指南

1. 操作系统环境

系统版本:Ubuntu 24.04.3

2. 安装 ROCm

版本要求:ROCm 7.1 官方文档参考:ROCm 安装前置条件

3. 配置 Python 环境

使用 Conda 安装 Python 3.12 版本。 由于 PyTorch 尚未完全兼容 ROCm 7.1 的通用包,需使用 ROCm 编译的安装包(包含 torch, tensorflow, apex, jax, jaxlib, torchaudio, torchvision, triton)。 下载地址:ROCm Manylinux Repo 安装命令示例:

pip install XXXX.whl

验证安装:确保 PyTorch 版本对应 ROCm 7.1。

4. 安装 vLLM 前准备

git clone https://github.com/ROCm/flash-attention.git
cd flash-attention && git checkout v2.7.3-cktile && python setup.py install
pip install amdsmi --force-reinstall
pip install amdsmi==7.0.2

5. 编译安装 vLLM

git clone -b v0.13.0 https://github.com/vllm-project/vllm.git
pip install --upgrade packaging --ignore-installed
pip install -r requirements/rocm.txt
export PYTORCH_ROCM_ARCH="gfx1151"
python3 setup.py install

6. 下载模型

模型资源链接:https://modelscope.cn/models/openai-mirror/gpt-oss-120b

7. 运行 vLLM

vllm serve ./qwen3-32 --served-model-name qwen3-32 --dtype auto --max-model-len 32768 --host 0.0.0.0 --port 8000 --async-scheduling

目录

  1. AMD AI MAX+395 迷你主机 vLLM 部署指南
  2. 1. 操作系统环境
  3. 2. 安装 ROCm
  4. 3. 配置 Python 环境
  5. 4. 安装 vLLM 前准备
  6. 5. 编译安装 vLLM
  7. 6. 下载模型
  8. 7. 运行 vLLM

更多推荐文章

查看全部
  • 大模型 RAG 架构落地的十大核心挑战
  • JavaScript 网络请求实战:GET 与 POST 方法详解
  • Faster Whisper v1.7 本地语音转录与字幕生成教程(含 AMD 支持)
  • Ubuntu 部署 OpenClaw 实战指南
  • 接口测试全流程自动化:基于 AI 的实战方案
  • CentOS 启动时自动加载内核模块
  • 前端开发者必备的 3 项核心技能:设计、工程实践与硬件优化
  • Python 基础语法完全指南:变量、类型、运算符与字符串
  • 计算机类专业解析:核心课程、方向与就业路径
  • Mac Intel 芯片安装 Stable Diffusion WebUI 指南
  • ToDesk、顺网云与海马云运行 DeepSeek 模型对比评测
  • C++ 智能指针:内存管理的自动化机制
  • Git 入门指南:从零理解版本控制与团队协作
  • 销讲型直播内容策划:AIGC 的 5 步策划法
  • 三台 Win11 笔记本跑 VMware Ubuntu 24:网络配置实录
  • 本地部署 Kimi K2 模型:llama.cpp、vLLM 与 Docker 方案
  • Linux 容器化核心原理:Namespace 隔离与 cgroups 资源控制及 LXC 实战
  • AI 大模型定义及其在物流行业的变革应用
  • WhisperX 语音识别工具:为何优于传统方案?
  • 循环神经网络(RNN)与序列数据处理实战

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online