跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

DGX Spark 部署 vLLM + Open WebUI 运行 Qwen3-Coder-Next-FP8(CUDA 13.0)

DGX Spark 平台基于 Grace Blackwell 架构,在 Ubuntu 24.04 aarch64 环境下部署 vLLM 推理服务与 Open WebUI 前端。核心步骤涵盖 FlashAttention 编译、vLLM wheel 安装及 Qwen3-Coder-Next-FP8 模型加载,适配 CUDA 13.0 环境。支持单机容器化或跨主机远程访问,实测显存占用约 110GB,推理吞吐达 35–45 tokens/sec。提供故障排查指南与参数推荐,适用于生产级大模型服务搭建。

星辰大海发布于 2026/4/9更新于 2026/7/2034 浏览
DGX Spark 部署 vLLM + Open WebUI 运行 Qwen3-Coder-Next-FP8(CUDA 13.0)

DGX Spark 部署 vLLM + Open WebUI 运行 Qwen3-Coder-Next-FP8(CUDA 13.0)

本文记录在 NVIDIA DGX Spark(Grace Blackwell 架构)上部署 vLLM 推理服务并接入 Open WebUI 的完整流程。环境基于 Ubuntu 24.04.4 LTS(aarch64),适配 CUDA 13.0,所有命令经实测验证,可直接用于生产部署。

硬件平台:NVIDIA DGX Spark(Grace Blackwell GB10 架构)
操作系统:Ubuntu 24.04.4 LTS(aarch64)
CUDA Version:13.0(nvcc --version 确认)
用户:admin
模型:Qwen/Qwen3-Coder-Next-FP8(FP8 量化)
核心依赖:vLLM ≥ 0.15.1(需支持 CUDA 13.0 + aarch64 + cu130 wheel)


一、初始化 vLLM 部署环境

首先创建工作目录并配置 Python 虚拟环境。这里推荐使用 uv 管理依赖,效率更高。

mkdir -p ~/vllm
cd ~/vllm
uv venv --python3.12 --seed
source .venv/bin/activate
pip install torch==2.9.1+cu130 --index-url=https://download.pytorch.org/whl/cu130
uv pip install setuptools==80.10.2
uv pip install packaging -U

✅ 验证:确保 python --version 显示 3.12,且 torch 能正常导入。


二、安装依赖(FlashAttention 2.8.3 + Triton 3.6.0)

2.1 安装 FlashAttention

当前 FlashAttention 官方暂未提供 cu130 + aarch64 的预编译 wheel(截至 v2.8.3)。推荐优先下载社区构建的 aarch64 版本;若无可用 wheel,可从源码编译(设置 MAX_JOBS=4 防 OOM)。

方案 A:预编译 wheel(首选)
# 示例:假设已下载 wheel(替换为实际路径)
# uv pip install /path/to/flash_attn-2.8.3+cu130torch2.5.0cxx11abiFALSE-cp312-cp312-linux_aarch64.whl --no-build-isolation --no-cache-dir
方案 B:源码编译(若无 wheel)
export MAX_JOBS=4
export CMAKE_BUILD_PARALLEL_LEVEL=2
uv pip install flash-attn --no-build-isolation --no-cache-dir

🔔 注意:源码编译需提前安装 build-essential, cmake, , 。编译耗时约 0.5–1 小时,取决于 I/O 和内存。

nvidia-cuda-toolkit
python3-dev

2.2 升级 Triton

uv pip install --upgrade "triton>=3.6.0"

三、部署 vLLM(aarch64, CUDA 13.0)

3.1 安装 vLLM

官方 vLLM ≥ v0.15.1 已提供 cu130 + aarch64 wheel。本部署采用最新稳定版。

# 获取最新版本号(自动解析 tag,去掉 'v' 前缀)
export VLLM_VERSION=$(curl -s https://api.github.com/repos/vllm-project/vllm/releases/latest | jq -r '.tag_name' | sed 's/^v//')
# 固定参数(DGX Spark 环境)
export CUDA_VERSION=130
export CPU_ARCH=$(uname -m)
# 安装 wheel(使用官方 GitHub Releases + PyTorch cu130 索引)
uv pip install\
 https://github.com/vllm-project/vllm/releases/download/v${VLLM_VERSION}/vllm-${VLLM_VERSION}+cu${CUDA_VERSION}-cp38-abi3-manylinux_2_35_${CPU_ARCH}.whl \
 --extra-index-url https://download.pytorch.org/whl/cu${CUDA_VERSION}

⚠️ 若下载失败(如网络限制),可提前下载 wheel 至本地后执行。

3.2 启动 vLLM 推理服务

单卡模式下,直接加载模型并开启工具调用支持。

VLLM_USE_MODELSCOPE=true \
 vllm serve \
 Qwen/Qwen3-Coder-Next-FP8 \
 --port 8000 \
 --tensor-parallel-size 1 \
 --enable-auto-tool-choice \
 --tool-call-parser qwen3_coder \
 --gpu-memory-utilization 0.8
📊 性能实测(DGX Spark GB10)

加载模型后,显存及 GPU 使用

指标结果
GPU 使用率>90%
显存占用(模型加载后)~110+ GB
推理吞吐~35–45 tokens/sec(实测:单次请求最大 40±5)

✅ 输出 token 速率与测评一致,甚至好于预期,可能得益于 FlashAttention 的优化。运行 1 个请求时约 40 tokens/秒;运行 2 个请求时可提升至 59~70 tokens/秒。


四、部署 Open WebUI(本机非容器模式)

4.1 启动服务

使用 uvx 启动,与 vLLM 共用 Python 虚拟环境。

HF_ENDPOINT=https://hf-mirror.com \
DATA_DIR=~/open-webui/data \
 uvx --python3.12 \
 open-webui@latest serve \
--port 8080

✅ 访问地址:http://<dgx-spark-ip>:8080
⚠️ 若运行于 DGX Spark 本机,直接打开 http://localhost:8080

4.2 连接 vLLM 后端

在 Open WebUI 中配置,管理员面板 -> 设置 -> 外部连接,OpenAI 接口,点击加号:

字段值
Urlhttp://localhost:8000/v1
模型 ID(留空或填 Qwen/Qwen3-Coder-Next-FP8)
密钥(留空)

✅ 配置成功后测试:点击 验证链接,应显示 已验证服务器链接。


五、容器化部署 Open WebUI(跨主机场景)

若需在 Win11 等本地工作站通过 Docker Desktop 访问 DGX Spark 上的服务,可采用跨主机通信方案。

5.1 架构图示

Local Workstation (Win11 + Docker Desktop)
↓ HTTP/1.1 over TCP
NVIDIA DGX Spark (GB10)
GPU: Blackwell | CPU: Grace (aarch64) | CUDA: 13.0
📦 vLLM Service (端口 8000)
🐳 Docker Desktop
🌐 Open WebUI Container (端口 3000)
🔄 NVIDIA Sync (Custom) 映射 host:8000 → dgx-spark:8000

5.2 创建并运行容器

创建 docker-compose.yml 文件:

services:
  openwebui:
    image: ghcr.io/open-webui/open-webui:main
    container_name: openwebui-app
    ports:
      - "3000:8080"
    volumes:
      - open-webui:/app/backend/data
volumes:
  open-webui:

在命令窗口运行:

docker compose up -d

💡 注意:如果 C 盘空间不足,Docker Desktop 可以迁移 WSL 镜像的位置。在设置 -> Resources -> Docker Engine 指定 data-root 的位置。

5.3 配置端口映射

在 NVIDIA Sync 增加 custom 的端口映射,将宿主机的 8000 端口映射到 DGX Spark 的 8000 端口。

5.4 配置 OpenWebUI 容器连接 vLLM

在容器中配置连接地址:

http://host.docker.internal:8000/v1
(若 host.docker.internal 不可用,可改为 DGX Spark 宿主机局域网 IP)


六、模型采样参数推荐

针对 Qwen3-Coder-Next-FP8,建议如下参数配置以平衡代码生成的创造性与准确性:

参数推荐值说明
temperature1.0代码生成任务平衡创造性与准确性
top_p0.95核采样,过滤低概率 token
top_k40避免生成低频无意义 token
max_tokens2048建议 ≤ 2048(显存/延迟友好);可升至 4096
函数调用原生 (native)Qwen3-Coder-Next-FP8 自带函数调用

参考 ModelScope 模型库配置。在 Open WebUI → 管理员面板 → 模型 → Qwen/Qwen3-Coder-Next-FP8 → 高级参数 中配置后,所有新会话自动生效。


七、故障排查(aarch64 / CUDA 13.0 专项)

问题解决方案
ImportError: libcurand.so.10...确认 CUDA Toolkit 13.0 安装完整:apt install nvidia-cuda-toolkit(系统默认包已经安装)
CUDA driver version is insufficientnvidia-smi 显示驱动版本 ≥ 550.54.15(DGX Spark 默认已满足)
FlashAttention 加载失败确认 wheel 名称含 linux_aarch64 且 cu130;禁用 -no-build-isolation 时需手动安装 nvidia-cu-cdp-dev
vLLM 启动报 Triton not installed重新运行 uv pip install --upgrade triton,确保 ≥3.6.0

🔍 关键诊断命令:随时检查 nvidia-smi 状态及日志输出。


八、参考资料

  • NVIDIA DGX Spark 官方技术文档
  • vLLM aarch64 + GPU 安装指南
  • Qwen3-Coder-Next-FP8 模型库
  • DGX Spark 上安装使用 vLLM
  • Open WebUI 快速上手指南 python+uv

目录

  1. DGX Spark 部署 vLLM + Open WebUI 运行 Qwen3-Coder-Next-FP8(CUDA 13.0)
  2. 一、初始化 vLLM 部署环境
  3. 二、安装依赖(FlashAttention 2.8.3 + Triton 3.6.0)
  4. 2.1 安装 FlashAttention
  5. 方案 A:预编译 wheel(首选)
  6. 示例:假设已下载 wheel(替换为实际路径)
  7. uv pip install /path/to/flashattn-2.8.3+cu130torch2.5.0cxx11abiFALSE-cp312-cp312-linuxaarch64.whl --no-build-isolation --no-cache-dir
  8. 方案 B:源码编译(若无 wheel)
  9. 2.2 升级 Triton
  10. 三、部署 vLLM(aarch64, CUDA 13.0)
  11. 3.1 安装 vLLM
  12. 获取最新版本号(自动解析 tag,去掉 'v' 前缀)
  13. 固定参数(DGX Spark 环境)
  14. 安装 wheel(使用官方 GitHub Releases + PyTorch cu130 索引)
  15. 3.2 启动 vLLM 推理服务
  16. 📊 性能实测(DGX Spark GB10)
  17. 四、部署 Open WebUI(本机非容器模式)
  18. 4.1 启动服务
  19. 4.2 连接 vLLM 后端
  20. 五、容器化部署 Open WebUI(跨主机场景)
  21. 5.1 架构图示
  22. 5.2 创建并运行容器
  23. 5.3 配置端口映射
  24. 5.4 配置 OpenWebUI 容器连接 vLLM
  25. 六、模型采样参数推荐
  26. 七、故障排查(aarch64 / CUDA 13.0 专项)
  27. 八、参考资料
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • OpenClaw 免费 AI 大模型选型与配置指南
  • Vue Router 核心功能与进阶使用指南
  • Flutter 三方库 bones_ui 的鸿蒙化适配指南
  • GitHub Copilot 学生认证与使用指南
  • C++ priority_queue 优先级队列详解与模拟实现
  • 基于 Rokid 灵珠平台打造 AI Glasses 作业助手
  • Python aespy 包语法、参数与实战案例
  • 树莓派 4B 连接大疆 M300 无人机开发指南
  • Python 十大常用数据可视化工具库详解与使用指南
  • C++ 哈希表原理与实现详解
  • 链表分割:以指定值 x 为基准划分链表
  • Java 中间件:Dubbo 服务降级(Mock 机制)
  • Gomoon 开源:一款支持多模型与本地向量化存储的桌面大模型工具
  • 模拟算法:核心概念与经典例题实践
  • 文心大模型 4.5 开源发布,技术突破与生态展望
  • Coze 工作流实战:逻辑控制、数据处理与 AIGC 多媒体应用
  • 2025 机构技术栈:14 款 Web 模板与插件评审
  • Anaconda 与 Python 环境安装配置指南
  • Android Handler 消息机制深度解析
  • 数据结构核心:链表详解与实现

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online