跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

DGX Spark 部署 vLLM 与 Open WebUI 运行 Qwen3-Coder-Next-FP8(CUDA 13.0)

DGX Spark Grace Blackwell 架构部署 vLLM 推理服务并接入 Open WebUI。涵盖 FlashAttention 编译、vLLM wheel 安装、Qwen3-Coder-Next-FP8 模型加载及性能测试。支持 aarch64 + CUDA 13.0 环境,提供本地及容器化部署方案,包含参数配置与故障排查指南。

DebugKing发布于 2026/3/22更新于 2026/7/2840 浏览
DGX Spark 部署 vLLM 与 Open WebUI 运行 Qwen3-Coder-Next-FP8(CUDA 13.0)

DGX Spark 部署 vLLM 与 Open WebUI 运行 Qwen3-Coder-Next-FP8

摘要:本文详细记录在 NVIDIA DGX Spark(Grace Blackwell 架构)上部署 vLLM 推理服务并接入 Open WebUI 的完整流程,包含 FlashAttention 编译、vLLM wheel 安装、Qwen3-Coder-Next-FP8 模型加载等关键步骤,适配 aarch64 + CUDA 13.0 环境。

硬件平台:NVIDIA DGX Spark(Grace Blackwell GB10 架构) 操作系统:Ubuntu 24.04.4 LTS(aarch64) CUDA Version:13.0(nvcc --version 确认) 用户:admin 模型:Qwen/Qwen3-Coder-Next-FP8(FP8 量化) 核心依赖:vLLM ≥ 0.15.1(需支持 CUDA 13.0 + aarch64 + cu130 wheel)

一、初始化 vLLM 部署环境

mkdir -p ~/vllm
cd ~/vllm
uv venv --python 3.12 --seed-source .venv/bin/activate
pip install torch==2.9.1+cu130 --index-url=https://download.pytorch.org/whl/cu130
uv pip install setuptools==80.10.2
uv pip install packaging -U

二、依赖安装(FlashAttention 2.8.3 + Triton 3.6.0)

2.1 安装 FlashAttention(aarch64 + CUDA 13.0)

当前 FlashAttention 官方暂未提供 cu130 + aarch64 的预编译 wheel。推荐下载社区构建版本或源码编译。

方案 A:预编译 wheel(首选)
# 替换为实际路径
uv pip install /path/to/flash_attn-2.8.3+cu130torch2.5.0cxx11abiFALSE-cp312-cp312-linux_aarch64.whl --no-build-isolation --no-cache-dir
方案 B:源码编译(若无 wheel)
export MAX_JOBS=4
export CMAKE_BUILD_PARALLEL_LEVEL=2
uv pip install flash-attn --no-build-isolation --no-cache-dir

注意:源码编译需提前安装 build-essential, cmake, nvidia-cuda-toolkit, python3-dev。

2.2 升级 Triton 至 3.6.0+

uv pip install --upgrade "triton>=3.6.0"

三、部署 vLLM(aarch64, CUDA 13.0)

3.1 安装 vLLM

官方 vLLM ≥ v0.15.1 已提供 cu130 + aarch64 wheel。

export VLLM_VERSION=$(curl -s https://api.github.com/repos/vllm-project/vllm/releases/latest | jq -r '.tag_name' | sed 's/^v//')
export CUDA_VERSION=130
export CPU_ARCH=$(uname -m)
uv pip install \
  https://github.com/vllm-project/vllm/releases/download/v${VLLM_VERSION}/vllm-${VLLM_VERSION}+cu${CUDA_VERSION}-cp38-abi3-manylinux_2_35_${CPU_ARCH}.whl \
  --extra-index-url https://download.pytorch.org/whl/cu${CUDA_VERSION}

3.2 启动 vLLM 推理服务(单卡模式)

VLLM_USE_MODELSCOPE=true \
  vllm serve \
  Qwen/Qwen3-Coder-Next-FP8 \
  --port 8000 \
  --tensor-parallel-size 1 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder \
  --gpu-memory-utilization 0.8
性能实测(DGX Spark GB10)
指标结果
GPU 使用率>90%
显存占用(模型加载后)~110+ GB
推理吞吐~35–45 tokens/sec

四、部署 Open WebUI(本地非容器)

4.1 启动服务

HF_ENDPOINT=https://hf-mirror.com \
DATA_DIR=~/open-webui/data \
uvx --python3.12 open-webui@latest serve \
--port 8080

访问地址:http://<dgx-spark-ip>:8080

4.2 连接 vLLM 后端

在 Open WebUI 管理员面板 -> 设置 -> 外部连接,OpenAI 接口,点击加号:

字段值
Urlhttp://localhost:8000/v1
模型 IDQwen/Qwen3-Coder-Next-FP8
密钥留空

五、容器化部署 Open WebUI(跨主机)

5.1 架构图

Local Workstation (Win11 + Docker Desktop) <-> NVIDIA DGX Spark (GB10)

推理负载通过 HTTP/1.1 over TCP 传输。

  • GPU: Blackwell
  • CPU: Grace (aarch64)
  • CUDA: 13.0
  • vLLM Service: 端口 8000
  • Open WebUI Container: 端口 3000

5.2 创建并运行容器

创建 docker-compose.yml 文件:

services:
  openwebui:
    image: ghcr.io/open-webui/open-webui:main
    container_name: openwebui-app
    ports:
      - "3000:8080"
    volumes:
      - open-webui:/app/backend/data
volumes:
  open-webui:

运行命令:

docker compose up -d

5.3 配置端口映射

确保宿主机端口映射到 DGX Spark 宿主机局域网 IP。

5.4 配置 Open WebUI 连接 vLLM 地址

配置:http://host.docker.internal:8000/v1

六、模型采样参数推荐

参数推荐值说明
temperature1.0代码生成任务平衡创造性与准确性
top_p0.95核采样,过滤低概率 token
top_k40避免生成低频无意义 token
max_tokens2048建议 ≤ 2048;可升至 4096
函数调用原生 (native)Qwen3-Coder-Next-FP8 自带函数调用

七、故障排查

问题解决方案
ImportError: libcurand.so.10...确认 CUDA Toolkit 13.0 安装完整
CUDA driver version is insufficientnvidia-smi 显示驱动版本 ≥ 550.54.15
FlashAttention 加载失败确认 wheel 名称含 linux_aarch64 且 cu130
vLLM 启动报 Triton not installed重新运行 uv pip install --upgrade triton

八、参考资料

  • NVIDIA DGX Spark 官方技术文档
  • vLLM aarch64 + GPU 安装指南
  • Open WebUI 快速上手指南

目录

  1. DGX Spark 部署 vLLM 与 Open WebUI 运行 Qwen3-Coder-Next-FP8
  2. 一、初始化 vLLM 部署环境
  3. 二、依赖安装(FlashAttention 2.8.3 + Triton 3.6.0)
  4. 2.1 安装 FlashAttention(aarch64 + CUDA 13.0)
  5. 方案 A:预编译 wheel(首选)
  6. 替换为实际路径
  7. 方案 B:源码编译(若无 wheel)
  8. 2.2 升级 Triton 至 3.6.0+
  9. 三、部署 vLLM(aarch64, CUDA 13.0)
  10. 3.1 安装 vLLM
  11. 3.2 启动 vLLM 推理服务(单卡模式)
  12. 性能实测(DGX Spark GB10)
  13. 四、部署 Open WebUI(本地非容器)
  14. 4.1 启动服务
  15. 4.2 连接 vLLM 后端
  16. 五、容器化部署 Open WebUI(跨主机)
  17. 5.1 架构图
  18. 5.2 创建并运行容器
  19. 5.3 配置端口映射
  20. 5.4 配置 Open WebUI 连接 vLLM 地址
  21. 六、模型采样参数推荐
  22. 七、故障排查
  23. 八、参考资料
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • Stable Diffusion 各版本技术详解
  • 通义千问 Qwen 系列拆解:架构、开源与落地
  • node-llama-cpp 跨平台安装与配置指南:Windows、Linux 和 Mac
  • 2025年免费用数字人工具:五款平台实际体验
  • AI 提示词重构建议:提升代码可读性的实战指南
  • llamafile 使用指南:下载、配置与运行
  • Java String.format() 完整用法指南
  • VS Code 刷新 Python 包报错:Failed to run python -m pip list 修复方案
  • Whisper-large-v3 持续集成:GitHub Actions 自动测试与模型版本灰度发布
  • OpenClaw 龙虾机器人本地部署与配置指南
  • OpenClaw 龙虾机器人本地部署与进阶配置指南
  • Python + Neo4j 构建知识图谱实战指南
  • JavaAI 辅助构建 SpringBoot 项目的实战体验
  • Linux 系统安装 JDK 指南
  • 用 AI 独立完成前端设计:ASCII 原型、SVG 线稿与代码生成
  • Linux 网络编程基础:UDP Socket 核心接口详解
  • ZeroClaw Gateway + LM Studio + Reflex 本地 AI 管理面板搭建
  • Vue 实例劫持突破 Web 编辑器粘贴限制
  • OpenClaw 及其六大开源替代方案对比与选型指南
  • Flet:Python 全栈开发者的跨平台应用框架

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online