
DGX Spark 部署 vLLM + Open WebUI 运行 Qwen3-Coder-Next-FP8(CUDA 13.0 兼容版)
DGX Spark 部署 vLLM 推理服务并接入 Open WebUI 的完整流程。涵盖 FlashAttention 编译、vLLM wheel 安装、Qwen3-Coder-Next-FP8 模型加载等关键步骤。适配 aarch64 + CUDA 13.0 环境,支持单卡模式及容器化部署方案。提供性能实测数据、模型采样参数推荐及故障排查指南,适用于生产环境直接部署。
















