跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

基于 VLLM 部署 Qwen3-Embedding 模型实践

在 Ubuntu 环境下使用 vLLM 部署 Qwen3-Embedding-0.6B 模型的完整流程。内容涵盖环境配置、通过 ModelScope 下载模型、启动 Embedding 服务以及使用 OpenAI 兼容接口进行 Python 调用的代码示例。

星云发布于 2026/3/27更新于 2026/9/979 浏览
基于 VLLM 部署 Qwen3-Embedding 模型实践

文章配图

环境

系统:Ubuntu 20.04(NVIDIA 2080Ti)

版本信息:

  • vLLM: 0.10.0
  • Python: 3.10

选择最轻量级的 0.6B 级别模型。

模型下载

推荐从 ModelScope 下载以下两个模型:

  1. Embedding:https://www.modelscope.cn/models/Qwen/Qwen3-Embedding-0.6B
  2. Reranker:https://www.modelscope.cn/models/Qwen/Qwen3-Reranker-0.6B

安装 modelscope 并下载到指定路径:

pip install modelscope
modelscope download --model Qwen/Qwen3-Embedding-0.6B
modelscope download --model Qwen/Qwen3-Reranker-0.6B

vLLM 环境直接安装即可:

pip install vllm

Embedding 服务

vLLM 服务启动脚本如下:

VLLM_USE_V1=0 vllm serve /home/piqd/projects/simple_serving/models/Qwen/Qwen3-Embedding-0.6B/ \
  --port 8000 \
  --task embed \
  --trust-remote-code

vLLM 相关参数可参考官方文档:vLLM Documentation

Python 调用

需要提前安装 openai 库,脚本如下:

# SPDX-License-Identifier: Apache-2.0
# SPDX-FileCopyrightText: Copyright contributors to the vLLM project
from openai import OpenAI
from loguru import logger

# 修改 OpenAI 的 API key 和 API base 以使用 vLLM 的 API 服务器
openai_api_key = "EMPTY"
openai_api_base = "http://localhost:8000/v1"

def main():
    client = OpenAI(
        api_key=openai_api_key,
        base_url=openai_api_base,
    )
    response = client.embeddings.create(
        model="Qwen/Qwen3-Embedding-0.6B",
        input=["Hello world"],
    )
    logger.info(response.data[0].embedding)

if __name__ == "__main__":
    main()

目录

  1. 环境
  2. 模型下载
  3. Embedding 服务
  4. Python 调用
  5. SPDX-License-Identifier: Apache-2.0
  6. SPDX-FileCopyrightText: Copyright contributors to the vLLM project
  7. 修改 OpenAI 的 API key 和 API base 以使用 vLLM 的 API 服务器

更多推荐文章

查看全部
  • 商汤开源 SenseNova-MARS:多模态搜索推理模型突破
  • AJAX 原始请求详解:XMLHttpRequest 对象使用指南
  • Ollama 本地部署与运行开源大模型指南
  • 2026 GitHub 热门 Python 项目:AI 代理与数据工具
  • 高鋒集團合夥人兼 Web3Labs 行政總裁黃俊瑯:以資本與生態賦能傳統企業 Web3 轉型
  • MIDI 全解析:从协议底层到 Python 实操,音乐开发与 AI 作曲
  • CTFShow Web 入门:题目 21-28 爆破解析
  • FPGA 原理与典型应用场景解析
  • AI 时代前端工程师的核心职责:从静态页面到智能交互架构
  • 青海少年 AI 农业创业:基于 ViT 的病虫害检测系统
  • 二分查找算法详解:核心原理与实战应用
  • 企业微信群机器人添加点击链接教程:图文与 Markdown 实现
  • Llama-2-7b 在昇腾 NPU 上的六大核心场景性能基准测试
  • 搞懂 AI 前端:它和普通前端到底差在哪,又该怎么学
  • node-llama-cpp 安装与配置:Windows、Linux 和 Mac 全平台教程
  • VSCode Copilot 认证失败排查与修复技巧
  • Cubase 15 核心定位与潜在新功能分析
  • 深入理解 Web Worker
  • Windows 下 Git 常规操作:命令行与 TortoiseGit
  • OpenClaw 安全 AI 助理搭建指南:阿里云 Docker 本地部署方案

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online