Qwen3-Embedding-4B 本地部署:llama.cpp 与 vLLM 集成
综述由AI生成Qwen3-Embedding-4B 是面向向量检索的 4B 级 embedding 模型,支持 32k 长文本、2560 维输出和多语言场景。文章分别给出两种本地部署路径:用 llama.cpp 直接加载官方 GGUF 量化模型,适合轻量推理;用 vLLM 配合 FastAPI 和 Open WebUI 封装标准 Embedding 接口,适合带知识库和交互界面的方案。整体结论是,前者省事,后者更完整,选型主要看机器资源和是否需要 R…








