混合知识库搭建：本地 Docker 部署 Neo4j 图数据库与 Milvus 向量库 | 极客日志

PythonAI算法

混合知识库搭建：本地 Docker 部署 Neo4j 图数据库与 Milvus 向量库

基于 Docker 本地部署 Neo4j 图数据库与 Milvus 向量库以构建混合知识库的方法。通过 LangChain 实现非结构化文本到图结构的自动转换，利用 Few-shot 优化 Cypher 查询准确性。同时演示了文档分块、向量索引构建及检索链（RAG）配置。文章阐述了“图 + 向量”双引擎在关系型知识与语义型知识检索中的互补优势，并提供了协同调度逻辑与常见问题解决方案，适用于多代理 RAG 系统的知识底座搭建。

颠三倒四发布于 2026/4/5更新于 2026/7/2044 浏览

混合知识库搭建：本地 Docker 部署 Neo4j 图数据库与 Milvus 向量库

1 混合知识库的设计逻辑：为什么需要'图 + 向量'双引擎？

1.1 单一知识库的局限性

纯图数据库：擅长实体关系查询（如'小米的合作品牌'），但无法高效处理细粒度文本检索（如'苹果的环保目标细节'）；
纯向量数据库：擅长语义相似性检索（如'查找与 5G 技术相关的内容'），但难以挖掘实体间的复杂关联（如'华为 - 开发 - 鸿蒙 - 适配 - 智能设备'）。

1.2 混合知识库的核心优势

'Neo4j 图库+Milvus 向量库'的组合，完美弥补了单一知识库的短板：

互补覆盖：图库处理'关系型知识'，向量库处理'语义型知识'，覆盖结构化、半结构化、非结构化知识场景；
提升效率：关系查询走图库，语义查询走向量库，避免单一知识库的'一刀切'检索瓶颈；
适配多代理：graph_kg 代理调用图库，vec_kg 代理调用向量库，实现代理与知识库的精准绑定。

2 本地 Docker 部署：Neo4j 图数据库搭建

2.1 部署准备

依赖环境：Docker 已启动（参考 Docker Compose 配置）；
核心端口：7474（Web 管理界面）、7687（Bolt 协议端口，代码连接核心）；
初始配置：用户名 neo4j，密码 password（Docker Compose 中已预设）。

2.2 启动与验证

启动服务：通过 Docker Compose 启动 Neo4j；
Web 界面验证：浏览器访问 http://localhost:7474，输入用户名密码登录，首次登录需修改密码（保持与代码配置一致）；
代码连接验证：通过 LangChain 的 Neo4jGraph 类测试连接，核心代码：

from langchain_community.graphs import Neo4jGraph

# 初始化 Neo4j 连接
graph = Neo4jGraph(
    url='bolt://localhost:7687',
    username="neo4j",
    password="password", # 与 Web 界面修改后的密码一致
    database="neo4j"
)
print("Neo4j 连接成功！")

2.3 数据建模：从文本到图结构的自动转换

系统通过 LLMGraphTransformer 将非结构化文本（如 doc/company.txt）自动转换为图结构（实体 + 关系），无需手动建模，核心流程如下：

2.3.1 核心依赖

from langchain_experimental.graph_transformers import LLMGraphTransformer
from langchain_core.documents import Document

2.3.2 数据加载与转换

相关免费在线工具

加密/解密文本
使用加密算法（如AES、TripleDES、Rabbit或RC4）加密和解密文本明文。在线工具，加密/解密文本在线工具，online
RSA密钥对生成器
生成新的随机RSA私钥和公钥pem证书。在线工具，RSA密钥对生成器在线工具，online
Mermaid 预览与可视化编辑
基于 Mermaid.js 实时预览流程图、时序图等图表，支持源码编辑与即时渲染。在线工具，Mermaid 预览与可视化编辑在线工具，online
随机西班牙地址生成器
随机生成西班牙地址（支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选），支持数量快捷选择、显示全部与下载。在线工具，随机西班牙地址生成器在线工具，online
Gemini 图片去水印
基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印，支持批量处理与下载。在线工具，Gemini 图片去水印在线工具，online
curl 转代码
解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。在线工具，curl 转代码在线工具，online

import os

# 1. 加载文本知识库（公司相关文本）
current_dir = os.path.dirname(os.path.abspath(__file__))
company_txt_path = os.path.normpath(os.path.join(current_dir, "doc", "company.txt"))
with open(company_txt_path, 'r', encoding="utf-8") as file:
    content = file.read()
documents = [Document(page_content=content)]

# 2. 初始化 LLMGraphTransformer（通过大模型自动提取实体与关系）
graph_llm = ChatOpenAI(temperature=0, model_name="qwen-plus-2025-12-01", api_key=key, base_url=base_url)
graph_transformer = LLMGraphTransformer(llm=graph_llm)

# 3. 文本→图结构转换（实体：如 Company、Technology；关系：如 DEVELOPS、COOPERATES_WITH）
graph_documents = graph_transformer.convert_to_graph_documents(documents)

# 4. 插入 Neo4j 图数据库
graph.add_graph_documents(graph_documents)
print(f"成功插入{len(graph_documents)}个图文档，包含实体数：{len(graph_documents[0].nodes)}")

实体类型	实体示例	关系类型	关系示例
Company	小米科技有限责任公司、华为技术有限公司	DEVELOPS	华为→DEVELOPS→鸿蒙操作系统
Technology	5G 通信技术、智能手表芯片	COOPERATES_WITH	小米→COOPERATES_WITH→高通
Operating_system	鸿蒙操作系统、MIUI	ADOPTS	华为手机→ADOPTS→鸿蒙操作系统

from langchain_core.prompts import PromptTemplate
from langchain_community.chains.graph_qa.cypher import GraphCypherQAChain

# 1. Few-shot 示例（覆盖常见查询场景）
examples = [
    {"question": "都有哪些公司？", "query": "MATCH (c:Company) RETURN c.id"},
    {"question": "小米在技术创新方面有什么突破？", "query": "MATCH (c:Company)-[r:DEVELOPS|INTRODUCES]->(t) WHERE c.id CONTAINS '小米' RETURN c.id as company, type(r) as relation, t.id as technology"},
    {"question": "华为的鸿蒙操作系统有什么特点？", "query": "MATCH (c:Company)-[:DEVELOPS]->(os:Operating_system) WHERE c.id CONTAINS '华为' RETURN os.id"}
]

# 2. 构建 Cypher 生成 Prompt
cypher_prompt_template = """You are a Neo4j Cypher expert. Generate syntactically correct Cypher queries. Schema: {schema} Important rules: 1. Company names are stored as FULL names (e.g., "小米科技有限责任公司"). ALWAYS use CONTAINS for partial matching 2. Use pattern: WHERE c.id CONTAINS 'keyword' instead of exact match 3. For relationships, use [:DEVELOPS|INTRODUCES] for technology/products 4. NEVER use undefined variables (like type(r) without defining r) Examples: {examples} Question: {question} Cypher:"""
cypher_prompt = PromptTemplate(
    template=cypher_prompt_template,
    input_variables=["schema", "question"],
    partial_variables={"examples": "\n".join([f"Q: {ex['question']}\nCypher: {ex['query']}" for ex in examples])}
)

# 3. 创建 Cypher QA Chain
cypher_chain = GraphCypherQAChain.from_llm(
    graph=graph,
    cypher_llm=llm,
    qa_llm=llm,
    cypher_prompt=cypher_prompt,
    validate_cypher=True, # 开启 Cypher 语法校验
    allow_dangerous_requests=True
)

from langchain_milvus import Milvus
from langchain_core.embeddings import Embeddings

# 1. 初始化 DashScope Embeddings（生成文本向量）
class DashScopeEmbeddings(Embeddings):
    def __init__(self, model: str, api_key: str):
        self.model = model
        self.api_key = api_key
    # 实现 embed_documents 和 embed_query 方法（参考项目代码）

embeddings = DashScopeEmbeddings(model="text-embedding-v4", api_key=key)

# 2. 连接 Milvus 并创建集合
vectorstore = Milvus(
    embedding=embeddings,
    connection_args={"uri": "http://localhost:19530"},
    collection_name="company_milvus",
    drop_old=True # 测试时删除旧集合，生产环境设为 False
)
print("Milvus 连接成功！")

from langchain_text_splitters import RecursiveCharacterTextSplitter

# 1. 文档分块（关键参数：chunk_size=250，chunk_overlap=30）
text_splitter = RecursiveCharacterTextSplitter(
    chunk_size=250, # 每个文本块最大长度（字符数）
    chunk_overlap=30, # 文本块重叠长度（避免上下文断裂）
    length_function=len
)
splits = text_splitter.split_documents(documents) # documents 为之前加载的公司文本
print(f"文档分块完成，共生成{len(splits)}个文本块")

# 2. 向量插入与索引构建（自动生成向量并创建 IVF_FLAT 索引）
vectorstore = Milvus.from_documents(
    documents=splits,
    collection_name="company_milvus",
    embedding=embeddings,
    connection_args={"uri": "http://localhost:19530"},
    drop_old=True
)
print("Milvus 向量索引构建完成！")

from langchain_core.prompts import PromptTemplate
from langchain_core.output_parsers import StrOutputParser

# 1. 构建检索器（设置返回 Top2 相关文本块）
retriever = vectorstore.as_retriever(search_kwargs={"k": 2})

# 2. 构建 RAG 生成 Prompt（限制响应长度，确保简洁）
prompt = PromptTemplate(
    template="""You are an assistant for question-answering tasks. Use the following pieces of retrieved context to answer the question. If you don't know the answer, just say that you don't know. Use three sentences maximum and keep the answer concise: Question: {question} Context: {context} Answer: """,
    input_variables=["question", "context"],
)

# 3. 构建 RAG 链（检索→Prompt→生成→解析）
rag_chain = prompt | graph_llm | StrOutputParser()

# 4. 测试检索与生成
user_question = "苹果公司的环保目标是什么？"
docs = retriever.invoke(user_question) # 向量检索
response = rag_chain.invoke({"context": docs, "question": user_question}) # 生成响应
print(f"检索结果：{response}")

混合知识库搭建：本地 Docker 部署 Neo4j 图数据库与 Milvus 向量库

混合知识库搭建：本地 Docker 部署 Neo4j 图数据库与 Milvus 向量库

1 混合知识库的设计逻辑：为什么需要'图 + 向量'双引擎？

1.1 单一知识库的局限性

1.2 混合知识库的核心优势

2 本地 Docker 部署：Neo4j 图数据库搭建

2.1 部署准备

2.2 启动与验证

2.3 数据建模：从文本到图结构的自动转换

2.3.1 核心依赖

2.3.2 数据加载与转换

微信扫一扫，关注极客日志

更多推荐文章

相关免费在线工具

2.3.3 自动生成的图结构示例

2.4 Cypher 查询优化：Few-shot 提升准确性

2.4.1 配置 Few-shot 示例与 Prompt

2.4.2 优化效果

3 本地 Docker 部署：Milvus 向量数据库搭建

3.1 部署准备

3.2 启动与验证

3.3 向量索引构建：文档分块与向量插入

3.3.1 核心流程代码

3.3.2 分块策略优化说明

3.4 向量检索配置：Retriever 与 RAG 链构建

3.4.1 核心代码

3.4.2 检索参数优化

4 混合知识库协同逻辑：何时用图库？何时用向量库？

4.1 核心决策规则

4.2 协同执行示例

4.3 双库协同优势

5 常见问题与优化技巧

5.1 Neo4j 图库常见问题

5.1.1 Cypher 生成错误

5.1.2 实体重复或关系错乱

5.2 Milvus 向量库常见问题

5.2.1 检索结果不精准

5.2.2 向量插入失败

5.3 性能优化技巧

6 总结

微信扫一扫，关注极客日志

更多推荐文章

相关免费在线工具