跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

RAG、本地知识库、向量数据库与知识图谱的区别与联系

详细解析了 RAG(检索增强生成)技术与本地知识库、向量数据库及知识图谱之间的联系与区别。RAG 旨在解决大模型知识更新滞后、幻觉及知识不足等问题,通过检索外部资料增强生成效果。本地知识库是内部资料的集合,向量数据库基于语义存储数据,知识图谱则侧重数据间的关联关系。三者均可作为 RAG 的数据源或存储载体,但技术本质不同。文章还探讨了传统数据库在 RAG 中的应用,并提供了大模型学习的系统化路径建议。

kaikai发布于 2025/2/7更新于 2026/7/2550 浏览
RAG、本地知识库、向量数据库与知识图谱的区别与联系

RAG、本地知识库、向量数据库与知识图谱的区别与联系

前言

RAG 的本质是高效检索,而知识库、向量数据库和知识图谱只是组织数据的一种形式。很多人对 RAG 技术还没有一个本质的认识,以及与其相关的本地知识库、向量数据库等概念。

本文将介绍这些概念,以及它们的联系与区别。

RAG——检索增强生成

背景与目的

RAG(Retrieval-Augmented Generation)技术是基于大模型文本生成而产生的一种技术,目的是解决大模型的缺陷问题。简单来说,RAG 相当于给大模型配备了一个资料库,遇到不懂的问题不要胡扯,先去查查资料。

大模型主要缺陷包括:

  1. 知识更新不及时:大模型的知识仅限于训练数据的截止时间,无法获取之后的知识。
  2. 大模型幻觉问题:大模型一本正经地胡说八道。
  3. 大模型知识不足:大模型的知识有限,很多垂直领域的知识它都不知道。

运作流程

完整呈现了 RAG 的运作流程,主要分为三个部分:

  1. 创建资料库
  2. 查资料
  3. 带着资料问问题
生活化类比

你是一个学生,有一天遇到一个你不懂的问题;然后,你爸妈就让你去问邻居家上大学的哥哥姐姐。如果是一些常识性的问题,那么他们可以直接告诉你结果。

但你这个问题比较特殊,涉及到具体的专业知识,比如说化学、物理等;这时上大学的哥哥姐姐可能也不知道该怎么回答你的问题,但以他多年的学习经验,他觉得这个问题他可以解决,但需要先看一下你的课本或资料。

这个步骤就是 RAG 中的第三步,你就是用户,大模型就是邻家的哥哥姐姐;而你比较聪明,在来的时候就怕哥哥姐姐需要看你的课本,你随身就把课本和资料给带着了;这个就是第二步。

然后,邻家的哥哥姐姐看了一会你的课本,然后告诉你这个问题应该怎么给你讲,然后你的问题就解决了。

为什么需要这三步?

因为大模型上面的缺陷,所以导致大模型能力并不是很强,因此有些东西需要查资料才能知道。但怎么才给大模型建一个资料库呢?

这就是第一步,比如需要从不同的文档加载数据,如 Word、PDF、TXT、音频、视频等;然后需要把这些文档中有关联的数据放到一块,这个就叫做嵌入(Embedding),最后把这些数据存储到一个地方,比如向量数据库。

第二步就是检索,有了这些资料之后,怎么才能根据不同的问题,从中找到相关联的资料。比如,你不可能因为一个历史问题就去翻阅整个永乐大典;所以这就需要一种检索技术,比如目录/索引。

接着是第三步,你带着第二步检索到的数据给到大模型,然后大模型就可以根据这些数据来回答你的问题。这时你可能会说,既然有了这些资料你自己看不就行了,还要大模型干什么;那如果你是公司客服,你会为每个用户都重新介绍一下你们公司的产品和企业文化吗?

而这就是整个 RAG 技术的实现流程,每个环节又涉及到不同的技术。比如第一步创建资料库,需要文档加载技术、分词技术、嵌入技术等;第二步需要向量化技术、准确高效的检索技术等;第三步需要提示词技术、大模型调用技术等,因为第二步查到的资料需要放到提示词中让大模型自己去'看'。

所以,从这里也可以看出,严格来说 RAG 技术和大模型没太大直接关系(这里的没关系是指进行业务处理的大模型,而文档嵌入本质上使用的也是嵌入大模型)。大模型不管你使用的是什么资料库,也不关心你查到了哪些资料,大模型关心的只是你最后在提示词中携带的资料。

大模型与本地知识、向量数据和知识图谱

什么是本地知识库?

本地知识库说白了就是资料库的一种,比如说你们公司的技术档案、销售记录、公司的规章制度等都属于本地知识库的范围。本地知识库的作用是把一个组织内部的资料梳理出来方便大家使用。

所以,本地知识库的本质是资料库;而这个资料库可以有多种不同的组织形式,比如以文档、书籍、或者网页、视频、甚至是会议记录等形式存在,也可能是多种形式的混合。

什么是向量数据库?

向量数据库是一种存储数据的方式,只不过由于大模型的出现,导致基于以前的字符存储变成了基于语义的向量存储。向量数据库从功能上来说和传统的数据库没有本质区别,不论是 MySQL,还是 Redis;只不过传统的数据库是基于字符匹配,而向量数据库基于语义匹配(本质上一种数学模型,如欧式距离和余弦函数)。

向量数据库既然是数据库,那么它就具备数据库的特性,存储数据和查询数据;它是数据存储的载体,就类似于工作中的文件夹。

什么是知识图谱?

所谓的知识图谱是由谷歌推出的一种搜索引擎技术,面对互联网中日益增长的数据,怎么表示这些数据,以及这些数据之间的关系成为了一个难题。因此,谷歌就推出了知识图谱技术,用这个方式去记录这些数据及其关联关系。

说白了知识图谱就是一种组织数据的方式,比如我们日常工作和生活中,会按照日期、地点、任务名称等来存放不同的文件、资料。

三者之间的关系

本地知识库即可以使用简单的日期、部门、工作任务来组织资料,也可以使用知识图谱这种更加专业的方式来搭建本地知识库。而搭建的本地知识库存储在什么地方?

即可以存储在传统的关系性数据库中,也可以存储在文本文件中,当然也可以存储在向量数据库中。

这就是其三者之间的关系。

它们和 RAG 又有什么关系?

前面说了,RAG 是为了解决大模型本身存在的几个缺陷。大模型需要的是你在提示词中拼接的最终资料,而不会关心你这个资料从哪里来。而 RAG 就是从外部检索资料然后拼接到大模型提示词中的一种方法论。

RAG 最终的目的就是准确、高效的检索到相关的资料。而不管是去知识图谱中检索,还是去本地知识库中检索,还是去向量数据库中检索,亦或者是从传统的关系型数据库中检索,或者直接去网络上搜索。

比如说,你想让大模型告诉你怎么做西红柿炒蛋,你需要的是使用 RAG 技术检索到做番茄炒蛋的内容,而不是告诉大模型哪里大米产量高,哪里发生了自然灾害,原子弹怎么造。

而至于你这个资料是从哪家餐厅的菜谱中找到的,还是从网络上搜索到的,或者还是路边听说的都可以。

问题:传统数据库可以用来做 RAG 吗?

答案是可以,比如说价格表这种精确的不需要语义检索的数据;使用传统数据库效果会更好。一般企业场景中是把语义检索和字符匹配同时使用,需要语义理解的就使用语义检索库,比如向量数据库;精确的数据就放到传统数据库中。

总结

RAG 是一种从外部检索数据的方式;本地知识库相当于一个资料库;而知识图谱是组织数据的一种更加科学的方式;向量数据库是用来存储向量化数据的一个载体。

所以,本地知识库、向量数据库和知识图谱和 RAG 没什么直接关系,如果说有关系就是它们三者可以作为 RAG 技术的一种具体实现;但 RAG 也可以使用其它的实现方式。

RAG、本地知识库、向量数据库、知识图谱是四个完全独立的技术,它们之间没有任何直接关系,但又可以互相合作以达到某种效果。

大模型学习建议

对于希望深入理解大模型技术的开发者,以下是一个系统化的学习路径参考:

阶段 1:AI 大模型时代的基础理解

  • 目标:了解 AI 大模型的基本概念、发展历程和核心原理。
  • 内容:人工智能简述与大模型起源、大模型与通用人工智能、GPT 模型的发展历程、模型工程方法论与实践。

阶段 2:AI 大模型 API 应用开发工程

  • 目标:掌握 AI 大模型 API 的使用和开发,以及相关的编程技能。
  • 内容:API 接口接入(OpenAI、Python)、Prompt 框架设计、流水线工程构建。

阶段 3:AI 大模型应用架构实践

  • 目标:深入理解 AI 大模型的应用架构,并能够进行私有化部署。
  • 内容:Agent 模型框架、MetaGPT、ChatGLM、LLaMA 等大模型架构分析。

阶段 4:AI 大模型私有化部署

  • 目标:掌握多种 AI 大模型的私有化部署,包括多模态和特定领域模型。
  • 内容:模型私有化部署概述、关键技术、实施步骤及应用场景。

通过上述路径的学习,可以更好地掌握 RAG 及相关技术的底层逻辑与应用实践。

目录

  1. RAG、本地知识库、向量数据库与知识图谱的区别与联系
  2. 前言
  3. RAG——检索增强生成
  4. 背景与目的
  5. 运作流程
  6. 生活化类比
  7. 为什么需要这三步?
  8. 大模型与本地知识、向量数据和知识图谱
  9. 什么是本地知识库?
  10. 什么是向量数据库?
  11. 什么是知识图谱?
  12. 三者之间的关系
  13. 它们和 RAG 又有什么关系?
  14. 问题:传统数据库可以用来做 RAG 吗?
  15. 总结
  16. 大模型学习建议
  17. 阶段 1:AI 大模型时代的基础理解
  18. 阶段 2:AI 大模型 API 应用开发工程
  19. 阶段 3:AI 大模型应用架构实践
  20. 阶段 4:AI 大模型私有化部署
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • llama.cpp 核心特性、技术原理与实用部署
  • AMD 显卡 AI 绘画:ComfyUI-Zluda 配置手册
  • FPGA开发工具对比:Vivado、Quartus与ModelSim
  • Neeshck-Z-lmage_LYX_v2 本地 AI 绘画工具搭建教程
  • VSCode 高效代码开发:Copilot 与 Cline 插件配置指南
  • Python 修改 pip 默认安装路径的几种方法
  • GitHub CLI 跨平台安装与配置指南
  • 国内环境部署 OpenClaw 个人 AI 助手指南
  • Home Assistant 界面美化实战:lovelace-soft-ui 配置指南
  • ToDesk 内置 ToClaw AI:零代码实现科技新闻日报自动化实战
  • QGroundControl 跨平台安装实战:Windows、macOS、Linux 与 Android 全配置
  • OpenClaw 集成本地 Ollama 与 Qwen WebUI 无响应排查指南
  • 前端状态管理实战:告别组件传参的噩梦
  • MySQL 约束详解:非空、主键与外键的核心作用
  • Harness Engineering 深度解读:AI Agent 时代的缰绳与马鞍
  • 如何用 AI 大模型解决实际问题:从房产短视频案例解析
  • Linux 网络基础:局域网通信与跨网段传输
  • 面向 C++ 开发的 Web 自动化测试入门:从概念到 Selenium 实战
  • ICCV2019 贝叶斯优化 1-Bit CNNs 方法解读
  • VS Code 中 Git 使用指南:从配置到协作

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online