跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

AI 四大核心技术详解:LLM、Agent、RAG 与 Skill

AI 核心技术涵盖 LLM、Agent、RAG 与 Skill。LLM 为系统大脑负责理解生成;RAG 利用检索增强解决幻觉与私有数据问题;Skill 封装工具赋予操作能力;Agent 整合规划与行动实现自主任务。文章结合 LangChain 代码示例阐述四者架构关系及企业客服、知识助手等实际应用场景。

FrontendX发布于 2026/3/30更新于 2026/7/2436 浏览
AI 四大核心技术详解:LLM、Agent、RAG 与 Skill

前言:AI 技术演进背景

2023 年被称为"AI 元年",ChatGPT 的出现让大语言模型(LLM)走进了大众视野。 但很快,我们发现单纯的大模型还不够:

  • ❌ 它不知道最新的新闻
  • ❌ 它不能操作你的电脑
  • ❌ 它无法完成复杂的多步骤任务

于是,Agent、RAG、Skill 这些技术应运而生。今天,我们就来聊聊这四大核心技术。

一、LLM:AI 的"大脑"

1.1 什么是 LLM?

LLM (Large Language Model),也就是我们要说的'大模型',比如 DeepSeek、GPT、Gemini 等。

它是谁?

它是整个 AI 系统的 '大脑'。它读过几乎全互联网的书,上知天文下知地理,能写诗、能写代码、能陪你聊天。

它的超能力
  • ✅ 理解力 Max:能听懂你在说什么。
  • ✅ 生成力 Max:能快速生成高质量的文本。
  • ✅ 推理力 Max:能处理复杂的逻辑问题。
1.2 常见的 LLM 有哪些?
模型公司特点
GPTOpenAI综合能力最强,多模态支持
ClaudeAnthropic代码能力强,上下文超长
GeminiGoogle多模态原生,免费额度多
DeepSeekDeepSeek国产之光,性价比超高,推理能力强
LlamaMeta开源可商用,本地部署
文心一言百度中文优化,国内可用
通义千问阿里开源版本多,生态丰富
Kimi月之暗面长文本处理能力突出
1.3 LLM 的局限性

虽然 LLM 很强大,但它有三大硬伤:

架构图

这就引出了我们今天要讲的另外三个技术:RAG、Skill、Agent。

二、RAG(检索增强生成):外挂知识库

2.1 什么是 RAG?
它是谁?

如果 LLM 是一个参加'开卷考试'的学生,那 RAG 就是他手边的 '教科书' 或者 '图书馆'。

为什么要用它?

当你要问 LLM 关于'你们公司最新的考勤制度'时,LLM 肯定不知道。 这时候,RAG 的作用就来了:

  1. 检索 (Retrieve):先去你们公司的文档库里,把'考勤制度'相关的段落找出来。
  2. 增强 (Augment):把这些段落和你的问题一起扔给 LLM。
  3. 生成 (Generate):LLM 看着这些资料,回答你的问题。
核心价值
  • ✨ 解决幻觉:有据可查,不再瞎编。
  • ✨ 数据私有化:不用把数据训练进模型,也能回答私有领域问题。
  • ✨ 实时性:文档更新了,回答自然就更新了。

找到相关资料 -> 结合资料回答 -> 用户提问 -> 检索 RAG -> LLM 大脑 -> 最终答案

2.2 RAG 的工作原理

架构图

三步走:

1️⃣ 索引(Indexing)

  • 把你的文档切分成小块
  • 用 Embedding 模型转成向量
  • 存入向量数据库(如 Chroma、Pinecone)

2️⃣ 检索(Retrieval)

  • 用户提问也转成向量
  • 在向量库中找最相似的文档块
  • 返回 Top-K 个相关片段

3️⃣ 生成(Generation)

  • 把检索到的内容 + 用户问题拼成 Prompt
  • 发给 LLM 生成最终答案
2.3 RAG 的实际应用
  • 📚 企业知识库问答:上传公司文档,员工随时提问
  • 📖 智能客服:基于产品手册自动回答用户问题
  • 🔍 论文检索:上传论文库,快速找到相关内容
  • 💻 代码助手:基于项目代码库回答技术问题
2.4 代码示例
# 使用 LangChain 实现简单 RAG(新版 API)
from langchain_openai import OpenAIEmbeddings, ChatOpenAI
from langchain_chroma import Chroma
from langchain_text_splitters import CharacterTextSplitter
from langchain_community.document_loaders import TextLoader
from langchain.chains import RetrievalQA

# 1. 加载文档
loader = TextLoader('公司手册.txt', encoding='utf-8')
documents = loader.load()

# 2. 切分文档
text_splitter = CharacterTextSplitter(chunk_size=1000, chunk_overlap=200)
texts = text_splitter.split_documents(documents)

# 3. 创建向量库
embeddings = OpenAIEmbeddings()
vectorstore = Chroma.from_documents(texts, embeddings)

# 4. 创建检索器
retriever = vectorstore.as_retriever(search_kwargs={"k":3})

# 5. 创建问答链
qa_chain = RetrievalQA.from_chain_type(
    llm=ChatOpenAI(model="gpt-4", temperature=0),
    chain_type="stuff",
    retriever=retriever
)

# 6. 提问
query = "公司的年假政策是什么?"
answer = qa_chain.invoke({"query": query})
print(answer["result"])

三、Skill:给 LLM 配备"工具箱"

3.1 什么是 Skill?
它是谁?

它是 Agent 手里的 '锤子'、'扳手'、'计算器'。

为什么需要它?

LLM 虽然聪明,但它不擅长做某些具体的事情,比如:

  • 精确数学计算(大模型算数很差,不如调个计算器)。
  • 获取实时天气(需要调天气 API)。
  • 操作 Excel(需要调 Python 脚本)。
  • 画图(需要调绘图模型)。

Skill 就是把这些具体的能力封装成函数或 API,让 Agent 可以随时调用。

Skill(技能) 就是让 LLM 能够调用外部工具的能力。 如果说 RAG 是给 LLM"补充知识",那 Skill 就是给 LLM"赋予能力"。

3.2 常见的 Skill 类型
类型示例用途
搜索工具Google Search、Bing API获取实时信息
计算工具Python 解释器、Wolfram Alpha精确计算
数据库工具SQL 查询、MongoDB数据操作
文件工具读写文件、处理 Excel文档处理
API 工具天气 API、股票 API获取外部数据
浏览器工具Puppeteer、Selenium网页操作
3.3 Skill 的工作原理
用户:"北京今天天气怎么样?"
↓ LLM 分析:需要获取实时天气信息
↓ LLM 决定:调用天气查询 Skill
↓ 执行 Skill:调用天气 API 获取数据
↓ LLM 生成:"北京今天晴,25°C..."

四、Agent:让 AI 成为"智能体"

4.1 什么是 Agent?

Agent,智能体。这是目前最让人兴奋的概念!

它是谁?

如果说 LLM 是'大脑',RAG 是'书',那 Agent 就是 '一个完整的人'。它不仅有大脑,还有 手(Tools) 和 耳目(Sensors)。

它能做什么?

Agent 不仅仅是'回答问题',它的核心是 '行动 (Action)'。 它能根据你的目标,自主拆解任务,调用工具,一步步完成工作。 Agent(智能体) 是 AI 的终极形态。

举个栗子 🌰: 你对 DeepSeek 说:'帮我订一张明天去北京的机票。'

  • 纯 LLM:只能告诉你怎么订票,或者给你写一段订票的代码。
  • Agent:
    1. 思考:需要先查航班,再选时间,最后支付。
    2. 行动 1:调用'携程 API'查询航班。
    3. 行动 2:发现余额不足(假设),调用'提醒工具'告诉你。
    4. 行动 3:最终帮你下单。

它不仅能理解、能生成,还能:

  • 🧠 自主规划:分解复杂任务,制定执行计划
  • 🔄 循环执行:多步骤任务自动推进
  • 🛠️ 工具调用:灵活使用各种 Skill
  • 💾 记忆管理:记住对话历史和中间结果
4.2 Agent 的核心架构

一个完整的 Agent 通常包含四大核心模块:Planning(规划)、Memory(记忆)、Tools(工具)、Action(执行),通过 ReAct 模式循环迭代完成任务。

架构图

4.3 ReAct:Agent 的经典范式

ReAct(Reasoning + Acting) 是 Agent 最常用的工作模式:

Thought(思考)→ Action(行动)→ Observation(观察)→ ... → Answer(回答)

示例:

用户:"苹果公司今年的营收是多少?"
Thought: 我需要搜索苹果公司最新的财务报告
Action: 调用搜索工具,搜索"Apple revenue 2024"
Observation: 找到 Apple 2024 Q4 财报,营收 xxx 亿美元
Thought: 我已经找到了答案
Action: 生成最终回答
Answer: 苹果公司 2024 年营收为 xxx 亿美元...
4.4 LangChain 实现 Agent
from langchain.agents import Tool, AgentExecutor, create_react_agent
from langchain_openai import ChatOpenAI
from langchain_community.utilities import SerpAPIWrapper
from langchain.chains import LLMMathChain

# 准备工具
search = SerpAPIWrapper()
llm = ChatOpenAI(model="gpt-4", temperature=0)
llm_math_chain = LLMMathChain(llm=llm)
tools = [
    Tool(
        name="Search",
        func=search.run,
        description="用于搜索实时信息"
    ),
    Tool(
        name="Calculator",
        func=llm_math_chain.run,
        description="用于数学计算"
    )
]

# 创建 Agent
agent = create_react_agent(llm, tools)
agent_executor = AgentExecutor(agent=agent, tools=tools, verbose=True)

# 运行
agent_executor.invoke({"input":"苹果公司 CEO 是谁?他今年多大了?"})

五、四者关系:一张图看懂

架构图

架构图

💡 干货总结
概念形象比喻核心作用关键词
LLM大脑 🧠理解、推理、生成通用、思考
RAG图书馆 📚提供准确、私有的知识检索、上下文
Skill工具箱 🛠️执行具体操作、弥补短板API、函数
Agent完整的人 🤖自主规划、完成复杂任务规划、行动

六、实际应用场景

6.1 智能客服机器人
用户:"我的订单什么时候到?"
Agent 分析:需要查询订单信息
↓ 调用 Skill:查询订单数据库
↓ 获取结果:预计明天送达
↓ 生成回复:"您的订单预计明天送达..."
6.2 企业知识助手
用户:"公司的报销流程是什么?"
RAG 检索:从知识库找到报销手册
↓ LLM 理解:提取关键步骤
↓ 生成回复:分步骤说明报销流程
6.3 编程助手
用户:"帮我写一个 Python 爬虫"
Agent 规划:
1. 分析需求
2. 编写代码
3. 解释代码
↓ 调用 Skill:代码生成 + 代码解释
↓ 输出:完整代码 + 使用说明

目录

  1. 前言:AI 技术演进背景
  2. 一、LLM:AI 的"大脑"
  3. 1.1 什么是 LLM?
  4. 它是谁?
  5. 它的超能力
  6. 1.2 常见的 LLM 有哪些?
  7. 1.3 LLM 的局限性
  8. 二、RAG(检索增强生成):外挂知识库
  9. 2.1 什么是 RAG?
  10. 它是谁?
  11. 为什么要用它?
  12. 核心价值
  13. 2.2 RAG 的工作原理
  14. 2.3 RAG 的实际应用
  15. 2.4 代码示例
  16. 使用 LangChain 实现简单 RAG(新版 API)
  17. 1. 加载文档
  18. 2. 切分文档
  19. 3. 创建向量库
  20. 4. 创建检索器
  21. 5. 创建问答链
  22. 6. 提问
  23. 三、Skill:给 LLM 配备"工具箱"
  24. 3.1 什么是 Skill?
  25. 它是谁?
  26. 为什么需要它?
  27. 3.2 常见的 Skill 类型
  28. 3.3 Skill 的工作原理
  29. 四、Agent:让 AI 成为"智能体"
  30. 4.1 什么是 Agent?
  31. 它是谁?
  32. 它能做什么?
  33. 4.2 Agent 的核心架构
  34. 4.3 ReAct:Agent 的经典范式
  35. 4.4 LangChain 实现 Agent
  36. 准备工具
  37. 创建 Agent
  38. 运行
  39. 五、四者关系:一张图看懂
  40. 💡 干货总结
  41. 六、实际应用场景
  42. 6.1 智能客服机器人
  43. 6.2 企业知识助手
  44. 6.3 编程助手
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • 无人机遥感航拍巡检数据集 无人机遥感图像识别 无人机视角山区泥石流和滑坡图像识别数据集-数据集第10067期
  • Linux 搭建 Web 服务器指南:Nginx 与 Apache 安装配置
  • RMBG-2.0 接入 Stable Diffusion 工作流实现图像生成与抠图合成
  • WebGIS 实战:WKT 转 GeoJSON 技巧及 Leaflet 集成
  • n8n 集成飞书机器人实战指南:从 Webhook 到 WebSocket 的迁移
  • 清华大学发布仿生多模态触觉传感器 SuperTac,结合大模型实现类人感知
  • 大模型训练原理深度解析:以 GPT-1 为例
  • 基于改进 YOLOv11n 的无人机红外目标检测算法
  • Win11 + IDEA 集成 Codex 大模型开发环境搭建指南
  • Llama-Factory 用于养生食谱推荐与健康管理 APP 集成
  • 基于 Nexent 平台搭建育儿问答智能体实战
  • 基于 Docker 部署的 AI 量化分析平台搭建与波浪理论实战
  • 微信小程序样式与布局详解
  • C++ STL 详解:手写 String 类实现
  • Coze + Bot API:实现带自我反思的高质量长文翻译 Agent
  • π₀:视觉 - 语言 - 动作流模型通用机器人控制
  • Flutter 使用 wasm_ffi 在鸿蒙端调用 WebAssembly 实战
  • LangChain4j 中 ReAct Agent 的工作原理与实现方法
  • 2024 年主流大型语言模型 LLMs 盘点与解析
  • LLaMA-Factory 本地部署与安装配置指南

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online