跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

大模型面试核心知识点与实战问答总结

全面总结了大模型面试的核心知识点,涵盖 RAG 技术体系、幻觉问题解决方案、主流开源模型架构(如 LLaMA、ChatGLM)、微调方法(SFT、LoRA、RLHF)、训练优化技巧(DeepSpeed、混合精度)、推理显存管理及 Attention 机制优化等内容。文章详细解答了检索评估指标、上下文长度限制、OOM 问题处理及 LangChain 模块等高频面试题,旨在帮助求职者系统掌握算法岗必备技能。

霸天发布于 2025/2/6更新于 2026/9/759 浏览
大模型面试核心知识点与实战问答总结

大模型面试核心知识点与实战问答总结

本文针对算法岗技术趋势、大模型落地项目经验、新手入门及面试常考点进行了系统梳理,涵盖 RAG 架构、模型微调、训练优化及推理加速等核心领域。

1. RAG 技术体系的总体思路

RAG(Retrieval-Augmented Generation)通过检索增强生成,将外部知识库与大语言模型结合。其标准流程如下:

  1. 数据预处理:清洗原始数据,去除噪声。
  2. 分块(Chunking):关键步骤,影响检索粒度与效果。
  3. 文本向量化:使用 Embedding 模型将文本转为向量。
  4. Query 向量化:将用户问题转为向量。
  5. 向量检索:在向量数据库中检索相似片段。
  6. 重排(Rerank):对检索结果进行精排序。
  7. 输入 LLM:将 Query 与检索内容拼接输入大模型。
  8. 输出:生成最终回答。

2. 使用外挂知识库主要为了解决什么问题

  • 克服遗忘问题:LLM 训练数据截止后无法获取新知识。
  • 提升准确性与权威性:基于事实性文档减少幻觉。
  • 解决小众领域覆盖不足:通用模型缺乏垂直领域知识。
  • 提高可控性与可解释性:引用来源明确,便于审计与安全管控。

3. 如何评价 RAG 项目效果的好坏

检索环节评估

  • MMR(最大边际相关性):平衡相关性与多样性。
  • Hits Rate(命中率):前 k 项中包含正确信息的比例。
  • NDCG(归一化折损累计增益):考虑排序位置的评估指标。

生成环节评估

  • 非量化指标:完整性、正确性、相关性。
  • 量化指标:Rouge-L(重叠率)、BLEU 等。

4. 大模型的幻觉问题与复读机问题

  • 幻觉问题:模型生成的内容看似合理但无意义或不忠实于源内容,属于事实性错误。
  • 复读机问题:模型陷入循环,重复生成相同的短语或句子。

5. 针对幻觉与复读机的解决办法

  • 针对幻觉:引入外挂知识库、加入纠偏规则(如约束输出格式)、限制输出长度、增加置信度阈值。
  • 针对复读机:丰富数据集多样性、过滤重复文本、同义词替换做数据增强、调整温度参数(Temperature)、后处理去重。

6. 出现幻觉问题的原因

  • 训练数据偏差:数据中存在错误或矛盾信息。
  • 模型能力局限:注意力机制未能准确聚焦关键信息。
  • 提示词设计不当:未明确约束模型行为。
  • 上下文缺失:缺乏必要的背景知识导致模型猜测。

7. 当前主流的开源大模型及其架构

当前开源生态中影响力最广的是 Meta 的 LLaMA 系列。其基于 Transformer 架构,主要改进包括:

  • 前置归一化:采用 RMSNorm 替代 LayerNorm,提升训练稳定性。
  • 激活函数:使用 SwiGLU 替代 ReLU,提升性能。
  • 位置编码:从绝对位置嵌入改为旋转嵌入(RoPE),支持更长的上下文。
  • 注意力优化:使用 Causal Multi-head Attention 的高效实现,降低显存占用。

8. SFT(监督微调)方法

  • 全量微调:更新所有参数,效果最好但资源消耗大。
  • 参数高效微调(PEFT):仅更新少量参数,主流方式包括 LoRA、P-Tuning 等。
  • 指令微调:使用指令 - 回复对数据进行训练,使模型遵循指令。

9. 什么是 LoRA 微调

LoRA(Low-Rank Adaptation)是一种参数高效微调技术。它冻结预训练模型权重,在层旁路添加低秩分解矩阵进行训练。相比全量微调,显存占用大幅降低,且推理时无额外延迟。

10. LangChain 概述

LangChain 是一个用于构建大语言模型应用的框架。它提供了一系列工具链,帮助开发者连接 LLM 与外部数据源、API 及工具,简化应用开发流程。

11. LangChain 的常用模块

  • Prompts(提示词管理):动态组装提示词模板。
  • Memory(记忆模块):维护对话历史状态。
  • Chains(链):将多个组件串联执行任务。
  • Agents(智能体):让模型自主调用工具解决问题。
  • Document Loaders(文档加载):读取各类数据源。

12. SFT 和 RLHF 优劣对比

特性SFT (Supervised Fine-Tuning)RLHF (Reinforcement Learning from Human Feedback)
目标学习特定任务格式与知识对齐人类价值观与偏好
数据需求高质量指令 - 回复对偏好排序数据(A 优于 B)
成本较低,单阶段训练较高,需训练奖励模型 + PPO
效果提升任务完成度提升回答安全性与有用性

13. 详细介绍 RLHF

RLHF 通常包含三个阶段:

  1. SFT 阶段:训练基础模型遵循指令。
  2. 奖励模型(Reward Model)训练:根据人类反馈训练一个评分模型。
  3. PPO 优化:利用强化学习策略梯度(PPO)优化主模型,最大化奖励模型得分。

14. 大模型训练 OOM 问题及性能提升 Trick

OOM(Out Of Memory)常见于显存不足时。优化手段包括:

  • 梯度累积:模拟大 Batch Size 但小步长更新。
  • 梯度检查点(Gradient Checkpointing):牺牲计算换显存。
  • ZeRO 优化:DeepSpeed ZeRO 分片优化器状态、梯度和参数。
  • 混合精度训练:使用 FP16/BF16 减少显存占用。
  • 量化:使用 INT8/INT4 量化权重。

15. LLaMA 模型输入句子理论上可以无限长吗?

不可以。受限于 RoPE 位置编码的最大序列长度(Context Window)。例如 LLaMA-2-7B 默认支持 4k 上下文。超出范围会导致位置编码外推失效,性能下降。

16. 如何让大模型处理更长的文本?

  • 位置插值:如 YaRN、NTK-aware Scaling,扩展 RoPE 范围。
  • 滑动窗口:将长文本切分为重叠窗口分别处理。
  • 摘要压缩:先对长文本生成摘要,再输入模型。
  • 检索增强:只提取相关段落输入模型。

17. 大模型推理时显存中的数据组成

  • 模型权重:静态存储,占大头。
  • KV Cache:缓存 Key 和 Value 矩阵,随生成长度线性增长。
  • 激活值:中间计算结果。
  • 临时缓冲区:Attention 计算所需的临时空间。

18. ChatGLM 介绍

ChatGLM 是智谱 AI 推出的开源大模型系列。特点包括:

  • 基于 GLM 架构(双向编码 + 单向解码)。
  • 支持多轮对话优化。
  • 提供多种参数量版本(如 6B, 13B)。
  • 对中文场景有较好适配。

19. GLU 激活函数与 SwiGLU 激活函数

  • GLU(Gated Linear Unit):$f(x) = (xW+b) imes ext{sigmoid}(xV+c)$,引入门控机制。
  • SwiGLU:将 sigmoid 替换为 SiLU(Swish),即 $f(x) = ext{SiLU}(xW+b) imes (xV+c)$。在 LLaMA 等模型中表现更佳,收敛更快。

20. LLaMA 1 与 LLaMA 2 的异同

  • 上下文长度:LLaMA 1 为 2k,LLaMA 2 提升至 4k。
  • 词汇表:LLaMA 2 扩充了 Token 数量,提升多语言支持。
  • 架构微调:LLaMA 2 改进了 Attention 掩码逻辑,支持更长序列。
  • 安全对齐:LLaMA 2 引入了更多安全微调数据。

21. 模型在训练和推理时各占用显存的多少?

  • 训练:权重 + 梯度 + 优化器状态(Adam 动量)+ 激活值。约为权重的 3-4 倍。
  • 推理:权重 + KV Cache。约为权重的 1.5-2 倍(取决于序列长度)。

22. DeepSpeed 机制详解

DeepSpeed 是微软开发的分布式训练库,核心机制为 ZeRO(Zero Redundancy Optimizer):

  • ZeRO Stage 1:分片优化器状态。
  • ZeRO Stage 2:分片优化器状态 + 梯度。
  • ZeRO Stage 3:分片优化器状态 + 梯度 + 模型参数。 配合 Offload 功能可将部分数据卸载至 CPU 内存。

23. 什么是混合精度训练

使用不同精度数据类型进行训练以平衡速度与显存。通常使用 FP16 或 BF16 进行前向/反向传播,FP32 维护主权重副本。需开启 Loss Scaling 防止梯度下溢。

24. Prefix LLM 和 Casual LLM

  • Causal LLM(自回归):只能看到当前及之前的 token,用于生成任务(如 GPT)。
  • Prefix LLM:允许模型关注前缀之外的内容,常用于编辑任务或特定结构生成。

25. MHA 后续的计算优化工作

  • FlashAttention:通过 IO 感知算法减少 HBM 读写,加速 Attention 计算。
  • PagedAttention:vLLM 引入,管理 KV Cache 分页,减少碎片。
  • Grouped Query Attention (GQA):减少 KV Cache 大小,平衡速度。

26. Attention 几种常见的计算方式

  • Naive Attention:$O(N^2)$ 复杂度,直接计算 Softmax(QK^T)V。
  • FlashAttention:分块计算,利用 SRAM 加速。
  • Sparse Attention:限制 Attention 范围,降低复杂度。
  • Linear Attention:近似计算,将复杂度降为 $O(N)$。

结语

掌握上述知识点有助于应对大模型相关的技术面试。建议结合实际项目经验,深入理解底层原理与工程实践的结合。

目录

  1. 大模型面试核心知识点与实战问答总结
  2. 1. RAG 技术体系的总体思路
  3. 2. 使用外挂知识库主要为了解决什么问题
  4. 3. 如何评价 RAG 项目效果的好坏
  5. 检索环节评估
  6. 生成环节评估
  7. 4. 大模型的幻觉问题与复读机问题
  8. 5. 针对幻觉与复读机的解决办法
  9. 6. 出现幻觉问题的原因
  10. 7. 当前主流的开源大模型及其架构
  11. 8. SFT(监督微调)方法
  12. 9. 什么是 LoRA 微调
  13. 10. LangChain 概述
  14. 11. LangChain 的常用模块
  15. 12. SFT 和 RLHF 优劣对比
  16. 13. 详细介绍 RLHF
  17. 14. 大模型训练 OOM 问题及性能提升 Trick
  18. 15. LLaMA 模型输入句子理论上可以无限长吗?
  19. 16. 如何让大模型处理更长的文本?
  20. 17. 大模型推理时显存中的数据组成
  21. 18. ChatGLM 介绍
  22. 19. GLU 激活函数与 SwiGLU 激活函数
  23. 20. LLaMA 1 与 LLaMA 2 的异同
  24. 21. 模型在训练和推理时各占用显存的多少?
  25. 22. DeepSpeed 机制详解
  26. 23. 什么是混合精度训练
  27. 24. Prefix LLM 和 Casual LLM
  28. 25. MHA 后续的计算优化工作
  29. 26. Attention 几种常见的计算方式
  30. 结语

更多推荐文章

查看全部
  • ChatDoctor 使用指南:基于 LLaMA 的医疗 AI 助手
  • 2026 年 AI 生成产品原型工具实测:墨刀、FigmaMake、Uizard 对比
  • FPGA 毕业设计:选题避坑、开发流程与 Verilog 实战指南
  • 基于微服务架构的智能家居物联网平台实现
  • 基于 ESP32 的开源无人机开发指南:硬件与软件实现
  • 图的数据结构与核心算法
  • 无人机视角山区泥石流与滑坡图像识别数据集介绍
  • Python 使用 Ksycopg2 连接和操作 Kingbase 数据库
  • 《Agent Runtime 工程化》第三章 最小 Agent Loop:3.5 三个最小工具
  • Android Studio 修改项目 JDK 配置指南
  • Leaflet 与 SpringBoot 实现地图点位点击获取当地时间
  • Ollama v0.17.0 发布:OpenClaw 自动安装、Web 搜索及 Context 动态分配优化
  • 数据结构:链表分类详解与双向链表初始化实现
  • Python 学习路线:先打基础,再做项目
  • 基于 Next.js 与 Wagmi 实现 TokenP 钱包登录的 DApp 前端开发
  • AI 产品经理必备技能与职业成长路径
  • Git 远程协作实战:从安装到提交的全流程问题排查
  • IPSec 协议簇详解:AH、ESP 与 IKE 协议原理
  • Mac 离线 AI 绘画工具 Mochi Diffusion 使用指南
  • AIGC 技术全景:原理、应用与未来挑战

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online