大模型面试题整理
1. RAG 的整体流程
检索增强生成(Retrieval-Augmented Generation, RAG)这套方案,本质上是把'模型会说'和'知识能查'拼到一起。流程并不复杂,但每一步都能影响最后效果:
- 数据预处理:先把原始数据里的噪声、重复内容和脏数据清掉。
- 分块(Chunking):这一步通常最容易被低估。切得太细,语义断裂;切得太粗,检索粒度又会变差。常见做法有固定长度分块、语义分块。
- 文本向量化:把文本块编码成向量。
- Query 向量化:把用户问题也转成向量。
- 向量检索:在向量数据库里找 Top-K 相似内容。
- 重排(Rerank):用更精细的模型重新排序,通常能把前面的'凑数结果'筛掉。
- 输入 LLM:把 Query 和检索结果一起拼进 Prompt。
- 输出回答:模型根据上下文生成最终结果。
2. 外挂知识库主要解决什么
纯参数化模型有几个绕不开的限制:训练完知识就固定了,遇到冷门领域容易答偏,回答来源也不好追。外挂知识库就是拿来补这些短板的。
- 解决知识截止问题
- 降低幻觉概率
- 覆盖垂直领域知识
- 让回答更容易追溯和审计
如果场景里'准确'比'流畅'更重要,RAG 往往比单纯让大模型硬答更稳。
3. 怎么看 RAG 项目的效果
我一般会把评估拆成两段看:检索有没有把料找对,生成有没有把话说对。
检索环节
- MMR (Maximal Marginal Relevance):看相关性和多样性的平衡
- Hits Rate:前 K 条里有没有命中正确答案
- NDCG (Normalized Discounted Cumulative Gain):更看重排序位置
生成环节
- 非量化指标:完整性、正确性、相关性、流畅度
- 量化指标:Rouge-L、BLEU 等
现实里只看一个指标很容易误判。检索分高,不代表生成就稳;生成分看着高,也可能只是句子更顺。
4. 幻觉问题和复读机问题是什么
- 幻觉问题:模型说得像真的,但其实和事实不符,或者和给定上下文对不上。
- 复读机问题:长文本生成时开始打转,反复输出相同词组或句子。
这两个问题看起来不一样,底层都和模型在'该信什么、该停哪儿'这件事上不够稳定有关。
5. 幻觉和复读机怎么处理
幻觉
- 接入高质量知识库
- 加输出约束,比如格式校验
- 控制输出长度,减少发散
- 用 CoT 提示引导推理路径
复读机
- 清理训练数据里的重复文本
- 做适度的数据增强
- 调高 Temperature,别让生成太死
- 加后处理,发现重复就截断
6. 这两个问题一般怎么来的
幻觉的来源
- 训练数据和源数据不一致:模型学到的表示和真实输入对不上,或者解码策略把结果带歪了。
- :模型不知道,就只能补一个看起来合理的答案。


