大模型技术框架与核心应用学习指南
引言
人工智能(AI)是一个广泛的领域,旨在创建具有类人智能的系统。大模型(Large Language Models, LLM)作为当前 AI 的主流研究方向,基于深度学习算法模仿人类大脑神经元,通过神经网络实现智能。其核心在于利用海量数据进行预训练,产生'涌现'能力。本文将对大模型所涉及的理论、技术及实践进行系统性梳理。
一、神经网络基础
神经网络是构建大模型的基石。典型结构包含输入层、隐藏层和输出层。神经元之间通过权重连接,参数调整通过正向传播计算损失,再通过反向传播更新权重。
1.1 网络架构演变
- CNN (卷积神经网络):擅长图像处理,通过卷积核提取局部特征。
- RNN/LSTM (循环神经网络):处理序列数据,LSTM 解决了梯度消失问题,但并行度低。
- Transformer:目前主流架构,基于自注意力机制(Self-Attention),并行计算能力强,是大模型的基础。它摒弃了循环结构,直接关注序列中任意两个位置的关系。
1.2 训练机制
神经网络的效果由参数值决定。训练过程包括:
- 正向传播:输入数据经过各层计算得到预测结果。
- 损失计算:对比预测结果与真实标签,计算误差(Loss)。
- 反向传播:根据误差梯度更新网络权重,使 Loss 最小化。
不同神经网络的架构和实现有所不同,但其核心点都是基于此模型实现的。对想学习神经网络的朋友来说,先学会基础的神经网络架构,然后再针对不同的神经网络模型进行深化是最好的选择。
二、大模型训练范式
目前的大模型主要采用的是预训练的方式来实现智能的,简单来说就是给神经网络模型一堆资料,让它自己学,自己看,自己总结。
2.1 学习方式
- 无监督学习:利用大量未标注文本进行预测下一个 token,学习语言规律和知识。
- 监督学习:使用带答案的数据对模型进行微调,使其适应特定任务。
2.2 工程挑战
设计并训练一个完整可用的神经网络模型是一个复杂的工程,涉及模型的设计、训练数据的收集与处理、损失函数与反向传播算法的设计、模型过拟合、欠拟合等问题。
随着模型规模的增大,模型的训练难度成几何式增长,比如分布式训练、并行计算等问题;以及为了提升大模型的学习效率,节约成本而设计的强化学习、迁移学习等。
最后,为了使得大模型更像人,也为了实现真正的 AGI(通用人工智能),现在多模态大模型大行其道,而多模态大模型技术比传统大模型的技术复杂度又上升了不止一个台阶,涉及图像、音频、视频等多种模态的对齐与融合。
三、检索增强生成(RAG)
大模型技术虽然很强大,但其有几个明显的缺点:第一就是知识是有限制的,因为采用的是预训练方式,因此大模型的知识最多只能到训练开始的时间节点,之后产生的新的知识大模型无法获取。其次,由于训练大模型的成本问题,导致很多企业无法承担大模型的训练成本,因此只能使用第三方的大模型,但第三方大模型没有在特定领域的数据上进行训练或微调,因此,其表现能力一般。
这时 RAG 就出现了,RAG 中文是检索增强,是通过外挂知识库的方式,提问大模型之前先从向量数据库中查询数据,然后一起输入到大模型,这样大模型就相当于有了一个外部资料库,遇到不懂的问题就可以通过查资料的方式解决。
3.1 技术流程
- 文档处理:将非结构化文档切片、清洗。
- 向量化:使用 Embedding 模型将文本转化为向量。
- 存储:存入向量数据库(如 Milvus, ChromaDB)。
- 检索与生成:用户提问时检索相似片段,拼接 Prompt 后输入大模型。
以目前的技术来说,RAG 是大模型技术的一个重要节点,即是大模型能力范围的扩展,也是对大模型短板的补充。
四、模型适配技术
我们一般使用的大模型都是预训练模型,也就是用某些数据集训练过的模型;但这些模型一般情况下只会在特定领域表现出色,但如果用来解决自己的实际问题可能就不太好用了。这时怎么让预训练模型在其它任务中表现更好就是一个值得思考的问题,而这就是微调与提示词工程存在的意义。


