大语言模型原理、应用与演进路线
1. 从语言模型到大模型
在自然语言处理里,语言模型一直是个基础件。它的目标并不复杂:给定前面的上下文,预测下一个词。差别在于,早期方法更多依赖统计,后来逐步转向神经网络,再到今天参数规模动辄上百亿、上千亿的大语言模型。
这个演进过程里,几个阶段的边界其实很清楚:
- 统计语言模型(SLMs):靠词频和 n-gram 这类统计关系做预测。好处是直观,问题是上下文一长就容易失效。
- 神经语言模型(NLMs):引入词嵌入,用分布式表示来表达语义关系,终于不再只是盯着表面词频。
- 预训练语言模型(PLMs):先在大规模语料上预训练,再针对下游任务微调。BERT 这类模型把上下文理解能力往前推了一大步。
- 大语言模型(LLMs):参数规模继续放大,出现了更强的泛化和涌现能力,很多过去需要专门训练的任务,现在靠提示就能完成。
2. 大语言模型到底强在哪
大模型不是因为'更大'才有价值,而是它把几个能力一起拉起来了:
- 上下文理解更强:能处理更长的文本,保持对话和任务的连续性。
- 少样本、零样本能力更好:给几个例子,甚至只给一句要求,它也能跑起来。
- 开始支持多模态:不只是文本,图像等输入也能纳入同一套推理链路。
- 推理能力有所提升:虽然不稳定,但在数学、代码、逻辑题上已经能做不少事。
- 可通过微调适配新场景:这点很实用,尤其是落到行业任务时。
3. 常见模型家族
现在提大模型,绕不开 GPT、LLaMA 和 PaLM 这几条线。它们路线不同,但都代表了主流方向。
3.1 GPT 家族
GPT(Generative Pre-trained Transformer)由 OpenAI 推出。GPT-3 的参数量达到 1750 亿,生成能力很强。GPT-4 进一步强化了多模态理解,已经不只是'会聊天',还能分析图像并给出建议。
3.2 LLaMA 家族
LLaMA 是 Meta 推出的开源系列。它强调在相对可控的参数量下获得不错的效果,SwiGLU 等设计也帮了不少忙。后续像 Alpaca 这类衍生模型,靠指令微调把'听得懂人话'这件事补得更完整。
3.3 PaLM 家族
PaLM 是 Google 的 Pathways 架构模型。PaLM-540B 拥有 5400 亿参数,在多步推理和多语言任务上表现很亮眼。
3.4 其他常被提到的模型
- BLOOM:覆盖 46 种自然语言。
- ERNIE 3.0:把知识图谱融合进来,增强知识理解。
- Claude:更强调对话安全和伦理约束。
4. 大模型是怎么做出来的
训练一个大模型,真正花时间的通常不是'堆参数',而是前面的数据、训练目标和后面的对齐。这几步哪个没做好,模型都会掉链子。
4.1 数据清洗
高质量数据是底座。去重、过滤异常样本、清理 HTML 标签,这些看起来琐碎,但实际很关键。比如 Falcon40B 训练时,就从数万亿 token 里筛出了更高质量的语料。
4.2 分词
模型不能直接读文本,得先切成 token,再映射成数字序列。常见方案有:
- BPE(Byte Pair Encoding):通过合并高频字符对来控制词表大小,也能减少未知词问题。
- WordPiece:更偏向按语言构造拆分。
- SentencePiece:把输入当成 Unicode 序列处理,多语言场景比较方便。
4.3 位置编码
Transformer 本身不带顺序感,所以得补位置编码。RoPE(旋转位置编码)是现在常见的一种,它把位置信息融进向量旋转里,长序列场景下表现不错,GPT-3 和 LLaMA 都用过类似思路。


