一、大模型是什么
1.1 大模型的定义
起源:大语言模型(Large language Models,LLMs),围绕自然语言处理任务而创建的一系列模型。
发展:基础模型(Foundation Models),可以处理多模态数据,不局限于自然语言。
下图粗略地概括了人工智能、机器学习、深度学习、大模型之间的关系。

定义
定义 1:是一种由包含数百亿以上参数的深度神经网络构建的语言模型,通常使用自监督学习方法,通过大量无标注文本进行训练。—出自书籍《大规模语言模型从理论到实践》
定义 2:任意的在大规模数据上训练并且可以适配(例如微调)广泛下游任务的模型。—出自论文《On the Opportunities and Risks of Foundation Models》
发散思考与学习内容
- • 自监督学习
自监督学习是一种机器学习范式,它不依赖人工标注的数据,而是通过数据自身提供的内在结构或隐藏信息来生成监督信号,从而进行模型训练。它可以被看作是一种特殊的无监督学习,因为它不需要人工标签,但它的训练方式类似于监督学习。
- • 无标注文本
无标注文本(Unlabeled Text)指的是没有附加人工标注信息的文本数据,通常只是原始的自然语言数据,不包含类别标签、情感评分、实体标注等额外信息。
无标注文本在**自然语言处理(NLP)任务中被广泛使用,尤其在自监督学习(Self-Supervised Learning)和无监督学习(Unsupervised Learning)**中,它们用于预训练语言模型,帮助模型学习语言结构和语义信息,而无需人工标注数据。
1.2 大模型的特性
基本特点
- 大规模参数量,超过百亿参数规模的神经网络模型。
- 大规模训练数据,通过海量数据进行自监督预训练。
- 涌现能力,表现出了人类才会有的智能(上下文学习、思维链)。
- 多模态数据多领域适应性(通用人工智能,AGI,artificial general intelligence),经适当微调或提示,能应用于不同领域,且效果显著。
- 超长上下文感知,基于 Transformers 的注意力机制(Google 的论文《Attention is All You Need》)保证其能充分理解信息,并做出合理推断。
- 不是搜索引擎,无法感知实时数据。(这个不足可以通过联网搜索来加以弥补,但不是大模型本身的推理能力即离开了互联网大模型将缺失这种能力)
其他特点
- 模型同质化。当前大模型都是以 Transformer 为基础衍生而来的
- 大力出奇迹。参数规模与预训练语料量级是模型性能的关键影响因素。例如与 GPT-2 的 15 亿参数相比,GPT-3 有 1750 亿个参数,从而在性能方面有关质的提升。
- 从开源走向闭源。某些模型根本不会对外发布或只对少数提供 API 访问权限(如 openai 的模型),甚至一些数据集(如 GPT-2)也没有公开发布
- 头部垄断。由于数据资源与算力制约,中小型企业基本无法与头部科技公司竞争。
典型代表(国外)
- GPT 系列:https://chat.openai.com/
- 谷歌 gemini:https://gemini.google.com/

















