预训练(Pre-training)是指通过海量数据训练模型,让模型学会如何预测 Token 序列。训练的最终产物是基础模型(Base Model)。预训练的革命性意义在于让模型从文本的自然结构中自主学习,无需外部监督。
两种预训练路线
| 维度 | 自回归(CLM) | 掩码语言(MLM) |
|---|---|---|
| 代表模型 | GPT 系列 | BERT 系列 |
| 训练目标 | 预测下一个词 | 预测被遮盖的词 |
| 注意力方向 | 只看左边 | 左右都看 |
| 适合任务 | 文本生成、对话、推理 | 文本理解、分类 |
AI大模型如何学习
海量数据(学习资料)→ 硬件运算(大脑硬件)→ 算法投喂(教学方法)→ 测试测验(期末考试)→ 迭代优化(反复练习)
关键概念
参数(Parameters):模型在训练过程中学习到的数值权重。Token 决定模型"能听懂多少"和"说多少",参数决定模型"有多聪明"。GPT-3 为 1750 亿参数,GPT-4 据估计万亿级。
涌现能力(Emergent Abilities):模型规模(参数量、训练数据量等)达到一定阈值后,突然展现出的、在小规模模型中不具备的能力。非线性、跳跃式出现,仿佛某个临界点后模型突然"顿悟"。
Scaling Law(规模法则):通过扩大训练数据集规模、增加模型参数数量和计算资源,可以实现模型性能的提升。模型能力与**数据、模型规模(算力)、计算能力(算法)**三要素密不可分。
幻觉(Hallucination):模型生成不真实、虚构、不一致或无意义的内容。现已泛指模型出现错误的情况。
大语言模型"大"体现在哪?
- 参数规模大:参数是模型的"记忆容量",越多越丰富
- 数据量巨大:互联网级别文本,可达万亿级别,需大量工程筛选
- 算力需求大:训练成本数百万到数千万美元,需成千上万块高端 GPU
基础模型的缺陷
- 不会理解问题,只会基于训练数据的统计模式生成文本
- 不能拒绝不适当的问题,可能输出不安全或不准确的内容
- 缺乏交互性,无法进行多轮对话或执行复杂任务
→ 解决方案:后训练
相关页面
→ 大模型后训练 → 大模型发展时间线 → AIPM课程 Day3