预训练(Pre-training)是指通过海量数据训练模型,让模型学会如何预测 Token 序列。训练的最终产物是基础模型(Base Model)。预训练的革命性意义在于让模型从文本的自然结构中自主学习,无需外部监督。

两种预训练路线

维度 自回归(CLM) 掩码语言(MLM)
代表模型 GPT 系列 BERT 系列
训练目标 预测下一个词 预测被遮盖的词
注意力方向 只看左边 左右都看
适合任务 文本生成、对话、推理 文本理解、分类

AI大模型如何学习

海量数据(学习资料)→ 硬件运算(大脑硬件)→ 算法投喂(教学方法)→ 测试测验(期末考试)→ 迭代优化(反复练习)

关键概念

参数(Parameters):模型在训练过程中学习到的数值权重。Token 决定模型"能听懂多少"和"说多少",参数决定模型"有多聪明"。GPT-3 为 1750 亿参数,GPT-4 据估计万亿级。

涌现能力(Emergent Abilities):模型规模(参数量、训练数据量等)达到一定阈值后,突然展现出的、在小规模模型中不具备的能力。非线性、跳跃式出现,仿佛某个临界点后模型突然"顿悟"。

Scaling Law(规模法则):通过扩大训练数据集规模、增加模型参数数量和计算资源,可以实现模型性能的提升。模型能力与**数据、模型规模(算力)、计算能力(算法)**三要素密不可分。

幻觉(Hallucination):模型生成不真实、虚构、不一致或无意义的内容。现已泛指模型出现错误的情况。

大语言模型"大"体现在哪?

  • 参数规模大:参数是模型的"记忆容量",越多越丰富
  • 数据量巨大:互联网级别文本,可达万亿级别,需大量工程筛选
  • 算力需求大:训练成本数百万到数千万美元,需成千上万块高端 GPU

基础模型的缺陷

  • 不会理解问题,只会基于训练数据的统计模式生成文本
  • 不能拒绝不适当的问题,可能输出不安全或不准确的内容
  • 缺乏交互性,无法进行多轮对话或执行复杂任务

→ 解决方案:后训练

相关页面

大模型后训练大模型发展时间线AIPM课程 Day3