一文读懂大语言模型的训练全过程
从原始数据到智能对话——ChatGPT、DeepSeek、Qwen 这类大模型是怎么"炼"出来的? 当你在手机上向 AI 助手提问,它能流畅地回答、写代码、做分析,这背后是一套复杂而精密的训练工程。本文将从工程视角,完整拆解大语言模型(LLM)的训练过程,包括每一步在做什么、需要哪些数据、依赖哪些技术基础设施。 一、先搞清楚两个大阶段 LLM 的训练通常分为两大阶段: 预训练(Pre-training):让模型"博览群书",获得通用知识与语言能力 后训练(Post-training):让模型"上岗培训",学会按指令回答、安全礼貌地与用户交流 后训练的计算量只有预训练的约 5%,但它决定了模型的实际可用性,也是近年来研究最活跃的方向。[1] 二、六大训练步骤详解 第一步:数据收集与预处理 一切从数据开始。训练一个现代大语言模型,需要数万亿(Trillions)个 Token 的文本语料。[2] 数据来源包括: 通用网页文本:Common Crawl、C4 等互联网爬虫数据集 书籍与学术文献:Books3、ArXiv、PubMed 等 代码:GitHub 公开代码仓库、Stack Overflow 问答 百科全书:多语言 Wikipedia 原始数据质量参差不齐,必须经过严格的清洗流程: 去重:使用 MinHash / SimHash 去除重复内容,防止模型过拟合 质量过滤:基于困惑度(Perplexity)、规则过滤低质量内容 语言识别与分类:按语言比例混合多语言数据 Tokenizer 训练:使用 BPE(字节对编码)或 SentencePiece 训练分词器 这一步的产出: TB 级别的清洁语料库 + 训练好的 Tokenizer。 第二步:大规模预训练 这是整个流程中计算量最大、成本最高的环节,通常需要数千块 GPU 运行数周甚至数月。 核心原理: 自回归语言建模(Autoregressive Language Modeling)——给模型看一段文本,让它预测下一个 Token 是什么。通过在海量文本上反复迭代,模型逐渐学会了语言规律、世界知识、逻辑推理。[3] 关键技术组件: 组件 作用 Transformer 架构 多头注意力(Multi-head Attention)+ 前馈网络(FFN) RoPE 位置编码 让模型理解 Token 之间的位置关系 RMSNorm 归一化 稳定训练过程,替代传统 LayerNorm Flash Attention 2/3 IO 感知的高效注意力算法,2-4 倍提速 GQA 分组查询注意力 减少 KV Cache 占用,提升推理效率 混合精度训练(BF16) 节省显存,加速计算 这一步的产出: 基础模型(Base Model)。它掌握了丰富的知识,但只会续写文本,不会听指令。 ...