大模型是怎么炼成的?从预训练到 AI 助手的完整过程
你每天和 AI 聊天、用它写代码、帮你改文案——但这个东西到底是怎么做出来的?
很多人对大模型有一种模糊的印象:大量数据 + 超级算力 = 聪明的 AI。这个理解没有错,但太粗糙了。事实上,一个大模型从零开始到最终变成你手边的助手,要经历三个截然不同的阶段,每个阶段解决的问题和用的方法完全不一样。
这篇文章用最直白的方式,把这个过程讲清楚。
三个阶段:一张大图
| 阶段 | 目标 | 核心问题 |
|---|---|---|
| 预训练 | 学会语言规律和知识结构 | 模型怎么”读懂”文字? |
| 后训练(SFT) | 学会按指令对话 | 模型怎么变成助手? |
| 强化学习 / 偏好对齐 | 让回答更有用、更安全 | 模型怎么知道什么该说、什么不该说? |
第一阶段:预训练——让模型学会”理解”语言
数据从哪里来
预训练的第一步是大规模数据收集。来源包括:网页文本、维基百科、学术论文、书籍、论坛帖子、代码仓库等。
但并不是互联网上所有内容都能直接用。在进入训练之前,数据会经过严格的清洗和过滤:
- 过滤恶意网站、低质量营销内容
- 去除极端仇恨内容、违法内容
- 清除真实个人隐私信息
- 去掉大量重复数据
最终保留下来的是一份相对”干净”的文本语料库,规模通常达到数万亿 token 级别。
文字怎么变成模型能处理的格式
电脑不能直接理解文字,需要把文字转换成数字。这分两步走:
第一步:分词(Tokenization)
把文本切分成一个个基本单位(token),再映射成对应的数字 ID。一个 token 可能是一个汉字、一个词、一个英文单词的片段,甚至是一个标点符号。
"今天天气真好" → [4821, 2392, 6107, 1563] (示意)
第二步:嵌入(Embedding)
光有数字 ID 还不够,模型还需要知道这些词的”意思”。嵌入把每个 token 转换成一串向量数字,用来表示这个词在不同场景下的语义特征。
举个例子:“苹果”这个词,可能指水果,也可能指那家科技公司。嵌入不会给它一个固定标签,而是通过一串数字来表达它和”水果""手机""科技""公司”等不同概念之间的关联强度。
这些向量的意义不是预设的,而是在训练过程中逐渐形成的:语义相近、使用场景相似的词,在向量空间里的距离也更近。“汉堡”和”薯条”会靠在一起,“汉堡”和”天气预报”则相距很远。
训练的本质:无数轮填空题
预训练的核心任务极其简单:预测下一个 token 是什么。
给模型看”今天天气真”,让它猜后面最可能是”好”还是”热”还是”冷”。模型会输出一个概率分布,比如:好(80%)、热(15%)、冷(5%)。
然后系统拿它的预测和训练数据里的真实答案对比。如果猜错了,**损失函数(Loss Function)**就会计算出这次预测有多离谱,并通过反向传播告诉模型”应该往哪个方向调整参数”。
这个过程重复无数次:猜词 → 对比答案 → 算 loss → 更新参数 → 再猜词。
表面上只是在玩文字接龙,但当数据规模足够大、模型参数足够多、训练轮次足够多,这个简单任务会逼着模型学会:
- 语法结构和语言习惯
- 事实之间的关联关系
- 不同领域的写作风格
- 代码模式、数学表达
- 初步的推理模式
预训练结束后得到什么
一个基础模型(Base Model)。
它掌握了大量语言规律和知识结构,但它不是一个助手。它更像是”互联网文本续写机”——你给它什么风格的开头,它就续写什么风格的内容。你问它”2+2等于几”,它可能不会直接回答,而是根据上下文风格续写出一段百科式说明、一段教材内容、或者一段论坛回帖。
基础模型知道”什么”,但不知道”怎么服务人”。
第二阶段:后训练(SFT)——把文本机器变成助手
监督微调做了什么
后训练最核心的一步叫监督微调(Supervised Fine-Tuning,SFT)。
操作方式和预训练类似,本质上还是预测下一个 token——但数据变了。不再是互联网上的随机文本,而是大量”用户问题 + 理想回答”的对话样本。这些样本来自:
- 人类专家和标注员
- 高质量助手模型生成并筛选
- 经过改写的多轮对话数据
涵盖范围很广:日常问答、专业咨询、代码任务、写作请求、安全边界问题等,数量可能达到千万轮以上。
数据环境变了,模型行为也变了
这里有个关键的认知:数据环境决定了模型学出来的表达方式。
预训练时,模型泡在互联网文本里,学的是”互联网风格的续写”。SFT 时,模型泡在高质量对话数据里,学的是”助手风格的回答”。
模型发现:在这批数据里,跟在问题后面的,不是长篇百科定义,而是简洁、高效、符合用户需求的回答。于是它的输出倾向就被重塑了。
SFT 训练模型学会的核心行为包括:
- 简单问题给简单回答,不过度展开
- 识别用户真正想要什么,而不只是字面意思
- 按照指令完成具体任务
- 避免危险和不当内容
- 用人类习惯的方式对话和表达
需要强调的是:模型并没有真的”变得有礼貌”或者”有情商”,它是在极其精确地学习和模仿高质量人类对话的输出模式。
第三阶段:强化学习 / 偏好对齐——让模型知道边界在哪里
为什么 SFT 还不够
经过 SFT 的模型已经能对话了,但还不够好。一个真正可用的助手,不只是会回答问题,还要知道:
- 什么该说,什么不该说
- 什么时候要给方案,什么时候要先安抚情绪
- 遇到危险问题怎么处理
比如有人问”怎么自杀最无痛”,模型不应该背诵医学论文,更不应该给出具体方法。有人问”怎么入侵邻居 WiFi”,模型不应该提供违法步骤。
这些判断,光靠 SFT 还不足以稳定实现。
人类反馈怎么参与进来
这一阶段引入了人类反馈:由标注员、安全团队、领域专家对模型生成的回答进行比较和评分。
评分标准不只是”回答是否聪明”,还包括:
- 是否真正有帮助
- 是否诚实(不确定时承认不确定,而不是编造答案)
- 是否安全
- 是否符合用户的真实需求
训练团队会为模型设置多层行为边界,例如:
| 类型 | 规则 |
|---|---|
| 安全边界 | 涉及暴力、自残、违法等场景,宁可拒绝,也不给出危险建议 |
| 诚实边界 | 超出能力范围时,承认不知道,优于胡编 |
| 共情边界 | 用户情绪崩溃时,优先支持和安抚,而不是输出冷冰冰的知识 |
奖励模型的作用
让人类标注员对每一条回答都打分,成本极高。所以实践中会用这些人类偏好数据训练一个专门的奖励模型(Reward Model)。
奖励模型的工作是:学习人类的打分习惯,预测在类似场景下人类更喜欢哪种回答。
有了奖励模型,就可以用它给助手模型的大量输出自动打分,再根据这些分数不断调整助手模型的参数——这就是基于人类反馈的强化学习(RLHF)。
最终结果是:模型越来越倾向于生成那些有用、安全、诚实、符合人类偏好的回答。
三个阶段的本质区别
| 预训练 | SFT(监督微调) | RLHF(偏好对齐) | |
|---|---|---|---|
| 数据来源 | 互联网公开文本 | 人工标注的问答对话 | 人类对多个回答的排序偏好 |
| 训练目标 | 预测下一个 token | 模仿高质量回答风格 | 最大化人类偏好分数 |
| 模型变化 | 学会语言规律和知识 | 学会助手式对话方式 | 学会什么该说、边界在哪里 |
| 产出 | 基础模型 | 对话模型 | 可部署的 AI 助手 |
总结
我们今天用的大语言模型,不是从一开始就是助手的。它的”成长”路径是这样的:
- 预训练:吞下海量文本,学会语言规律和世界知识,成为一个强大的文本预测器
- SFT:接触大量高质量对话数据,学会按指令回答问题,具备助手的基本能力
- RLHF:通过人类反馈和奖励模型的打分,不断校准输出,变得更有用、更安全、更诚实
理解这个过程,有助于我们更清醒地看待 AI 的能力边界:它不是真的”懂了”,而是在极其精准地学习人类语言和行为的统计模式。它的”聪明”来自数据,它的”边界”来自人类的持续干预和校准。
这也提示我们:AI 助手的质量,很大程度上取决于训练数据的质量、人类反馈的质量,以及设计者对”好回答”定义的深度。