跳到正文
Victor BI
返回

大模型是怎么炼成的?从预训练到 AI 助手的完整过程

大模型是怎么炼成的?从预训练到 AI 助手的完整过程

你每天和 AI 聊天、用它写代码、帮你改文案——但这个东西到底是怎么做出来的?

很多人对大模型有一种模糊的印象:大量数据 + 超级算力 = 聪明的 AI。这个理解没有错,但太粗糙了。事实上,一个大模型从零开始到最终变成你手边的助手,要经历三个截然不同的阶段,每个阶段解决的问题和用的方法完全不一样。

这篇文章用最直白的方式,把这个过程讲清楚。


三个阶段:一张大图

阶段目标核心问题
预训练学会语言规律和知识结构模型怎么”读懂”文字?
后训练(SFT)学会按指令对话模型怎么变成助手?
强化学习 / 偏好对齐让回答更有用、更安全模型怎么知道什么该说、什么不该说?

第一阶段:预训练——让模型学会”理解”语言

数据从哪里来

预训练的第一步是大规模数据收集。来源包括:网页文本、维基百科、学术论文、书籍、论坛帖子、代码仓库等。

但并不是互联网上所有内容都能直接用。在进入训练之前,数据会经过严格的清洗和过滤:

最终保留下来的是一份相对”干净”的文本语料库,规模通常达到数万亿 token 级别

文字怎么变成模型能处理的格式

电脑不能直接理解文字,需要把文字转换成数字。这分两步走:

第一步:分词(Tokenization)

把文本切分成一个个基本单位(token),再映射成对应的数字 ID。一个 token 可能是一个汉字、一个词、一个英文单词的片段,甚至是一个标点符号。

"今天天气真好" → [4821, 2392, 6107, 1563] (示意)

第二步:嵌入(Embedding)

光有数字 ID 还不够,模型还需要知道这些词的”意思”。嵌入把每个 token 转换成一串向量数字,用来表示这个词在不同场景下的语义特征。

举个例子:“苹果”这个词,可能指水果,也可能指那家科技公司。嵌入不会给它一个固定标签,而是通过一串数字来表达它和”水果""手机""科技""公司”等不同概念之间的关联强度。

这些向量的意义不是预设的,而是在训练过程中逐渐形成的:语义相近、使用场景相似的词,在向量空间里的距离也更近。“汉堡”和”薯条”会靠在一起,“汉堡”和”天气预报”则相距很远。

训练的本质:无数轮填空题

预训练的核心任务极其简单:预测下一个 token 是什么

给模型看”今天天气真”,让它猜后面最可能是”好”还是”热”还是”冷”。模型会输出一个概率分布,比如:好(80%)、热(15%)、冷(5%)。

然后系统拿它的预测和训练数据里的真实答案对比。如果猜错了,**损失函数(Loss Function)**就会计算出这次预测有多离谱,并通过反向传播告诉模型”应该往哪个方向调整参数”。

这个过程重复无数次:猜词 → 对比答案 → 算 loss → 更新参数 → 再猜词。

表面上只是在玩文字接龙,但当数据规模足够大、模型参数足够多、训练轮次足够多,这个简单任务会逼着模型学会:

预训练结束后得到什么

一个基础模型(Base Model)

它掌握了大量语言规律和知识结构,但它不是一个助手。它更像是”互联网文本续写机”——你给它什么风格的开头,它就续写什么风格的内容。你问它”2+2等于几”,它可能不会直接回答,而是根据上下文风格续写出一段百科式说明、一段教材内容、或者一段论坛回帖。

基础模型知道”什么”,但不知道”怎么服务人”。


第二阶段:后训练(SFT)——把文本机器变成助手

监督微调做了什么

后训练最核心的一步叫监督微调(Supervised Fine-Tuning,SFT)

操作方式和预训练类似,本质上还是预测下一个 token——但数据变了。不再是互联网上的随机文本,而是大量”用户问题 + 理想回答”的对话样本。这些样本来自:

涵盖范围很广:日常问答、专业咨询、代码任务、写作请求、安全边界问题等,数量可能达到千万轮以上。

数据环境变了,模型行为也变了

这里有个关键的认知:数据环境决定了模型学出来的表达方式

预训练时,模型泡在互联网文本里,学的是”互联网风格的续写”。SFT 时,模型泡在高质量对话数据里,学的是”助手风格的回答”。

模型发现:在这批数据里,跟在问题后面的,不是长篇百科定义,而是简洁、高效、符合用户需求的回答。于是它的输出倾向就被重塑了。

SFT 训练模型学会的核心行为包括:

需要强调的是:模型并没有真的”变得有礼貌”或者”有情商”,它是在极其精确地学习和模仿高质量人类对话的输出模式


第三阶段:强化学习 / 偏好对齐——让模型知道边界在哪里

为什么 SFT 还不够

经过 SFT 的模型已经能对话了,但还不够好。一个真正可用的助手,不只是会回答问题,还要知道:

比如有人问”怎么自杀最无痛”,模型不应该背诵医学论文,更不应该给出具体方法。有人问”怎么入侵邻居 WiFi”,模型不应该提供违法步骤。

这些判断,光靠 SFT 还不足以稳定实现。

人类反馈怎么参与进来

这一阶段引入了人类反馈:由标注员、安全团队、领域专家对模型生成的回答进行比较和评分。

评分标准不只是”回答是否聪明”,还包括:

训练团队会为模型设置多层行为边界,例如:

类型规则
安全边界涉及暴力、自残、违法等场景,宁可拒绝,也不给出危险建议
诚实边界超出能力范围时,承认不知道,优于胡编
共情边界用户情绪崩溃时,优先支持和安抚,而不是输出冷冰冰的知识

奖励模型的作用

让人类标注员对每一条回答都打分,成本极高。所以实践中会用这些人类偏好数据训练一个专门的奖励模型(Reward Model)

奖励模型的工作是:学习人类的打分习惯,预测在类似场景下人类更喜欢哪种回答。

有了奖励模型,就可以用它给助手模型的大量输出自动打分,再根据这些分数不断调整助手模型的参数——这就是基于人类反馈的强化学习(RLHF)

最终结果是:模型越来越倾向于生成那些有用、安全、诚实、符合人类偏好的回答。


三个阶段的本质区别

预训练SFT(监督微调)RLHF(偏好对齐)
数据来源互联网公开文本人工标注的问答对话人类对多个回答的排序偏好
训练目标预测下一个 token模仿高质量回答风格最大化人类偏好分数
模型变化学会语言规律和知识学会助手式对话方式学会什么该说、边界在哪里
产出基础模型对话模型可部署的 AI 助手

总结

我们今天用的大语言模型,不是从一开始就是助手的。它的”成长”路径是这样的:

  1. 预训练:吞下海量文本,学会语言规律和世界知识,成为一个强大的文本预测器
  2. SFT:接触大量高质量对话数据,学会按指令回答问题,具备助手的基本能力
  3. RLHF:通过人类反馈和奖励模型的打分,不断校准输出,变得更有用、更安全、更诚实

理解这个过程,有助于我们更清醒地看待 AI 的能力边界:它不是真的”懂了”,而是在极其精准地学习人类语言和行为的统计模式。它的”聪明”来自数据,它的”边界”来自人类的持续干预和校准。

这也提示我们:AI 助手的质量,很大程度上取决于训练数据的质量、人类反馈的质量,以及设计者对”好回答”定义的深度


分享这篇文章:

上一篇
AI 正在重写软件工程:瓶颈转移、流程重构与组织变革
下一篇
AI 浪潮下,程序员的时代在悄悄变了