跳到主内容
快讯直播
AI智模界
AI 词典

预训练与后训练:模型的能力和性格分别在哪成型

一句话定义:预训练(Pre-training)是用海量文本让模型学会语言和世界知识,后训练(Post-training)是在这个基础上把它调教成一个会好好说话的助手。

打个比方。预训练就像把一个人关进图书馆读上几年书——出来时他博闻强识,知道的东西极多,但完全不懂社交:你问他"今天天气怎么样",他可能顺着话头继续编出十句"今天天气怎么样,明天天气怎么样……",因为他学的唯一技能是"预测下一个词(next token)"。这一步产出的叫基座模型(base model)。

后训练就是紧接着的入职培训加岗位带教。教练拿一批人工写好的问答范例、一批"这样答更好、那样答不行"的偏好打分,反复纠正他:别人提问要正面回答,不确定的事别硬编,不该说的内容要拒绝,语气别太冲。数据量比预训练小好几个数量级,但每一条都是人精挑细选甚至逐字打磨的。

所以两者分工大致是:

维度预训练后训练
数据海量公开文本,基本不用人工标注少量人工编写、标注、排序的样本
目标预测下一个词遵循指令、符合偏好与安全规范
产出基座模型对话/助手模型
主要塑造知识、语言、推理的底子语气、格式、边界感、"性格"
类比读完图书馆入职培训与岗位带教

一句话记:预训练决定"会什么",后训练决定"怎么答"。

需要说明的是,这条线并不像听起来那么泾渭分明。指令遵循、按步骤推理这类能力,在预训练阶段其实已经埋下了种子,后训练更多是把它激发出来、定向到"回答问题"这个用法上。业内也有介于两者之间的做法(继续预训练、中期训练等),不必把二者当成非黑即白的两件事。

对从业者的实际意义在于:遇到问题时先分清是"能力不足"还是"行为不对"。模型答不出某领域的专业知识,再怎么调AI 词典:系统提示词">系统提示词也是徒劳,得从数据、继续预训练或换更强的基座模型上想办法;反过来,模型知道答案却答得啰嗦、爱编、爱说教,那基本是后训练数据和对齐策略的问题,改提示词往往只能治标。

对普通职场人的意义则是:你今天感受到的"这模型挺好用"或者"这模型有点烦",很大一部分来自后训练。两个知识水平接近的模型,风格可以差出十万八千里,差别常常不在读了多厚的书,而在后来被怎么带。具体到某个产品的训练细节和版本策略,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。