大模型训练范式的常见概念-Day27
一、传统 LLM 的三阶段训练:预训练 → SFT → RLHF
这是目前绝大多数通用大语言模型的标准"成长路径"。
1. 预训练(Pre-training):读万卷书
本质:让模型在海量无标注文本(网页、书籍、代码等)上学习语言的统计规律和世界知识。
过程:
- 输入:数万亿 token 的互联网文本
- 目标:预测下一个词(Next Token Prediction)
- 结果:模型学会了语法、常识、逻辑,但输出可能混乱、有害、不符合人类偏好
DeepSeek 案例:DeepSeek-V3 在 14.8T tokens 上预训练,耗资约 557 万美元。此时它是一个"知识容器",能续写文本,但不会对话。
2. SFT(Supervised Fine-Tuning,监督微调):拜师学艺
本质:用高质量的人工标注"问答对"(Prompt + 理想回答)来教模型"人类希望你怎么回答"。
过程:
- 输入:数十万到数百万条精心编写的对话数据(如"请写一首关于春天的诗"→"春眠不觉晓…")
- 目标:让模型模仿这些高质量回答的风格、格式和 helpfulness
- 结果:模型从"文本续写器"变成"对话助手"
关键点:SFT 是监督学习——有明确的标准答案(Ground Truth),模型通过"模仿"来学习。
DeepSeek 案例:DeepSeek-V3 预训练后,经过多轮 SFT,学会了遵循指令、保持礼貌、生成结构化回答。
3. RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习):社会打磨
本质:用人类的偏好评价来进一步微调模型,让它不仅"答得对",还要"答得好"(更有用、更无害、更诚实)。
过程:
- 第一步:训练一个奖励模型(Reward Model)——让人类标注员对同一问题的多个回答打分(A比B好),奖励模型学会预测"人类会喜欢哪个回答"
- 第二步:用强化学习算法(如 PPO)优化语言模型,目标是让奖励模型给出的分数越来越高
- 结果:模型学会了"讨好"人类偏好——拒绝有害请求、承认不知道、给出更详细的解释
关键点:RLHF 是强化学习——没有标准答案,只有"好/更好"的反馈信号,模型通过试错和优化来提升自己。
DeepSeek 案例:DeepSeek-V3 经过 RLHF 后,会拒绝生成违法内容,会主动说明"我的知识截止到 2024 年",语气也更自然。
二、推理模型的训练路径:预训练 → 纯 RL → SFT 对齐
DeepSeek-R1 走了一条反直觉的路:它把"强化学习"放到了核心位置,甚至在没有大量人工标注推理数据的情况下,让模型自己"悟"出了推理能力。
1. 预训练:同样的起点
和 V3 一样,R1 的底座是 DeepSeek-V3-Base(预训练后的基础模型)。此时它有语言能力,但没有显式的深度推理能力。
2. 纯 RL 驱动推理(Pure RL-driven Reasoning):自我觉醒
本质:不给模型标准答案,只给规则化的奖励信号,让模型通过海量试错自己学会"怎么思考"。
DeepSeek-R1 的具体做法:
阶段 A:Cold Start(冷启动 SFT)
- 先收集几千条高质量的长思维链(CoT)数据,对 Base 模型做一次小规模 SFT
- 目的:给 RL 一个稳定的起点,避免模型在 RL 初期"乱来"
阶段 B:Reasoning-Oriented RL(面向推理的强化学习)
- 使用 GRPO(Group Relative Policy Optimization) 算法
- 奖励信号极其简单,只有两个:
- 准确性奖励:数学题的答案对不对(可自动验证)
- 格式奖励:是否按规定的格式输出(如把推理过程放在
<think>标签内)
- 没有人类标注的推理过程!
神奇的事情发生了:模型在试错中自发学会了:
- 把复杂问题拆解成子问题
- 尝试不同解法并验证
- 发现错误后自我修正(“Wait, let me check this again…”)
- 生成越来越长的思维链
关键点:这是 “纯” RL——不依赖人类标注的推理数据,奖励信号完全来自可自动验证的规则(如数学题答案是否正确)。
3. SFT 对齐(SFT Alignment):能力整合
本质:把 RL 阶段涌现出的推理能力"固化"下来,同时补充通用能力,防止模型变成"只会做题的偏科生"。
DeepSeek-R1 的具体做法:
阶段 C:Rejection Sampling + SFT(拒绝采样与监督微调)
- 从 RL 训练后的模型中,用拒绝采样筛选出 60 万条高质量推理轨迹(只保留答案正确的长 CoT)
- 混合 20 万条 V3 的非推理数据(写作、翻译、简单问答等)
- 对模型进行第二轮 SFT
阶段 D:RL Alignment(全场景对齐)
- 最后阶段引入人类偏好奖励(类似 RLHF),对齐 helpfulness 和 harmlessness
- 同时保留推理能力
三、两条路线的核心区别
| 维度 | 传统 LLM(V3 路线) | 推理模型(R1 路线) |
|---|---|---|
| 核心哲学 | 模仿人类写的答案 | 自己探索解题策略 |
| SFT 的作用 | 主要学习手段,数据量巨大 | 辅助手段,数据量小且经过严格筛选 |
| RL 的作用 | 最后一步微调偏好 | 核心驱动力,让模型自发涌现推理 |
| 奖励信号 | 人类偏好(主观、模糊) | 规则验证(客观、精确,如数学题对错) |
| 数据依赖 | 极度依赖海量人工标注 | 极度依赖可自动验证的任务 |
| 适用任务 | 开放域对话、创意写作 | 数学、代码、逻辑推理 |
四、一句话总结
预训练 = 读万卷书(学知识)
SFT = 拜师学艺(学格式)
RLHF = 社会打磨(学做人)
纯 RL = 闭关顿悟(学会思考)
SFT 对齐 = 融会贯通(既会思考,也会聊天)
DeepSeek-R1 的革命性在于:它证明了深度推理能力不需要人类手把手教,只要给模型一个"对/错"的判卷机,它就能自己"悟"出来。这也是为什么 R1 的训练成本远低于 OpenAI o1,却能取得相近甚至更好的推理效果——它绕过了最昂贵的人工标注推理数据环节。
更多推荐

所有评论(0)