一、传统 LLM 的三阶段训练:预训练 → SFT → RLHF

这是目前绝大多数通用大语言模型的标准"成长路径"。

1. 预训练(Pre-training):读万卷书

本质:让模型在海量无标注文本(网页、书籍、代码等)上学习语言的统计规律和世界知识。

过程

  • 输入:数万亿 token 的互联网文本
  • 目标:预测下一个词(Next Token Prediction)
  • 结果:模型学会了语法、常识、逻辑,但输出可能混乱、有害、不符合人类偏好

DeepSeek 案例:DeepSeek-V3 在 14.8T tokens 上预训练,耗资约 557 万美元。此时它是一个"知识容器",能续写文本,但不会对话。

2. SFT(Supervised Fine-Tuning,监督微调):拜师学艺

本质:用高质量的人工标注"问答对"(Prompt + 理想回答)来教模型"人类希望你怎么回答"。

过程

  • 输入:数十万到数百万条精心编写的对话数据(如"请写一首关于春天的诗"→"春眠不觉晓…")
  • 目标:让模型模仿这些高质量回答的风格、格式和 helpfulness
  • 结果:模型从"文本续写器"变成"对话助手"

关键点:SFT 是监督学习——有明确的标准答案(Ground Truth),模型通过"模仿"来学习。

DeepSeek 案例:DeepSeek-V3 预训练后,经过多轮 SFT,学会了遵循指令、保持礼貌、生成结构化回答。

3. RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习):社会打磨

本质:用人类的偏好评价来进一步微调模型,让它不仅"答得对",还要"答得好"(更有用、更无害、更诚实)。

过程

  • 第一步:训练一个奖励模型(Reward Model)——让人类标注员对同一问题的多个回答打分(A比B好),奖励模型学会预测"人类会喜欢哪个回答"
  • 第二步:用强化学习算法(如 PPO)优化语言模型,目标是让奖励模型给出的分数越来越高
  • 结果:模型学会了"讨好"人类偏好——拒绝有害请求、承认不知道、给出更详细的解释

关键点:RLHF 是强化学习——没有标准答案,只有"好/更好"的反馈信号,模型通过试错和优化来提升自己。

DeepSeek 案例:DeepSeek-V3 经过 RLHF 后,会拒绝生成违法内容,会主动说明"我的知识截止到 2024 年",语气也更自然。

二、推理模型的训练路径:预训练 → 纯 RL → SFT 对齐

DeepSeek-R1 走了一条反直觉的路:它把"强化学习"放到了核心位置,甚至在没有大量人工标注推理数据的情况下,让模型自己"悟"出了推理能力。

1. 预训练:同样的起点

和 V3 一样,R1 的底座是 DeepSeek-V3-Base(预训练后的基础模型)。此时它有语言能力,但没有显式的深度推理能力。

2. 纯 RL 驱动推理(Pure RL-driven Reasoning):自我觉醒

本质:不给模型标准答案,只给规则化的奖励信号,让模型通过海量试错自己学会"怎么思考"。

DeepSeek-R1 的具体做法

阶段 A:Cold Start(冷启动 SFT)

  • 先收集几千条高质量的长思维链(CoT)数据,对 Base 模型做一次小规模 SFT
  • 目的:给 RL 一个稳定的起点,避免模型在 RL 初期"乱来"

阶段 B:Reasoning-Oriented RL(面向推理的强化学习)

  • 使用 GRPO(Group Relative Policy Optimization) 算法
  • 奖励信号极其简单,只有两个:
    1. 准确性奖励:数学题的答案对不对(可自动验证)
    2. 格式奖励:是否按规定的格式输出(如把推理过程放在 <think> 标签内)
  • 没有人类标注的推理过程!

神奇的事情发生了:模型在试错中自发学会了:

  • 把复杂问题拆解成子问题
  • 尝试不同解法并验证
  • 发现错误后自我修正(“Wait, let me check this again…”)
  • 生成越来越长的思维链

关键点:这是 “纯” RL——不依赖人类标注的推理数据,奖励信号完全来自可自动验证的规则(如数学题答案是否正确)。

3. SFT 对齐(SFT Alignment):能力整合

本质:把 RL 阶段涌现出的推理能力"固化"下来,同时补充通用能力,防止模型变成"只会做题的偏科生"。

DeepSeek-R1 的具体做法

阶段 C:Rejection Sampling + SFT(拒绝采样与监督微调)

  • 从 RL 训练后的模型中,用拒绝采样筛选出 60 万条高质量推理轨迹(只保留答案正确的长 CoT)
  • 混合 20 万条 V3 的非推理数据(写作、翻译、简单问答等)
  • 对模型进行第二轮 SFT

阶段 D:RL Alignment(全场景对齐)

  • 最后阶段引入人类偏好奖励(类似 RLHF),对齐 helpfulness 和 harmlessness
  • 同时保留推理能力

三、两条路线的核心区别

维度 传统 LLM(V3 路线) 推理模型(R1 路线)
核心哲学 模仿人类写的答案 自己探索解题策略
SFT 的作用 主要学习手段,数据量巨大 辅助手段,数据量小且经过严格筛选
RL 的作用 最后一步微调偏好 核心驱动力,让模型自发涌现推理
奖励信号 人类偏好(主观、模糊) 规则验证(客观、精确,如数学题对错)
数据依赖 极度依赖海量人工标注 极度依赖可自动验证的任务
适用任务 开放域对话、创意写作 数学、代码、逻辑推理

四、一句话总结

预训练 = 读万卷书(学知识)
SFT = 拜师学艺(学格式)
RLHF = 社会打磨(学做人)
纯 RL = 闭关顿悟(学会思考)
SFT 对齐 = 融会贯通(既会思考,也会聊天)

DeepSeek-R1 的革命性在于:它证明了深度推理能力不需要人类手把手教,只要给模型一个"对/错"的判卷机,它就能自己"悟"出来。这也是为什么 R1 的训练成本远低于 OpenAI o1,却能取得相近甚至更好的推理效果——它绕过了最昂贵的人工标注推理数据环节。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐