面试题解析:LLM 训练中,什么时候需要“先 SFT 后 RL“?
面试题解析:LLM 训练中,什么时候需要"先 SFT 后 RL"?
这是一道能快速区分"背过流程"和"真懂原理"的面试题。很多人能背出"预训练 → SFT → RLHF"这条流水线,但被追问"为什么 SFT 一定要放在 RL 前面?能不能跳过?"时就答不上来了。这篇博客帮你把底层逻辑讲透。
一、先回顾三个阶段各自在干什么
要回答"什么时候先 SFT 后 RL",得先明确每个阶段的职责:
- 预训练(Pre-training):在海量互联网文本上做"预测下一个词",给模型打下语言能力和世界知识的地基。这一步之后,模型什么都懂一点,但不知道"被提问时该怎么好好回答"。
- SFT(监督微调):用人工准备的"提问 → 理想回答"示范数据,继续做"预测下一个词"(只在回答部分回传梯度)。它教会模型回答的格式与协议——面对一个问题,该用什么结构、什么风格组织输出。
- RL(强化学习,如 RLHF / RLVR):不再模仿参考答案的 token,而是让模型自己生成回答,再用奖励信号评估好坏、回传梯度。它追求的是策略优化和泛化——在有打分标准的前提下,让模型的输出越来越符合人类偏好或任务目标。
一句话概括三者关系:预训练给"知识",SFT 给"形",RL 给"神"。
二、核心原因:RL 需要一个"能被打分的起点"
答这道题的关键,藏在 RL 的工作方式里。
RL 的训练闭环是这样的:
模型生成回答 → 解析输出 → 奖励函数打分 → 用奖励回传梯度 → 更新策略
注意第二步:必须先能把模型的输出解析出来,奖励函数才能打分。
现在设想一个场景:任务要求模型输出一段 JSON,或者发起一次工具调用(function call)。奖励函数的逻辑可能是"JSON 能否被解析成功、字段是否正确"。
- 如果模型此刻还是个"话都说不利索"的基础模型,它吐出来的是一团格式混乱的文本——括号不匹配、字段乱写、中英文混杂。
- 那么奖励函数连’成功还是失败’都判断不了,算出来的奖励要么全是 0,要么是随机噪声。
- 奖励信号一旦变成噪声,RL 就失去了学习方向,训练直接失败。
这就是为什么要先 SFT: 用少量示范数据,先把输出格式"立稳",让模型的输出能被奖励函数可靠解析。SFT 扮演的是"把话说利索"的角色,给 RL 提供一个能打分的起点。
借用中国画的说法:SFT 先把"形"(格式、结构)立起来,RL 再追求"神"(策略、泛化)——先形后神。
三、关键边界:这个"必须"是有条件的
这是这道题的加分点,也是区分候选人深度的地方。"必须先 SFT"不是绝对的,它成立的前提是:
较小的基础模型 + 严格的结构化输出要求。
在这个设定下,基础模型能力不足以自发产出合格的结构化输出,跳过 SFT 直接 RL 会因为奖励信号退化成噪声而完全失败。例如 Llama-3.2-Vision-11B 这个量级的模型,不经 SFT 直接做 RL 会彻底跑不起来。
但如果基础模型足够强呢?
强基模可能一上来就能产出"够格"的输出——格式基本可解析,奖励函数能正常打分。这时 RL 就有了起点,可以跳过 SFT 直接做。
四、最好的注脚:DeepSeek-R1-Zero 到 R1 的往返
这个案例几乎是为这道面试题量身定做的,答出来会很出彩。
DeepSeek-R1-Zero 证明了:一个足够强的基础模型,可以完全跳过 SFT、直接做 RL 并成功。它甚至自行涌现出了反思(reflection)、验证、长链思考(long chain-of-thought)等复杂推理行为——这说明"先 SFT"并非物理定律,强基模能突破这个约束。
但代价是什么? R1-Zero 的输出可读性差、中英文混杂、格式不稳定。"神"有了(推理能力很强),但"形"是乱的。
于是 DeepSeek 在正式的 R1 里,又把 SFT 加了回来——在 RL 之前引入少量高质量的"冷启动(cold start)"SFT 数据,把输出的"形"重新立稳,再接着做 RL。
所以 R1 从 Zero(纯 RL)到冷启动(重新加回 SFT)的这一趟往返,恰恰是**“先形后神”**这条原则最生动的证明:
- 强基模可以先不管形,直接练神(R1-Zero);
- 但要做出一个可用、可读、稳定的产品,最终还是得回过头把形立稳(R1 冷启动 SFT)。
五、面试时可以这样组织答案
如果时间有限,可以按这个结构简洁作答:
-
给结论:"先 SFT 后 RL"的核心原因是——RL 靠奖励信号学习,而奖励函数得先能解析模型的输出才能打分。SFT 负责把输出格式立稳,给 RL 一个能打分的起点。
-
讲机制:在结构化输出(JSON、工具调用)场景下,若模型输出混乱,奖励信号会退化成噪声,RL 无从学起。SFT 立"形",RL 追"神",即"先形后神"。
-
给边界:这个"必须"只在"较小基础模型 + 严格结构化输出"下成立。基础模型足够强时可以跳过 SFT 直接 RL。
-
举例证:Llama-3.2-Vision-11B 不经 SFT 直接 RL 会失败;反例是 DeepSeek-R1-Zero,强基模纯 RL 成功涌现推理能力,但因输出可读性差、中英混杂,DeepSeek 最终在 R1 里加回"冷启动 SFT"重新立稳"形"。
六、一句话总结
RL 需要一个"能被可靠打分"的起点。 当基础模型较小、任务又要求严格的结构化输出时,必须先用 SFT 把输出的"形"立稳,RL 才能算出有效的奖励、学到"神"。基础模型足够强时,这一步可以跳过——但 DeepSeek 从 R1-Zero 到 R1 加回冷启动 SFT 的往返说明:要做出稳定可用的产品,"形"终究得立起来。这就是"先形后神"的两阶段范式。
后记
2026年8月12日于上海,在claude opus 4.8辅助下完成。
更多推荐

所有评论(0)