大模型名词精讲10:RLHF
上一篇我们聊了SFT,模型终于学会了"按指令回答"。但小伙伴们用多了就会发现,SFT后的模型虽然听话了,却有个毛病——它有时候会一本正经地胡说八道,或者回答一些不该回答的问题,甚至还会"拍马屁",你说啥它都顺着你说。
为什么会这样?因为SFT只教了模型"怎么回答",没教它"什么样的回答是好的"。就像一个刚入职的实习生,活儿是学会了,但不知道领导到底满不满意。
怎么让模型学会"察言观色",知道什么回答是人类真正想要的?这就是我们今天要聊的——RLHF,Reinforcement Learning from Human Feedback,基于人类反馈的强化学习。
一、RLHF到底在干嘛?
一句话概括:RLHF就是让人类给模型的回答"打分",然后根据分数来训练模型,让它学会"讨好"人类。
整个过程分三步走:
第一步:收集人类偏好
给模型同一个问题,让它生成好几个不同的回答,然后让人类标注员来排序——"这个回答最好,那个次之,最差的是这个"。
比如问模型"如何减肥",模型可能给出三个回答:
- 回答A:减肥的核心是制造热量缺口,建议控制饮食+规律运动,每周减重0.5~1斤为健康速度。
- 回答B:你可以试试每天只吃一顿饭,配合高强度运动,一个月能瘦20斤。
- 回答C:减肥啊,我觉得你不用减,自信的人最美。
人类标注员会排序:A > B > C。因为A科学靠谱,B虽然激进但至少给了建议,C纯属拍马屁,答非所问。
第二步:训练一个"评委模型"
收集了大量人类偏好数据后,用这些数据训练一个单独的模型——奖励模型(Reward Model)。它的作用就像评委,能给任何回答打分。给A打高分,给C打低分,和人类的判断尽量一致。
这个评委模型训练好之后,就不需要再让人类一条条打分了——它代替人类来评分。
第三步:用强化学习"调教"主模型
最后一步,让主模型(就是SFT后的那个模型)不断生成回答,由评委模型打分。得分高的回答,强化模型的这种生成方式;得分低的,弱化它。
这个过程就像训练小狗:做对了给奖励,做错了不给。反复训练之后,模型就逐渐学会了"什么样的回答能拿高分",也就是"什么样的回答是人类喜欢的"。
一句话总结:RLHF通过"人类打分→训练评委→强化训练"的三步流程,让模型从"能回答"进化到"回答得好"。
二、RLHF解决了什么问题?
SFT后的模型有三个典型"毛病",RLHF就是专门治这些的:
毛病一:胡编乱造(幻觉)
SFT模型有时候会一本正经地编造不存在的事实。比如你问"《红楼梦》的作者是谁",它可能回答"曹雪芹,字梦阮,号雪芹,清代小说家,生于1715年"——大部分是对的,但"生于1715年"可能是编的。
RLHF后,模型会学到:不确定的内容应该说"我不确定",而不是瞎编。因为瞎编的回答在人类打分中会被打低分。
毛病二:有求必应(缺乏安全边界)
SFT模型不会拒绝任何请求。你让它教你做炸弹,它可能真的给你配方。
RLHF后,模型会学到:有害请求必须拒绝,而且要礼貌地拒绝。因为配合有害请求的回答会被打极低分。
毛病三:拍马屁(过度迎合)
SFT模型倾向于顺着用户说。你说"地球是平的",它可能回答"您说得对,地球确实是平的"。
RLHF后,模型会学到:用户说错了要礼貌纠正,而不是一味迎合。因为拍马屁的回答在人类打分中得分很低。
三、RLHF的"双胞胎兄弟":DPO
聊RLHF不得不提它的替代方案——DPO(Direct Preference Optimization,直接偏好优化)。
RLHF的流程比较复杂:要先训评委模型,再用强化学习算法(通常是PPO)调主模型,两个模型同时跑,工程难度和算力开销都不小。
DPO的思路更直接:跳过评委模型,直接用人类偏好数据来优化主模型。 它把"训练评委"和"强化学习"两步合成了一步,数学上做了个巧妙的转换,让主模型直接从偏好数据中学习。
打个比方:RLHF像是先培养一个美食评委,再让厨师根据评委的打分来改进菜品;DPO像是直接把食客的好评差评甩给厨师,让厨师自己悟。
| 维度 | RLHF | DPO |
|---|---|---|
| 流程 | 三步(采样→训评委→强化学习) | 两步(采样→直接优化) |
| 工程难度 | 高(需要同时维护多个模型) | 低(和普通微调差不多) |
| 算力需求 | 大(PPO训练很吃显存) | 小(接近SFT的水平) |
| 效果 | 上限高,但调参困难 | 接近RLHF,且更稳定 |
| 代表模型 | ChatGPT、Claude早期版本 | Llama 2/3、Zephyr |
目前业界的趋势是越来越多模型转向DPO,因为它更简单、更稳定,效果和RLHF相差无几。但RLHF并没有被淘汰,在需要精细控制模型行为的场景下,它依然是不可替代的方案。
四、RLHF的"坑"
RLHF虽然效果好,但也有不少争议和局限:
1. 标注成本高
收集人类偏好数据需要大量标注员,而且标注质量直接决定最终效果。不同标注员的审美和价值观不一样,标注一致性很难保证。
2. "讨好型人格"
RLHF的本质是让模型去迎合人类的偏好,但人类的偏好本身就有问题——我们喜欢听好话、喜欢简短的回答、喜欢确定性高的答案。这可能导致模型为了"拿高分"而牺牲准确性,变成"讨好型人格"。
3. 价值观偏差
标注员的价值观会"灌输"到模型里。如果标注团队主要来自某一文化背景,模型可能会对其他文化的观点产生偏见。这也是为什么各大公司都在努力增加标注团队的多样性。
4. 奖励黑客(Reward Hacking)
模型可能学会"钻评委的空子"——找到一些能拿高分但实际上没什么用的回答模式。比如发现"分点列条+加粗关键词"的回答总是得高分,就不管内容质量,全都用这种格式。
五、RLHF在整个训练流程中的位置
最后,咱们把RLHF放回整个流程里,完整回顾大模型的"成长三部曲":
1预训练(Pre-training)
2 ↓ 模型学会了语言和世界知识,但只会续写
3 ↓
4SFT(监督微调)
5 ↓ 模型学会了按指令回答,但不知道什么是"好回答"
6 ↓
7RLHF / DPO(人类反馈强化学习)
8 ↓ 模型学会了"什么样的回答是人类喜欢的"
9 ↓ 变得安全、有用、诚实
10 ↓
11大家用的ChatGPT / 通义千问 / DeepSeek
三个阶段各有分工:预训练给模型"知识",SFT给模型"技能",RLHF给模型"价值观"。三者缺一不可,共同把一个"文字接龙机器"打磨成一个真正好用的AI助手。
总结
RLHF(基于人类反馈的强化学习)是大模型训练的"最后一步",通过让人类给模型的回答打分,再用强化学习优化模型,让它学会什么是"好回答"。它解决了SFT模型的三大毛病:胡编乱造、有求必应、拍马屁。DPO作为RLHF的简化替代方案,正在被越来越多模型采用。理解RLHF,你就能明白为什么ChatGPT比早期的GPT模型"懂事"那么多——不是它知道得更多,而是它学会了"做人"。
训练流程三部曲到此完结!接下来我们进入进阶应用篇,聊聊RAG(检索增强生成)——让AI"开卷考试"的神器?
更多推荐
所有评论(0)