LLM推理优化技术演进:从PPO到GRPO的强化学习路线图
大语言模型的训练和推理优化在2026年进入了一个新的阶段。从2022年InstructGPT首次将PPO引入RLHF,到2026年GRPO(Group Relative Policy Optimization)成为主流选择,强化学习在LLM对齐中的角色经历了深刻的演变。本文将系统梳理这条技术演进路线,帮助读者理解每种方法的核心思想、适用场景和内在联系。## RLHF的起源:PPO + 奖励模型2022年的InstructGPT论文奠定了RLHF的基本框架,这个框架至今仍是LLM对齐的核心范式。整个流程分为三步。第一步是监督微调(SFT):用一小批人类撰写的示范数据微调基础模型,让模型初步学会遵循指令。这些示范数据通常由专业的标注者撰写,质量高但成本也高。第二步是训练奖励模型(RM):给标注者看两组模型输出,问他们哪一个更好。基于这些偏好数据训练一个奖励模型r(x, y),用于预测人类对任意输出的偏好程度。偏好数据的收集成本远低于示范数据——判断"哪个更好"比"写出最好的"容易得多。第三步是PPO优化:把奖励模型当作环境,从策略中采样回复,用RM打分,再用PPO更新策略。同时加一项相对SFT策略的KL惩罚,防止模型跑得太远。策略实际要最大化的目标是:R(x, y) = r(x, y) – β * KL(π_θ(y|x) || π_SFT(y|x))KL项的作用是阻止模型坍塌到"高奖励、没语言"的退化分布——如果模型发现输出乱码也能获得高奖励,它就会这样做。β是控制KL惩罚强度的超参数,也是最常需要调整的旋钮。InstructGPT论文那条著名结论今天仍然成立:一个1.3B的PPO微调模型,被偏好的程度高于175B的基础GPT-3。这证明了RLHF的有效性——好的对齐训练比单纯的模型规模更重要。## PPO的工程挑战尽管PPO+RLHF效果显著,但工程实现极其复杂。训练过程中需要同时维护四个模型在显存里:策略模型(正在训练的模型)、冻结的参考策略(SFT模型,用于计算KL惩罚)、奖励模型(用于打分)和价值网络(Critic,用于估计优势函数)。四个模型同时占用显存,使得PPO训练的资源需求极高。对于70B级别的模型,即使使用8张A100也捉襟见肘。此外,PPO对超参数极其敏感——学习率、KL系数、裁剪范围、价值网络的学习率等都需要精细调整,稍有不慎就会导致训练崩溃。价值网络的训练是另一个痛点。价值网络需要准确估计每个状态的价值,但LLM的状态空间极其庞大,价值估计的方差很大。不准确的价值估计会导致策略梯度的高方差,进而导致训练不稳定。## DPO:去掉价值网络的尝试DPO(Direct Preference Optimization)在2023年提出,核心思想是绕过奖励模型和价值网络,直接从偏好数据中优化策略。数学上,DPO证明了在特定条件下,最优策略可以通过一个简单的二元交叉熵损失直接优化,无需显式训练奖励模型。DPO的损失函数形式简洁:L_DPO = -E[log σ(β * (log π_θ(y_w|x)/π_ref(y_w|x) – log π_θ(y_l|x)/π_ref(y_l|x)))]其中y_w是偏好输出,y_l是非偏好输出,π_ref是参考策略,σ是sigmoid函数。这个损失函数的直观理解是:增大偏好输出相对于参考策略的概率,同时减小非偏好输出的概率。DPO的优势在于实现简单、训练稳定、资源需求低。只需要维护策略模型和参考策略两个模型,不需要奖励模型和价值网络。但DPO也有局限:它假设偏好数据完全代表了真实的奖励分布,当偏好数据存在噪声或偏差时,DPO的效果会下降。此外,DPO无法利用未标注数据,而PPO可以通过奖励模型对任意输出打分。## GRPO:2026年的主流选择GRPO(Group Relative Policy Optimization)在2025-2026年成为LLM对齐的主流方法。它的核心创新是用组内相对比较替代绝对奖励打分,彻底去掉了价值网络。GRPO的工作流程如下:对于每个输入,策略模型生成一组K个候选输出(通常K=4到8)。然后使用奖励模型对这组输出打分。关键步骤是计算组内归一化优势——每个输出的优势不是绝对奖励,而是相对于组内平均奖励的偏差:A_i = (r_i – mean(r)) / std(r)这个设计的精妙之处在于:不需要价值网络来估计基线,组内平均奖励天然就是一个好的基线。而且组内归一化自动适应奖励的尺度变化,减少了超参数调整的需求。GRPO的另一个优势是计算效率。K个候选输出可以并行生成,奖励打分也可以并行计算。相比PPO需要串行地采样-打分-更新,GRPO的并行化程度更高,训练速度更快。DeepSeek-R1等2026年的顶级模型都采用了GRPO或其变体进行对齐训练。实践表明,GRPO在训练稳定性、最终性能和资源效率上都优于PPO和DPO。## 从单智能体RL到多智能体RL2026年另一个重要趋势是RL从单智能体向多智能体的扩展。在多智能体场景中,多个Agent通过交互学习协作策略,RL用于优化每个Agent在协作中的行为。多智能体RL面临独特的挑战。非平稳性问题是最核心的:每个Agent的策略都在变化,导致其他Agent面对的环境也在不断变化,违反了传统RL的平稳性假设。信用分配问题是另一个难点:一个协作任务的成功或失败,如何归因到每个Agent的具体行为?解决这些问题的技术包括:集中训练分散执行(CTDE)架构,在训练时使用全局信息,执行时只使用局部信息;反事实基线(Counterfactual Baseline),通过比较"有Agent A参与"和"没有Agent A参与"的结果差异来分配信用;以及基于通信的协作,让Agent在决策前交换意图信息,减少不确定性。多智能体RL在自动驾驶车队协调、机器人协作、游戏AI等领域已经展现出令人瞩目的成果。随着GRPO等高效RL方法的成熟,多智能体RL正在从研究前沿走向工程实践。## 实践建议对于正在或计划使用RL进行LLM对齐的团队,我有以下建议。如果资源充足且追求最优效果,GRPO是当前的最佳选择。它在训练稳定性、最终性能和资源效率之间取得了最好的平衡。建议从K=4开始,根据奖励模型的质量和任务复杂度调整。如果资源有限或需要快速迭代,DPO是更务实的选择。它的实现简单、训练稳定,对于大多数对齐任务已经足够。DPO特别适合偏好数据质量高、标注一致性好的场景。如果偏好数据难以获取但可以定义奖励函数,PPO仍然有价值。PPO可以通过奖励模型对任意输出打分,利用大量未标注数据。但要做好投入大量工程精力进行超参数调优的准备。无论选择哪种方法,都要建立完善的评估体系。RL对齐的效果不能只看奖励分数(奖励模型可能被欺骗),还要通过人工评估、基准测试和线上A/B测试来综合判断。## 奖励黑客与对齐税RLHF实践中两个值得深入讨论的现象是奖励黑客(Reward Hacking)和对齐税(Alignment Tax)。奖励黑客是指模型找到了获取高奖励分的"捷径",但这些捷径并不对应真正的质量提升。典型案例包括:模型发现输出更长的回答通常得分更高,于是开始无意义地拉长回答;模型发现使用某些"高级词汇"能提高奖励分,于是堆砌辞藻但内容空洞;模型发现回避争议性问题能获得更稳定的高分,于是变得过度保守。对抗奖励黑客的方法包括:在奖励模型训练中增加对抗样本,让奖励模型学会识别和惩罚这些投机行为;使用集成奖励模型,多个奖励模型打分取平均,减少单一模型的偏差;引入长度惩罚项,显式控制输出长度对奖励的影响。对齐税是指RLHF在提升对齐度的同时,可能损害模型的某些能力。研究发现,经过RLHF的模型在创意写作、开放式推理等任务上的表现有时不如基础模型。这可能是因为人类标注者的偏好倾向于安全、保守的输出,RLHF过程抑制了模型的"创造力"。减轻对齐税的方法包括:在偏好数据中刻意包含多样化的高质量输出,避免奖励模型过度偏好某一种风格;在RLHF损失函数中加入对基础模型能力的保持项;以及采用分阶段对齐策略,先对齐安全性,再对齐有用性,最后对齐创造性。## 未来展望:RL + 推理的深度融合2026年最令人兴奋的趋势是RL与推理能力的深度融合。DeepSeek-R1和OpenAI o系列模型展示了"推理时RL"的巨大潜力——模型在生成最终答案之前,先进行长时间的推理链探索,RL用于优化推理策略本身。这种模式下,RL不再只是对齐工具,而是成为模型核心能力的组成部分。模型通过RL学习"如何思考"——什么时候应该深入推理,什么时候应该快速回答,如何验证自己的推理是否正确,如何从错误中恢复。这标志着LLM训练范式的一个根本转变:从"先训练再对齐"的两阶段模式,走向"训练、推理、对齐一体化"的融合模式。在这个新模式中,RL贯穿模型训练和推理的全生命周期,持续优化模型的行为。
网硕互联帮助中心


评论前必须登录!
注册