强化学习讲义1——RL-for-LLM技术选择决策图Tricks-or-Traps

作者: 引线小白-本文永久链接:https://www.limoncc.com/post/e2dd286f4b3be253/
知识共享许可协议: 本博客采用署名-非商业-禁止演绎4.0国际许可证

导言:论文[arXiv:2508.08221 ][^1] 认为
RL for LLM 的绝大多数”技巧”并非普适,而是强烈依赖模型类型(Base vs. 对齐模型)、数据难度和奖励尺度;只需”组级均值 + 批次级标准差的优势归一化”配合”词元级损失聚合”两种技术(即 Lite PPO),即可在原始 PPO 损失下释放无 critic 策略的学习能力,并超越 GRPO 与 DAPO。本文也
是强化学习
讲义系列第一篇,力求提取文章精华降低理解难度。
LitePPO总结了各类强化学习算法,以它作为第一篇开头。

一、LitePPO的完整目标函数

$$\begin{align}
\mathcal{J}_{\text{LitePPO}}(\theta) \;=\; \mathbb{E}_{\,q \sim \mathcal{D},\;\{o_i\}_{i=1}^{G} \sim \pi_{\theta_{\text{old}}}(\cdot|q)} \left[\;
\frac{1}{\sum_{i=1}^{G}|o_i|}\sum_{i=1}^{G}\sum_{t=1}^{|o_i|}
\min\Big(
r_{i,t}(\theta)\,\hat{A}_{i,t},\;
\mathrm{clip}\big(r_{i,t}(\theta),\,1{-}\epsilon,\,1{+}\epsilon\big)\,\hat{A}_{i,t}
\Big)
\;\right]
\end{align}$$

其中优势通过组级均值 + 批次级标准差计算——这就是 Lite PPO 的全部:

$$\begin{align}
\hat{A}_{i,t}=\underbrace{\frac{r_i-\mathrm{mean}_{\text{组级}}\big(\{r_j\}_{j=1}^{G}\big)}{\mathrm{std}_{\text{批次级}}\big(\{r_j\}_{j=1}^{N\cdot G}\big)}}_{\text{要点 3:稳健归一化}}\quad,
r_{i,t}(\theta)=\frac{\pi_\theta(o_{i,t}\mid q,o_{i,:t})}{\pi_{\theta_{old}}(o_{i,t}\mid q,o_{i,:t})}
\end{align}$$

二、与基线的公式级对比

组件 Lite PPO GRPO DAPO
评论网络 / GAE ✗(Monte-Carlo 奖励 $r_i$)
优势均值 组级 $\mathrm{mean}(\{r_j\}_{j=1}^G)$ 组级 组级
优势标准差 批次级 $\mathrm{std}(\{r_j\}_{j=1}^{NG})$ 组级 组级
损失归一化项 $\sum_i \lvert o_i\rvert$(词元级) $G\lvert o_i\rvert$(序列级) $\sum_i \lvert o_i\rvert$(词元级)
非对称裁剪 $\epsilon_{\text{high}}>\epsilon$ ✗(原始对称 $\epsilon$) ✓(0.28)
KL 惩罚项 ✓ $-\beta D_{\mathrm{KL}}$
动态采样 / 超长奖励塑形
过滤全对/全错组

三、一句话解读

$$\begin{align}
\text{Lite PPO}
=\underbrace{\mathcal{J}_{\text{PPO}}}_{\text{原始对称裁剪损失,无 critic、无 KL}}
+\underbrace{A^{\text{group-mean}}_{\text{batch-std}}}_{\text{唯一修改 ①:跨层级优势归一化}}
+\underbrace{\mathcal{J}_{\text{token-level}}}_{\text{唯一修改 ②:词元级聚合}}
\end{align}$$

相对 GRPO/DAPO,它只做减法和一处替换:去掉 KL 项、去掉非对称上界裁剪、去掉动态采样与超长过滤,再把优势的分母从组级 std 换成批次级 std。正是这两处保留(组均值提供组内相对基线、批次 std 稳定梯度量级;词元级聚合消除长度偏置)使得该最简目标在 Qwen3-Base 模型上超越了技术堆叠更复杂的 GRPO 与 DAPO。

四、RL for LLM 技术选择决策图

START

你的初始策略模型是哪种?

最关键分叉点:几乎所有结论都以「模型类型」为首要变量

分支 A:Base(未对齐)模型

① 优势归一化 · 要点 1–3

组级均值 + 批次级标准差

$$ \hat{A}_{i,t}=\frac{r_i-\underset{\text{组级}}{\mathrm{mean}}\{r_j\}_{j=1}^{G}}{\underset{\text{批次级}}{\mathrm{std}}\{r_j\}_{j=1}^{N\cdot G}} $$

✔ 稳健组合;只用组级 std 时,奖励高度集中会导致分母极小 → ✘ 梯度爆炸

② Clip-Higher · 要点 4–6

提高裁剪上界 ε_high?

✘ 不需要:Base 模型 clip 率仅约 0.003,
放宽上界无益甚至有害

③ 损失聚合 · 要点 7

词元级 or 序列级?

✔ 词元级:归一化项为 1/Σ|oi|,
每个词元贡献均等,消除长度偏置,收敛更快、峰值更高

④ 超长过滤 · 要点 8

要不要掩码超长响应?

✘ 建议移除:会限制小模型生成复杂长尾推理输出的能力

BASE 路径结论

组均值 + 批std + 词元级损失 + 原始 PPO

无 critic · 无 KL 项 · 对称裁剪 clip(r, 1−ε, 1+ε)

分支 B:Instruct(对齐)模型

① 优势归一化 · 要点 1–3

组级均值 + 批次级标准差

✔ 同样是稳健组合,对齐模型上保留

② Clip-Higher · 要点 4–6

提高裁剪上界 ε_high?

✔ 有效:缓解熵崩溃,释放推理结构多样性
4B 模型:ε_high = 0.32(存在「缩放定律」)
8B 模型:ε_high = 0.28(DAPO 默认已最优)

③ 损失聚合 · 要点 7

词元级 or 序列级?

✔ 序列级:词元级优势消失甚至有害,
序列级更好保留输出结构一致性

④ 超长过滤 · 要点 8

要不要掩码超长响应?

✔ 建议启用:纠正 EOS 建模退化,抑制「重复不终止」样本
小阈值(8k)收益最大;20k 收益有限

INSTRUCT 路径结论

归一化组合 + Clip-Higher(0.28 / 0.32)+ 序列级损失 + 超长过滤

保持输出结构稳定性优先

🎯 最终推荐(Base 模型场景)

Lite PPO —— 仅两种技术的最简组合

$$ \hat{A}_{i,t}=\frac{r_i-\underset{\text{组级均值}}{\mathrm{mean}}\big(\{r_j\}_{j=1}^{G}\big)}{\underset{\text{批次级标准差}}{\mathrm{std}}\big(\{r_j\}_{j=1}^{N\cdot G}\big)} $$

$$ \mathcal{J}_{\text{LitePPO}}(\theta)=\frac{1}{\sum_{i=1}^{G}|o_i|}\sum_{i=1}^{G}\sum_{t=1}^{|o_i|}\min\Big(r_{i,t}(\theta)\,\hat{A}_{i,t}, \mathrm{clip}\big(r_{i,t}(\theta),\,1-\epsilon,\,1+\epsilon\big)\,\hat{A}_{i,t}\Big) $$

✔ 组级均值✔ 批次级 std✔ 词元级聚合✘ 无 critic✘ 无 KL 惩罚✘ 无非对称裁剪✘ 无动态采样/超长塑形

在 Qwen3-4B / 8B-Base 上持续超越 GRPO 与 DAPO
「简洁性可以战胜复杂性」

⚠️ 所有结论基于 Qwen3 系列 + ROLL 框架 + 数学推理任务验证,跨模型家族、跨领域可能不成立。
决策前请确认:① 模型类型(Base / Instruct) ② 数据难度分布 ③ 奖励尺度与集中度 ④ 目标响应长度范围

[^1]: Liu, Z., Liu, J., He, Y., Wang, W., Liu, J., Pan, L., Hu, X., Xiong, S., Huang, J., Hu, J., Huang, S., Obando-Ceron, J., Yang, S., Wang, J., Su, W., & Zheng, B. (2025, August 11). Part I: Tricks or traps? A deep dive into RL for LLM reasoning. arXiv. https://doi.org/10.48550/arXiv.2508.08221


版权声明
引线小白创作并维护的柠檬CC博客采用署名-非商业-禁止演绎4.0国际许可证。
本文首发于柠檬CC [ https://www.limoncc.com ] , 版权所有、侵权必究。
本文永久链接https://www.limoncc.com/post/e2dd286f4b3be253/
如果您需要引用本文,请参考:
引线小白. (Sep. 23, 2026). 《强化学习讲义1——RL-for-LLM技术选择决策图Tricks-or-Traps》[Blog post]. Retrieved from https://www.limoncc.com/post/e2dd286f4b3be253
@online{limoncc-e2dd286f4b3be253,
title={强化学习讲义1——RL-for-LLM技术选择决策图Tricks-or-Traps},
author={引线小白},
year={2026},
month={Sep},
date={23},
url={\url{https://www.limoncc.com/post/e2dd286f4b3be253}},
}

'