大语言模型研究17——强化学习中KL散度惩罚问题

作者: 引线小白-本文永久链接:https://www.limoncc.com/post/9e2e995289848c87/
知识共享许可协议: 本博客采用署名-非商业-禁止演绎4.0国际许可证

一、回顾一下问题来源

1.1、优化目标的惩罚项

对于优化目标 $f(\theta)$, 如果有约束项 $g(\theta)$,通常使用拉格朗日乘子法表示为:

$$\begin{align}
\max_{\theta} [f(\theta)+\lambda g(\theta)]
\end{align}$$

1.2、PPO的KL散度惩罚

PPO提出了裁剪版的代理目标函数

$$\begin{align}
\mathcal{L}_{\textit{PPO} }(\bm{\theta})
&=\mathbb{E}_{q\sim \rho(Q),\bm{o}\sim \pi_{\bm{\theta}_\text{old} } }\frac{1}{\mid\bm{o}\mid}\sum_{t=1}^{\mid\bm{o}\mid}\bigg[\min\left[\frac{\pi_{\bm{\theta} }(o_t\mid q,o_{:t})}{\pi_{\bm{\theta}_\text{old} }(o_t\mid q,o_{:t})}\cdot A_{\pi}(q,o_t),\mathrm{\text{clip} }\left[\frac{\pi_{\bm{\theta} }(o_t\mid q,o_{:t})}{\pi_{\bm{\theta}_\text{old} }(o_t\mid q,o_{:t})},1-\epsilon,1+\epsilon\right]\cdot A_{\pi}(q,o_t)\right]\bigg]
\end{align}$$

为减轻奖励模型的过度优化,PPO引入了基于参考模型的 $\text{KL}$ 散度惩罚项, 在计算每个token奖励时,减去 $\{o_1,\cdots,o_t\}$ 上的散度,

$$\begin{align}
r_t=\pi_{\bm{\theta}_{\textit{rm} } }(q,o_{:t})-\beta \hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]
\end{align}$$

其中:
$\pi_{\bm{\theta}_{\textit{rm} } }$ 是奖励模型(reward model)
$\displaystyle \hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big] = \log \frac{\pi_{\bm{\theta} }(o_t\mid q,o_{:t})}{\pi_{\bm{\theta}_\textit{ref} }(o_t\mid q,o_{:t})}$

PPO这个KL散度惩罚加入的是一眼看上去是极其的不自然。学过优化理论的都知道,惩罚应该加到整体目标函数的外面。PPO这个操作是加到目标函数里面的一个参数里面。这是不自然的。

1.3、GRPO的KL惩罚

deepseek math论文[^5]提出了,GRPO组相对策略优化,目标函数是

$$\begin{align}
&\mathcal{L}_{\textit{GRPO} }(\bm{\theta})
=\mathbb{E}_{q\sim \rho(Q),\{\bm{o}_i\}_{i=1}^G\sim \pi_{\bm{\theta}_\text{old} } }\\
&\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\min\left[\frac{\pi_{\bm{\theta} }(o_{i,t}\mid q,o_{i,:t})}{\pi_{\bm{\theta}_\text{old} }(o_{i,t}\mid q,o_{i,:t})}\cdot A_{\pi}(q,o_{i,t}),\mathrm{\text{clip} }\left[\frac{\pi_{\bm{\theta} }(o_{i,t}\mid q,o_{i,:t})}{\pi_{\bm{\theta}_\text{old} }(o_{i,t}\mid q,o_{i,:t})},1-\epsilon,1+\epsilon\right]\cdot A_{\pi}(q,o_{i,t})\right]-\beta \mathbb{\hat{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]\bigg]
\end{align}$$

其中 $\displaystyle \mathbb{\hat{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big] =\frac{\pi_{\bm{\theta}_\textit{ref} }(o_t\mid q,o_{:t})}{\pi_{\bm{\theta} }(o_t\mid q,o_{:t})}- \log \frac{\pi_{\bm{\theta}_\textit{ref} }(o_t\mid q,o_{:t})}{\pi_{\bm{\theta} }(o_t\mid q,o_{:t})}-1$

忽略掉clip,GRPO的目标函数其实是这样:

$$\begin{align}
\mathcal{L}(\bm{\theta})
=\mathbb{E}_{q\sim\rho,\bm{o}\sim \pi_{\bm{\theta}_{old} } }
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\frac{\pi_{\bm{\theta} }(o_{i,t}\mid q,o_{i,:t})}{\pi_{\bm{\theta}_\text{old} }(o_{i,t}\mid q,o_{i,:t})}A_{i,t}
-\beta\cdot\hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]\bigg]
\end{align}$$

这样看,比PPO稍微要合理一点,因为KL惩罚项可以单独提出来,这样就和常规优化惩罚项一致了。

二、GRPO的KL散度的理论分析

GRPO的KL散度惩罚项的梯度分析最早见之于^1和^2, 不过他们的符号较为混乱,不够清晰。尤其关于PPO的部分,笔者很难同意是正确的。下面分析均是基于token级别的惩罚。

2.1、KL散度惩罚

现在讨论GRPO的KL散度,到底是怎么来的,我们先忽略clip和重要性采样。回归到强化学习的目标函数(状态价值函数),去考察KL散度。其中 $q,o_{i,:t}$是状态 $s_t$, $o_{i,t}$是动作 $a_t$。也可以用优势函数替换期望中的动作价值函数。它们的策略梯度是等价的。

$$\begin{align}
\mathcal{J}(\bm{\theta})
&=V_{\pi_{\bm{\theta} } }(o_{i,t})
=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} } }
\bigg[\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
Q_{\pi_{\bm{\theta} } }\big(q,o_{i,:t},o_{i,t}\big)
\bigg]\\
\mathcal{J}(\bm{\theta})
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} } }
\bigg[\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
A_{\pi_{\bm{\theta} } }\big(q,o_{i,:t},o_{i,t}\big)
\bigg]
\end{align}$$

下面从这个目标函数来推导。如果给目标函数加KL散度约束,应该是这样
$$\begin{align}
\mathcal{L}(\bm{\theta})
=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} } }
\bigg[\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
A_{\pi}(q,o_{i,t})
\bigg]
-\mathbb{E}_{q\sim \rho}\bigg[\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\beta\cdot\mathbb{KL}\big[\pi_{\bm{\theta} }\\mid\pi_{\bm{\theta}_{ref} }\big]\bigg]
\end{align}$$

准确说对于其中一个token输出 $o_{i,t}$ 的KL散度是这样的

$$\begin{align}
\mathbb{KL}\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]
=\sum_{o_{i,t} \in \mathcal{Vocab} }\pi_{\bm{\theta} } \cdot \hat{\mathbb{KL} }
=\sum_{o_{i,t} \in \mathcal{Vocab} }\pi_{\bm{\theta} }(o_{i,t}\mid q,o_{i,:t})\cdot\hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]
\end{align}$$

把加约束的目标函数展开

$$\begin{align}
\mathcal{L}(\bm{\theta})
&=\mathbb{E}_{q\sim \rho}
\bigg[\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }\pi_{\bm{\theta} }(o_{i,t}\mid q,o_{i,:t})
A_{\pi}(q,o_{i,t})
\bigg]
-\mathbb{E}_{q\sim \rho}\bigg[\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\beta\sum_{o_{i,t} \in \mathcal{Vocab} }\pi_{\bm{\theta} }(o_{i,t}\mid q,o_{i,:t})\cdot\hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]\bigg]\\
&=\mathbb{E}_{q\sim \rho}
\bigg[\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }\pi_{\bm{\theta} }(o_{i,t}\mid q,o_{i,:t})\bigg(
A_{\pi}(q,o_{i,t})-\beta\cdot\hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]\bigg)
\bigg]\\
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} } }
\bigg[
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg(
A_{\pi}(q,o_{i,t})-\beta\cdot \hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]
\bigg)
\bigg]\\
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} } }
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[
A_{\pi}(q,o_{i,t})-\beta\cdot \hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]
\bigg]
\end{align}$$

GRPO在loss中加KL散度是极为自然的,符合经典的带约束优化形式:直接在策略梯度的目标函数后面加上正则项(KL惩罚)

$$\begin{align}
\mathcal{L}(\bm{\theta})
=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} } }
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[A_{i,t}
-\beta \cdot\hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]
\bigg]
\end{align}$$

但是如果考虑重要性采样(IS)。情况就变化了,为了分析,我们去掉不必要的项。按照GRPO的规则,不给KL惩罚项加IS。

$$\begin{align}
\mathcal{L}(\bm{\theta})
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta}_{old} } }
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\frac{\pi_{\bm{\theta} }(o_{i,t}\mid q,o_{i,:t})}{\pi_{\bm{\theta}_\text{old} }(o_{i,t}\mid q,o_{i,:t})}A_{i,t}
-\beta\cdot\hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]
\bigg]\\
&=\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta}_{old} } }
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\frac{\pi_{\bm{\theta} }(o_{i,t}\mid q,o_{i,:t})}{\pi_{\bm{\theta}_\text{old} }(o_{i,t}\mid q,o_{i,:t})}A_{i,t}\bigg]}_{\small\text{ 标准的强化学习目标} }
-\beta \cdot \underbrace{ \mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta}_{old} } }
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]\bigg]}_{\small\text{KL惩罚项} }\\
&=\underbrace{\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[
\pi_{\bm{\theta}_{old} }\frac{\pi_{\bm{\theta} }(o_{i,t}\mid q,o_{i,:t})}{\pi_{\bm{\theta}_\text{old} }(o_{i,t}\mid q,o_{i,:t})}A_{i,t}\bigg]}_{\small\text{ 标准的强化学习目标} }
-\beta\cdot\underbrace{ \mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\pi_{\bm{\theta}_{old} }\cdot\hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]\bigg]}_{\small\text{KL惩罚项} }
\end{align}$$

单独考察惩罚项

$$\begin{align}
\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta}_{old} } }
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]\bigg]
=\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\pi_{\bm{\theta}_{old} }\cdot \hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]
\end{align}$$

这里由于缺失了重要性采样系数,将导致结果是有偏的。也就是说由于没有乘 IS 系数,它的期望实际上是 $\mathbb{E}_{o \sim \pi_{\theta_{old} } }[\hat{\mathbb{KL} }]$。但理论上,我们希望计算的是新策略 $\pi_{\theta}$ 自身与 $\pi_{ref}$ 的 KL 散度,其期望应该是 $\mathbb{E}_{o \sim \pi_{\theta} }[\hat{\mathbb{KL} }]$。对此DeepSeek-V3.2 技术报告[^3]在 “Scaling GRPO” 章节中明确引入了 Unbiased KL Estimate(无偏 KL 估计),即在原始 K3 估计器前显式乘以了重要性采样比率 。

2.2、KL散度惩罚的作用

2.2.1、期望概率梯度截断情形

$$\begin{align}
\mathcal{L}(\bm{\theta})
=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta}_{old} } }
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[
\frac{\pi_{\bm{\theta} }(o_{i,t}\mid q,o_{i,:t})}{\pi_{\bm{\theta}_\text{old} }(o_{i,t}\mid q,o_{:t})}
\bigg(
A_{i,t}-\beta \cdot\hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]
\bigg)
\bigg]
\end{align}$$

2.2.1.1、K3策略梯度截断情形

为了便于分析带入K3展开有:

$$\begin{align}
\mathcal{L}(\bm{\theta})
&=\underbrace{\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\pi_{\bm{\theta}_{old} }\frac{\pi_{\bm{\theta} } }{\pi_{\bm{\theta}_\text{old} } }A_{i,t}\bigg]}_{\small\text{ 标准的强化学习目标} }
-\beta \cdot \underbrace{ \mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\pi_{\bm{\theta}_{old} }\frac{ {\color{gray} \pi_{\bm{\theta} } } }{\pi_{\bm{\theta}_\text{old} } }\cdot\hat{\mathbb{KL} }\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]\bigg]}_{\small\text{KL惩罚项} }\\
&=\underbrace{\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\pi_{\bm{\theta} }\cdot A_{i,t}\bigg]}_{\small\text{标准的强化学习目标} }
-\beta \cdot \underbrace{ \mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[{\color{gray} \pi_{\bm{\theta} } }\cdot\big(\frac{\pi_{\bm{\theta}_\textit{ref} } }{\pi_{\bm{\theta} } }- \log \frac{\pi_{\bm{\theta}_\textit{ref} } }{\pi_{\bm{\theta} } }-1\big)\bigg]}_{\small\text{KL惩罚项} }\\
&=\underbrace{\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[
\pi_{\bm{\theta} }\cdot A_{i,t}\bigg]}_{\small\text{标准的强化学习目标} }
-\beta \cdot \underbrace{ \mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\mathrm{SG}(\pi_{\bm{\theta} })\cdot\big(\frac{\pi_{\bm{\theta}_\textit{ref} } }{\pi_{\bm{\theta} } }- \log \frac{\pi_{\bm{\theta}_\textit{ref} } }{\pi_{\bm{\theta} } }-1\big)\bigg]}_{\small\text{KL惩罚项} }
\end{align}$$

灰色 ${\color{gray} \pi_{\bm{\theta} }}$ 表示梯度冻结,求梯度时不参与运算, 也可以写成 $\mathrm{SG}(\pi_{\bm{\theta} })$,stop gradient(SG)。这里期望概率梯度为何截断。分析一下,同时注意到 $\displaystyle \pi_{\theta}\cdot\nabla_{\theta}\log\pi_{\theta}=\nabla_{\theta}\pi_{\theta}$, KL惩罚项的梯度求解:

$$\begin{align}
&\nabla_{\bm{\theta} }\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\mathrm{SG}(\pi_{\bm{\theta} })\cdot\big(\frac{\pi_{\bm{\theta}_\textit{ref} }}{\pi_{\bm{\theta} }}- \log \frac{\pi_{\bm{\theta}_\textit{ref} }}{\pi_{\bm{\theta} }}-1\big)\bigg]\\
&=\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\pi_{\bm{\theta} }\cdot\nabla_{\bm{\theta} }\big(\frac{\pi_{\bm{\theta}_\textit{ref} }}{\pi_{\bm{\theta} }}- \log \frac{\pi_{\bm{\theta}_\textit{ref} }}{\pi_{\bm{\theta} }}-1\big)\bigg]\\
&=\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\pi_{\bm{\theta} }\cdot \frac{\nabla_{\bm{\theta} }\pi_{\bm{\theta} }}{\pi_{\bm{\theta} }}\Big(1-\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}\Big)\bigg]\\
&=\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\nabla_{\bm{\theta} }\pi_{\bm{\theta} }\Big(1-\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}\Big)\bigg]\\
&=\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\pi_{\theta}\cdot\nabla_{\theta}\log\pi_{\theta}\Big(1-\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}\Big)\bigg]\\
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\Big(1-\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}\Big)\bigg]
\end{align}$$

同时根据策略梯度定理求梯度有

$$\begin{align}
\nabla_{\bm{\theta} }\mathcal{L}(\bm{\theta})
&=\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot A_{i,t} }_{\small\text{标准策略梯度} }
\bigg]
-\beta\cdot\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\Big(1-\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}\Big)\bigg]}_{\small\text{新增梯度} }\\
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\Big(A_{i,t} -\beta\Big(1-\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}\Big)\Big)
\bigg]
\end{align}$$

2.2.1.2、K2策略梯度截断情形

如果是K2 = $\displaystyle \frac{1}{2}\log^2\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}$ 则有梯度:

$$\begin{align}
\nabla_{\bm{\theta} }\mathcal{L}(\bm{\theta})
&=\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot A_{i,t} }_{\small\text{标准策略梯度} }
\bigg]
-\beta\cdot\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot\log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}\bigg]}_{\small\text{新增梯度} }\\
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\Big(A_{i,t} -\beta\log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}\Big)
\bigg]
\end{align}$$

2.2.1.3、K1策略梯度截断情形

如果是K1 = $\displaystyle \log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}$ 则有梯度:

$$\begin{align}
\nabla_{\bm{\theta} }\mathcal{L}(\bm{\theta})
&=\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot A_{i,t} }_{\small\text{标准策略梯度} }
\bigg]
-\beta\cdot\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot1\bigg]}_{\small\text{新增梯度} }\\
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot A_{i,t}
\bigg]
\end{align}$$

这里啰嗦一下新增梯度项为何为零:

$$\begin{align}
\mathbb{E}_{\bm{o} \sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot1\bigg]
&=\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\pi_{\bm{\theta} }\cdot \frac{\nabla_{\bm{\theta} }\pi_{\bm{\theta} }}{\pi_{\bm{\theta} }}
=\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\sum_{o_{i,t} \in \mathcal{Vocab} }\nabla_{\bm{\theta} }\pi_{\bm{\theta} }\\
&=\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\nabla_{\bm{\theta} }\bigg[\sum_{o_{i,t} \in \mathcal{Vocab} }\pi_{\bm{\theta} }\big]
=\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\nabla_{\bm{\theta} }\big[1\big]
=0
\end{align}$$

2.2.1.4、总结

三种估计器在梯度截断下的统一形式设 $\hat{\mathrm{KL} }_k$ 为第 $k$ 种估计器,施加 $\mathrm{SG}(\pi_\theta)$ 后,KL 惩罚项的梯度都可写成「标准策略梯度 + 新增梯度项」的形式:

$$
\nabla_\theta \mathcal{L} = \mathbb{E}_{o\sim\pi_\theta}\Big[\nabla_\theta\log\pi_\theta \cdot \big(A_{i,t} - \beta \cdot g_k\big)\Big]
$$

其中 $g_k$ 是各估计器对应的「修正信号」,决定了 KL 惩罚到底把策略往 $\pi_{ref}$ 拉、还是根本不拉。

针对K1、K2、K3 这三种 KL 散度估计器,以下是对其核心差异进行的详细对比阐述

一、K1 估计器(对数概率比)

K1 的形式为 $\log(\pi_\theta / \pi_{ref})$。在理论上,它是 KL 散度的无偏估计量,但这是它唯一的优点。它的致命缺陷在于取值可正可负,无法保证非负性,且单点估计的方差极大。在梯度截断操作中,K1 的新增项 $g_k$ 恒等于常数 1,这导致其新增梯度的期望值为零($\mathbb{E}[\nabla\log\pi_\theta \cdot 1]=0$)。这意味着 KL 惩罚项在期望层面被彻底抵消,约束作用完全失效,KL 项形同虚设。虽然其梯度幅值有界(恒为 1),但符号剧烈波动,数值稳定性很差。在训练中,模型极易陷入 Reward Hacking,因此极不推荐单独作为惩罚项使用。

二、K2 估计器(对数概率比平方的一半)

K2 的形式为 $\frac{1}{2}\log^2(\pi_{ref} / \pi_\theta)$。它是一个有偏估计量,但在二阶近似下偏差较小。其最大优势在于恒为非负值,且梯度截断后新增项 $g_k = \log(\pi_\theta / \pi_{ref})$,期望值不为零,因此能持续产生有效的约束梯度。该梯度方向具有对称性,始终将当前策略 $\pi_\theta$ 拉向参考策略 $\pi_{ref}$,且梯度幅值随对数比增长,整体有界,方差较低,数值和训练稳定性都较好。不过,它的约束力度相对偏弱。因此,K2 适用于偏好稳定训练、且对约束强度要求不高的场景。

三、K3 估计器(概率比减对数概率比减一)

K3 的形式为 $\pi_{ref}/\pi_\theta - \log(\pi_{ref}/\pi_\theta) - 1$。与 K1 一样,它也是 KL 散度的无偏估计量,同时基于凸函数性质 $x-1-\log x \ge 0$,天然恒为非负。其梯度截断后的新增项 $g_k = 1 - \pi_{ref}/\pi_\theta$,期望值同样不为零。在梯度方向上,K3 表现出极强的非对称性:当 $\pi_\theta$ 远小于 $\pi_{ref}$(即当前策略在参考策略高概率区域概率极低)时,梯度会因包含 $\pi_{ref}/\pi_\theta$ 项而爆炸式放大,对长尾分布极端敏感,导致梯度无界。不过,得益于控制变量法的思想,其估计方差较低;但在极端 Token 上数值稳定性欠佳,容易引发梯度爆炸。K3 的约束力最强,但长尾噪声也最大。因此,它适用于需要施加极强约束、且必须配合额外无偏修正技术(如梯度裁剪或重要性采样修正)来驯服极端值的场景。

四、总结性对比

归纳来看,K1 因期望归零而完全失效,是三者中最不可靠的选择;K2 走稳健路线,以轻微偏差换取低方差和稳定约束,适合常规弱约束需求;K3 则走激进强约束路线,虽无偏且非负,但需警惕其无界梯度在长尾分布下引爆训练过程。实际应用中,通常会在 K2 的稳定性和 K3 的强效性之间做权衡,并配合相应的梯度裁剪或偏差修正策略。

2.2.2、期望概率梯度不截断情形
2.2.2.1、K3策略梯度不截断情形

对于K3有

$$\begin{align}
&\nabla_{\bm{\theta} }\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\pi_{\bm{\theta} }\cdot\big(\frac{\pi_{\bm{\theta}_\textit{ref} }}{\pi_{\bm{\theta} }}- \log \frac{\pi_{\bm{\theta}_\textit{ref} }}{\pi_{\bm{\theta} }}-1\big)\bigg]\\
&=\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[
\pi_{\bm{\theta} }\cdot\nabla_{\bm{\theta} }\big(\frac{\pi_{\bm{\theta}_\textit{ref} }}{\pi_{\bm{\theta} }}- \log \frac{\pi_{\bm{\theta}_\textit{ref} }}{\pi_{\bm{\theta} }}-1\big)
+\nabla_{\bm{\theta} }\pi_{\bm{\theta} }\cdot\big(\frac{\pi_{\bm{\theta}_\textit{ref} }}{\pi_{\bm{\theta} }}- \log \frac{\pi_{\bm{\theta}_\textit{ref} }}{\pi_{\bm{\theta} }}-1\big)
\bigg]\\
&=\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\pi_{\bm{\theta} }\cdot \frac{\nabla_{\bm{\theta} }\pi_{\bm{\theta} }}{\pi_{\bm{\theta} }}\Big(1-\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}\Big)
+\nabla_{\bm{\theta} }\pi_{\bm{\theta} }\cdot\big(\frac{\pi_{\bm{\theta}_\textit{ref} }}{\pi_{\bm{\theta} }}- \log \frac{\pi_{\bm{\theta}_\textit{ref} }}{\pi_{\bm{\theta} }}-1\big)
\bigg]\\
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot\log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}\bigg]
\end{align}$$

同时根据策略梯度定理求梯度有

$$\begin{align}
\nabla_{\bm{\theta} }\mathcal{L}(\bm{\theta})
&=\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot A_{i,t} }_{\small\text{标准策略梯度} }
\bigg]
-\beta\cdot\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot\log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}\bigg]}_{\small\text{新增梯度} }\\
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\Big(A_{i,t} -\beta\log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}\Big)
\bigg]
\end{align}$$

K3的梯度不截断和K2梯度截断版本结果是一样的。考虑到 $\nabla_{\bm{\theta} }\pi_{\bm{\theta} }$的巨大计算量,K2梯度截断版本显然是要划算的。

2.2.2.2、K2策略梯度不截断情形

再来考察K2梯度不截断版本
$$\begin{align}
&\nabla_{\bm{\theta} }\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\pi_{\bm{\theta} }\cdot\bigg(\frac{1}{2}\log^2\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}\bigg)\bigg]\\
&=\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[
\pi_{\bm{\theta} }\cdot\nabla_{\bm{\theta} }\bigg(\frac{1}{2}\log^2\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}\bigg)
+\nabla_{\bm{\theta} }\pi_{\bm{\theta} }\cdot\bigg(\frac{1}{2}\log^2\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}\bigg)
\bigg]\\
&=\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[
-\pi_{\bm{\theta} }\frac{\nabla_{\bm{\theta} }\pi_{\bm{\theta} }}{\pi_{\bm{\theta} }}
\log\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}
+\nabla_{\bm{\theta} }\pi_{\bm{\theta} }\cdot\bigg(\frac{1}{2}\log^2\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}\bigg)
\bigg]\\
&=\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[
-\pi_{\bm{\theta} }\frac{\nabla_{\bm{\theta} }\pi_{\bm{\theta} }}{\pi_{\bm{\theta} }}
\log\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}
+\nabla_{\bm{\theta} }\pi_{\bm{\theta} }\cdot\bigg(\frac{1}{2}\log^2\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }}\bigg)
\bigg]\\
&=\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\nabla_{\bm{\theta} } \pi_{\bm{\theta} } \cdot \bigg( \frac{1}{2}\log^2\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }} - \log\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }} \bigg)\\
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[ \nabla_{\bm{\theta} } \log \pi_{\bm{\theta} } \cdot \bigg( \frac{1}{2}\log^2\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }} - \log\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }} \bigg) \bigg]
\end{align}$$

同时根据策略梯度定理有

$$\begin{align}
\nabla_{\bm{\theta} }\mathcal{L}(\bm{\theta})
&=\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot A_{i,t} }_{\small\text{标准策略梯度} }
\bigg]
-\beta\cdot\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} } \log \pi_{\bm{\theta} } \cdot \bigg( \frac{1}{2}\log^2\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }} - \log\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }} \bigg)\bigg]}_{\small\text{新增梯度} }\\
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\Big(A_{i,t} -\beta\log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}\Big)
\bigg]
-\beta\cdot\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} } \log \pi_{\bm{\theta} } \cdot \bigg( \frac{1}{2}\log^2\frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }} \bigg)\bigg]}_{\small\text{第二个惩罚项} }\\
\end{align}$$

K2梯度不截断版本,形成了第二个惩罚项,实际上是双倍惩罚项,这是不合理的。

2.2.2.3、K1策略梯度不截断情形

$$\begin{align}
&\nabla_{\bm{\theta} }\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\pi_{\bm{\theta} }\cdot\log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}\bigg]\\
&=\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[
\pi_{\bm{\theta} }\cdot\frac{\nabla_{\bm{\theta} }\pi_{\bm{\theta} }}{\pi_{\bm{\theta} }}
+\nabla_{\bm{\theta} }\pi_{\bm{\theta} }\cdot\log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}
\bigg]\\
&=\mathbb{E}_{q\sim \rho}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\sum_{o_{i,t} \in \mathcal{Vocab} }
\bigg[\nabla_{\bm{\theta} }\pi_{\bm{\theta} }\cdot\bigg(\log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}+1\bigg)
\bigg]\\
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} } \log \pi_{\bm{\theta} } \cdot\bigg(\log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}+1\bigg)
\bigg]\\
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} } \log \pi_{\bm{\theta} } \cdot\log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}
\bigg]
\end{align}$$

其中 $\displaystyle \mathbb{E}_{\bm{o} \sim \pi_{\bm{\theta} }}\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot1\bigg]=0$

同时根据策略梯度定理有

$$\begin{align}
\nabla_{\bm{\theta} }\mathcal{L}(\bm{\theta})
&=\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot A_{i,t} }_{\small\text{标准策略梯度} }
\bigg]
-\beta\cdot\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}
\bigg[\nabla_{\bm{\theta} } \log \pi_{\bm{\theta} } \cdot\log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}
\bigg]}_{\small\text{新增梯度} }\\
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\Big(A_{i,t} -\beta\log\frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}\Big)
\bigg]
\end{align}$$

这样就有K3策略梯度不截断、K2策略梯度截断、K1策略梯度不截断,它们的效果是一样的。但是 $\displaystyle \mathbb{E}_{\bm{o}\sim\pi_{\bm{\theta} }}\frac{1}{G}\sum_{i=1}^G\frac{1}{\mid\bm{o}_i\mid}\sum_{t=1}^{\mid\bm{o}_i\mid}\bigg[\nabla_{\bm{\theta} }\log\pi_{\bm{\theta} }\cdot1\bigg]=0$ 只在理论期望下成立,在有限采样下会增加方差,因此标准做法是利用期望为 0的性质,直接将其截断丢弃。这样K2策略梯度截断似乎是理论上的完美的估计形式。

三、PPO的KL散度的理论分析

与GRPO不同,PPO的KL散度惩罚是加在奖励上,而PPO优势估计是通过GAE来计算的。

3.1、定义与符号说明

下面逐步推导 PPO 中目标函数对参数 $\theta$ 的梯度。为了书写方便,记 $kl_t$ 为 $t$ 时刻的 KL 散度采样值: $\displaystyle kl_t \triangleq \mathbb{KL}\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big] = \log \frac{\pi_{\bm{\theta} }(o_t\mid q,o_{:t})}{\pi_{\bm{\theta}_\textit{ref} }(o_t\mid q,o_{:t})}$ ,这样有带惩罚的奖励函数:

$$\begin{align}
r_t = \pi_{\bm{\theta}_{\textit{rm} }}(q,o_{:t}) - \beta \cdot kl_t
\end{align}$$

对于优势函数估计, 有:

$$\begin{align}
\begin{cases}
&\hat{A}_t(k)=\delta_t + \gamma\lambda\hat{A}_{t+1}(k-1)\\
&\delta_t = r_t + \gamma v_{\bm{w} }(s_{t+1}) - v_{\bm{w} }(s_t)\\
&r_t =\pi_{\bm{\theta}_{\textit{rm} }}(q,o_{:t})-\beta \mathbb{KL}\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big]\\
&\displaystyle \mathbb{KL}\big[\pi_{\bm{\theta} } \mid\mid\pi_{\bm{\theta}_\textit{ref} }\big] = \log \frac{\pi_{\bm{\theta} }(o_t\mid q,o_{:t})}{\pi_{\bm{\theta}_\textit{ref} }(o_t\mid q,o_{:t})}
\end{cases}
\end{align}$$

对于 TD Error ($\delta_t$),将 $r_t$ 代入 $\delta_t$ 的定义:

$$ \begin{aligned} \delta_t &= r_t + \gamma v_{\bm{w} }(s_{t+1}) - v_{\bm{w} }(s_t) \ &= \left( \pi_{\bm{\theta}_{\textit{rm} }}(q,o_{:t}) - \beta \cdot kl_t \right) + \gamma v_{\bm{w} }(s_{t+1}) - v_{\bm{w} }(s_t) \end{aligned} $$

我们可以将 $\delta_t$ 拆分为“奖励模型部分”和“KL部分”:

$$\begin{align}
\delta_t = \underbrace{\left[\pi_{\bm{\theta}_{\textit{rm} }}(q,o_{:t}) + \gamma v_{\bm{w} }(s_{t+1}) - v_{\bm{w} }(s_t) \right]}_{\delta^{RM}_t} - \beta \cdot kl_t
\end{align}$$

3.2、广义优势估计 ($\hat{A}_t$) 的展开

根据递归定义 $\hat{A}_t(k)=\delta_t + \gamma\lambda\hat{A}_{t+1}(k-1)$,我们可以将其展开为累加形式(假设 $k \to \infty$):

$$\begin{align}
\hat{A}_t = \sum_{l=0}^{\infty} (\gamma \lambda)^l \delta_{t+l}
\end{align}$$

将步骤 1 中拆分的 $\delta_{t+l}$ 代入上式:

$$\begin{align}
\hat{A}_t
&=\sum_{l=0}^{\infty} (\gamma \lambda)^l \left( \delta^{RM}_{t+l} -\beta \cdot kl_{t+l} \right) \
&= \underbrace{\sum_{l=0}^{\infty} (\gamma \lambda)^l \delta^{RM}_{t+l} }_{\hat{A}^{RM}_t}
-\beta \cdot \underbrace{\sum_{l=0}^{\infty} (\gamma \lambda)^l kl_{t+l} }_{\text{记为 } \textit{KL}_t}
\end{align}$$

这里出现了一个关键的新项 $\textit{KL}_t $:

$$\begin{align}
\textit{KL}_t \triangleq \sum_{l=0}^{\infty} (\gamma \lambda)^l kl_{t+l}
\end{align}$$

它是 KL 序列的加权折现和(即基于 KL 计算的 GAE 的一种形式,去除了基线的影响)。因此,实际计算出的优势函数为:

$$\begin{align}
\hat{A}_t = \hat{A}^{RM}_t - \beta \cdot \textit{KL}_t
\end{align}$$

3.3、PPO目标函数与梯度推导

PPO 的优化目标(Surrogate Objective)通常为:

$$\begin{align}
\mathcal{J}(\bm{\theta}) =
\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{\mid\bm{o}\mid}\sum_{t=1}^{\mid\bm{o}\mid}
\bigg[
\frac{\pi_{\bm{\theta} }(o_t \mid q, o_{:t})}{\pi_{\bm{\theta}_{old} }(o_t \mid q, o_{:t})} \hat{A}_t
\bigg]
\end{align}$$

在标准 PPO 实现中,计算梯度时将优势函数 $\hat{A}_t$ 视为常数(即不通过优势函数反向传播到 $r_t$ 和 $kl_t$,这是为了降低方差),因此梯度为:

$$\begin{aligned}
\nabla_\bm{\theta} \mathcal{J}(\bm{\theta})
&\approx
\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{\mid\bm{o}\mid}\sum_{t=1}^{\mid\bm{o}\mid}
\bigg[ \nabla_\theta \log \pi_{\bm{\theta} }(o_t \mid q, o_{:t}) \cdot \mathrm{SG}(\hat{A}_t)
\bigg] \
&=\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{\mid\bm{o}\mid}\sum_{t=1}^{\mid\bm{o}\mid}
\bigg[\nabla_\theta \log \pi_{\bm{\theta} }(o_t \mid q, o_{:t}) \cdot \left( \hat{A}^{RM}_t - \beta \cdot \textit{KL}_t \right)
\bigg]
\end{aligned}$$

最终的梯度形式:

$$\begin{align}
\nabla_\bm{\theta} \mathcal{J}(\bm{\theta})
=\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{\mid\bm{o}\mid}\sum_{t=1}^{\mid\bm{o}\mid}
\bigg[
\nabla_\bm{\theta} \log \pi_{\bm{\theta} } \cdot \hat{A}^{RM}_t
\bigg]}_{\small\text{标准策略梯度} }
-\beta\cdot
\underbrace{\mathbb{E}_{q\sim \rho,\bm{o}\sim \pi_{\bm{\theta} }}
\frac{1}{\mid\bm{o}\mid}\sum_{t=1}^{\mid\bm{o}\mid}
\bigg[
\nabla_\bm{\theta} \log \pi_{\bm{\theta} } \cdot \sum_{l=0}^{\infty} (\gamma \lambda)^l kl_{t+l} }_{\small\text{KL惩罚项} }
\bigg]
\end{align}$$

PPO的KL惩罚项是KL 序列的广义优势/折现和: $\textit{KL}_t = \sum (\gamma \lambda)^l kl_{t+l}$。不仅当前时刻的 KL 会降低优势,未来所有时刻的 KL(折现后)都会降低当前时刻的优势。这使得 KL 惩罚具有了“时序累积”效应,策略会倾向于选择那些不仅当前 KL 小,而且未来也不会导致策略剧烈偏离(KL 大)的路径。

至于 $kl_{t}$是用K1、k2、k3,在 PPO + GAE 的框架下,当我们将 $kl_t$ 嵌入到奖励 $r_t$ 中时,$kl_t$ 在反向传播时是被 detach(停止梯度)的。因此与GRPO中的“K1 的 $+1$ 项”或“K2 的平方项”带来的额外梯度问题,在标准 PPO 中是不存在的。此时,K1、K2、K3 的区别,纯粹转化为它们对 $\textit{KL}_t$的塑形(KL序列加权折现和塑形),进而从数值层面影响优势函数 $\hat{A}_t$ 的大小和方向。以下是具体的差异分析,回顾 $\textit{KL}_t$ 的定义:

$$\textit{KL}_t = \sum_{l=0}^{\infty} (\gamma \lambda)^l kl_{t+l}$$

3.4、KL散度不同估计的对比

3.4.1、采用 K1(标准对数比)

$$\begin{align}
kl_t = \log \frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}
\end{align}$$

  • 数值特性:K1 是一个可正可负的值。当 $\pi_{\bm{\theta} } > \pi_{\bm{\theta}_{ref} }$ 时为正,反之为负。
  • 对 GAE 的影响:$\textit{KL}_t$ 是未来 K1 值的折现和。如果模型在未来几步持续增加某些 token 的概率($kl > 0$),$\textit{KL}_t$ 会变大,从而更强烈地压低 $\hat{A}_t$。
  • 时序行为:惩罚是线性且对称的。它平稳地将策略拉回参考模型,不会因为单步的微小概率波动产生剧烈的数值跳变。这是 PPO/RLHF 中最常用的形式,因为其数值稳定性最好。
3.4.2、采用 K2(平方对数比)

$$\begin{align}
kl_t = \frac{1}{2} \log^2 \frac{\pi_{\bm{\theta} }}{\pi_{\bm{\theta}_{ref} }}
\end{align}$$

  • 数值特性:K2 恒大于等于 0,且对偏离程度有平方级的放大效应。
  • 对 GAE 的影响:如果模型在序列的后续阶段($t+l$ 较大时)出现了较大的偏离,$kl_{t+l}$ 会变得极大。由于 GAE 的折现求和机制,这个极大的平方惩罚会反噬到当前步 $t$ 的优势函数 $\hat{A}_t$ 上。
  • 时序行为:这会导致一种“后期崩塌引发前期停滞”的现象。即使当前步 $t$ 的动作很好(RM 给分高),但如果模型预测这条路走下去最终会导致概率剧烈偏离,K2 会提前在当前步施加巨量的负向优势,导致模型过度保守,甚至不敢探索长序列。因此,K2 在 PPO 的 GAE 框架下通常是不推荐的,极易引发训练崩溃或模式坍塌。
3.4.3、采用 K3(逆向 KL 无偏估计)

$$\begin{align}
kl_t = \frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }} - \log \frac{\pi_{\bm{\theta}_{ref} }}{\pi_{\bm{\theta} }} - 1
\end{align}$$

  • 数值特性:K3 恒大于等于 0,且它是 $\mathbb{KL}(\pi_{\bm{\theta}_{ref} } \mid\mid \pi_{\bm{\theta} })$ 的无偏估计。它对 $\pi_{\bm{\theta} }$ 趋近于 0(即模型放弃了参考模型本该生成的 token)惩罚极大(因为 $\frac{\pi_{ref} }{\pi_\theta} \to \infty$)。
  • 对 GAE 的影响:在时序累积中,如果策略在生成序列的某一步试图“抹杀”参考模型的高频词(即 $\pi_{\bm{\theta} } \to 0$),K3 的数值会爆炸。通过 GAE 传递,当前步及之前所有步的优势函数都会遭遇毁灭性的负惩罚。
  • 时序行为:K3 的主要作用是防止模式坍塌(Mode Collapse)。在长文本生成中,它能强有力地逼迫策略保留参考模型的多样性,不要过度集中在少数几个 token 上。但由于其数值无上界,在 PPO 中使用 K3 必须配合极小的 $\beta$ 或对 $kl_t$ 进行严格的 Clip 截断。

PPO 不通过 $\hat{A}_t$ 反向传播梯度的,所以K1/K2/K3 的选择从“求导法则问题”变成了“数值缩放问题”。在 GAE 的时序折现求和下,任何无上界或增长过快的惩罚(如 K2、K3)都会因为时序累积而放大方差。这就是为什么在标准 PPO 算法中,大家几乎默认使用 K1(对数概率比) 作为 KL 惩罚的数值计算方式。

四、评述

4.1、GRPO与PPO的KL散度惩罚的根本区别

经过第二章与第三章的推导,可以给出一个明确的判断:GRPO与PPO在KL散度惩罚上的根本区别,不在于”加不加”,而在于”加在哪、用什么估计、梯度如何流动”。GRPO把KL惩罚当作一个独立的正则项贴在策略梯度目标之外,符合经典带约束优化的拉格朗日形式;而PPO则把KL惩罚嵌入到逐token的奖励中,再经由GAE折现求和渗透进整个优势函数。前者是”空间上的加法”,后者是”时序上的卷积”。

这一差异直接决定了两者在梯度层面的拓扑结构:

对比维度 GRPO PPO
KL惩罚位置 loss中独立正则项,与策略梯度并列 嵌入reward,经GAE折现渗透进advantage
常用估计器 K3($\pi_{ref}/\pi_\theta-\log(\pi_{ref}/\pi_\theta)-1$),无偏非负 K1($\log(\pi_\theta/\pi_{ref})$),可正可负但数值稳定
反向传播 KL项参与梯度,需考虑是否stop-gradient及IS修正 KL项在reward中detach,不回传梯度,仅作数值塑形
时序影响 逐token独立惩罚,无时序累积 GAE折现求和,当前步惩罚受未来所有步KL影响($\textit{KL}_t=\sum(\gamma\lambda)^l kl_{t+l}$ )
稳定性来源 估计器非负性+IS无偏修正+组内归一化 KL时序平滑+detach降低方差+Critic基线

4.2、GRPO中三种估计器的权衡

第二章的推导已经揭示了一个关键事实:在GRPO框架下,估计器的选择不仅是一个”方差-偏差”的数值问题,更是一个”梯度是否生效”的优化问题。
K1在梯度截断下新增项期望为零,KL惩罚形同虚设;K2梯度截断后与K3梯度不截断等价,是”理论上的完美形式”;K3梯度不截断同样与K2梯度截断等价,但需承担$\nabla_\theta\pi_\theta$的额外计算开销。这意味着GRPO中”K3+梯度截断”并非最优,”K2+梯度截断”才是计算与理论的双优解。

然而DeepSeek在GRPO原始实现中选择了K3而非K2,这背后有一个超越纯数学的考量:K3的非对称性——对 $\pi_\theta\to0$ 的爆炸式惩罚——恰好对应了防止模式坍塌的刚性需求。在数学推理这类长序列生成任务中,模型一旦放弃参考模型的高频token,K3会立即给出无界的负反馈,这种”长尾刚性”是K2的对称平方惩罚无法提供的。

但K3的刚性也是其阿喀琉斯之踵:当$\pi_\theta\ll\pi_{ref}$时,$\pi_{ref}/\pi_\theta\to\infty$ 会导致梯度爆炸。DeepSeek-V3.2技术报告在”Scaling GRPO”章节中明确引入Unbiased KL Estimate,即在K3前乘以重要性采样比率$\pi_\theta/\pi_{old}$,正是为了驯服这种长尾噪声。这一修正的本质,是把采样分布从$\pi_{old}$ 校正回 $\pi_\theta$ ,使KL估计在期望意义下严格无偏。

4.3、PPO中KL嵌入奖励的优劣

PPO将KL嵌入reward的做法,初看”不自然”(如1.2节所述),但深入分析后会发现它有其独特的工程哲学。

优势在于时序平滑与方差控制。GAE的折现求和机制使得KL惩罚具有”前瞻性”:当前步的优势不仅被当前KL压低,还被未来所有步的KL(折现后)压低。这迫使策略选择那些”不仅当前不偏离,未来也不会偏离”的路径,本质上是一种隐式的长序列约束。同时,由于KL在reward中detach,不参与梯度回传,避免了K1/K2/K3在求导法则下的额外梯度项问题,三种估计器的差异纯粹转化为对$\textit{KL}_t$的数值塑形。

劣势在于时序累积会放大方差。如3.4节分析,任何无上界或增长过快的惩罚(K2的平方项、K3的概率比项)都会因GAE的折现求和而把单步的极端值反噬到当前步优势上,引发”后期崩塌引发前期停滞”。这正是标准PPO几乎默认使用K1的原因——K1的线性对称性使其在时序累积下保持数值稳定。

但K1在PPO中也并非完美。由于K1可正可负,当$\pi_\theta<\pi_{ref}$时KL为负,反而增加reward,这在某些token上会弱化约束。Mila实验室(Bengio团队)2025年的论文《A Comedy of Estimators》[^4]进一步指出,”K1放reward”是唯一能产生稳定且无偏梯度估计的配置,而流行的”K3放loss”虽然稳定但梯度有偏,实验显示回归K1-in-reward可带来近20%的OOD性能跃升。这一结论与本文的推导形成互证:PPO的KL-in-reward设计在无偏性上具有理论优势。

4.4、对reward hacking的控制效果

KL散度惩罚的根本目的,是抑制奖励模型的过度优化(reward hacking)。两种框架在这方面的控制机制有本质差异:

GRPO的控制是”刚性截断式”。K3的非对称性使得模型一旦在参考模型高频token上概率骤降,立即遭遇无界惩罚,这种刚性截断能有效防止模型通过”钻空子”获得高reward。但刚性也意味着脆弱——若无IS修正,极端token的梯度噪声会破坏训练动态。DeepSeek-V3.2的实践表明,在数学推理任务中甚至可以采用”零KL惩罚”($\beta\approx0$)策略,允许更激进的策略更新,这侧面说明当reward信号足够可靠(如规则奖励)时,KL约束的必要性会下降。

PPO的控制是”柔性渗透式”。K1的线性对称性使得惩罚温和而持续,通过GAE的时序累积形成”软约束”。这种柔性控制对reward hacking的抑制更为渐进,但也更容易被reward signal的持续高强度信号所压倒——当reward model给分足够高时,线性的KL惩罚可能不足以拉回策略。实践中常需配合reward normalization、response length监控、perplexity监控等辅助手段来及时发现reward hacking。

4.5、实践建议

综合前文分析,给出以下实践层面的建议:

1.PPO场景:默认K1-in-reward,配合GAE。 这是数值稳定性最优的配置。K1的线性对称性在GAE时序累积下不会放大方差,detach机制避免了求导法则的额外梯度问题。若需更强约束,可适当增大$\beta$而非更换估计器。

2.GRPO场景:默认K3+梯度截断+IS修正。 K3的非负性与非对称性提供了强约束,梯度截断避免了$\nabla_\theta\pi_\theta$的额外计算,IS修正($\pi_\theta/\pi_{old}$前缀)保证了无偏性。这是DeepSeek-V3.2验证过的配置。若计算资源紧张或训练不稳定,可退回”K2+梯度截断”,其在理论上与K3梯度不截断等价但计算更省。

3.估计器选择的本质是偏差-方差-刚性三维权衡。 K1无偏高方差低刚性,K2有偏低方差中刚性弱,K3无偏低方差低刚性强。选择取决于任务对约束刚性的需求:通用对话用K1/K2,数学推理用K3,且在reward信号可靠时可弱化甚至关闭KL。

4.大规模训练的工程要点。 DeepSeek-V3.2的[^3]经验表明,除估计器选择外,还需配合Off-Policy序列掩码(过滤偏离过大的负样本)、Keep Routing(MoE路由一致性)、Keep Sampling Mask(采样空间一致性)等工程手段,才能在大规模RL训练中保持稳定。这些措施的本质,都是在弥补”采样分布$\pi_{old}$与目标分布$\pi_\theta$不一致”带来的系统性偏差。
5.趋势判断:从”KL-in-loss”向”KL-in-reward”的回归。 Bengio团队的最新研究与本文的推导共同指向一个结论:朴素K1放reward的无偏性优势,在追求理论严谨性的场景下值得回归。但GRPO框架下K3+IS修正的工程实效也已得到DeepSeek-V3.2的验证。两者的选择并非对错之分,而是”理论无偏”与”工程稳定”之间的权衡——这正是大模型强化学习从经验工程走向理论成熟过程中必然经历的张力。

4.6、最后的陈述

Agentic RL 系统的三大挑战探:探索空间不塌缩、分布偏移可控、信号非退化实际上对强化学习提供了更高的要求,在后续人们对GRPO的改进和RL算法优化中,提出了远比KL惩罚项更加精细的控制方法。

1.探索空间不塌缩:从被动约束到主动熵正则

KL散度惩罚本质上是一种“被动约束”,它通过拉扯策略向参考模型靠拢来防止极端偏离,但这同时也会不可避免地压制模型的探索意愿,导致策略过早收敛到少数高回报路径上(模式坍塌)。在Agentic RL中,智能体需要在庞大的动作空间(如多步推理、工具调用组合)中寻找长链路最优解,过早的坍缩是致命的。

为此,现代算法引入了更加主动的机制,如熵正则化,直接在目标函数中鼓励策略分布的熵,使模型在获得高奖励的同时保持对低概率但潜在有价值的动作的探索;或者通过种群多样性奖励和Curiosity-driven Intrinsic Reward(好奇心驱动的内在奖励),对访问新状态或产生差异化输出给予额外激励。这些方法比静态的KL惩罚更能动态地维持探索与利用的平衡。

2.分布偏移可控:从单步截断到多步信任域

在单轮文本生成中,基于重要性采样的PPO或GRPO通过Clip机制较好地控制了分布偏移。但在Agentic RL中,轨迹长度动辄数十步,每一步的微小分布偏移会在时间维度上指数级累积,导致 $\pi_{\theta}$ 与 $\pi_{old}$ 之间的比值爆炸或趋零。

单纯的KL惩罚无法处理这种多步累积的协变量偏移。更精细的控制方法转向了严格的信任域更新或多步重要性采样截断。例如,DAPO (Decoupled clip and dynamic sAmpling Policy Optimization) 等算法通过动态调整采样策略和截断阈值,过滤掉那些分布偏移过大的负样本,确保策略更新始终在可靠的信任域内进行。此外,结合在线回放缓冲池的精细重用策略,也使得在保持样本效率的同时,将分布偏移控制在一个可计算的界限内。

3.信号非退化:从结果奖励到过程奖励

在长轨迹任务中,奖励信号极其稀疏,往往只在轨迹结束时给出。此时,如果只依赖结果奖励模型(ORM),优势函数的估计方差极大,很容易发生信号退化——策略梯度被噪声淹没。而传统的KL惩罚嵌入在奖励中时,可能会因为其占比较大,直接掩盖掉真实的任务奖励信号。

为解决信号退化,社区全面转向了过程奖励模型(PRM, Process Reward Model)。PRM对推理的每一步都提供密集的奖励信号,使得优势函数能够更精确地归因到具体的动作上。此外,为了进一步降低方差并防止信号退化,现代算法还采用了基于价值函数的方差缩减技术、分层强化学习(HRL)的目标分解,以及更精细的GAE参数自适应调整。

五、结语

KL散度作为RLHF时代的基石,成功地将生成式语言模型驯化为了符合人类偏好的对话助手。然而,面对Agentic RL的复杂环境,单一的KL惩罚已显得力不从心。从KL散度到多维度的熵正则、信任域控制和过程奖励,我们正在见证大模型强化学习从“粗放的约束工程”向“精细的动力学控制”演进。未来的RL系统,必将是一个融合了动态约束、自适应分布校准和多粒度信号反馈的复杂动力系统。

参考文献

[^3]: DeepSeek-AI, Liu, A., Mei, A., Lin, B., Xue, B., Wang, B., et al. (2025, December 2). DeepSeek-V3.2: pushing the frontier of open large language models. arXiv. https://doi.org/10.48550/arXiv.2512.02556
[^4]: Shah, V., Obando-Ceron, J., Jain, V., Bartoldson, B., Kailkhura, B., Mittal, S., et al. (2026, March 18). A comedy of estimators: on KL regularization in RL training of LLMs. arXiv. https://doi.org/10.48550/arXiv.2512.21852
[^5]: Shao, Z., Wang, P., Zhu, Q., Xu, R., Song, J., Bi, X., et al. (2024, April 27). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv. https://doi.org/10.48550/arXiv.2402.03300


版权声明
由引线小白创作并维护的柠檬CC博客采用署名-非商业-禁止演绎4.0国际许可证。
本文首发于柠檬CC [ https://www.limoncc.com ] , 版权所有、侵权必究。
本文永久链接https://www.limoncc.com/post/9e2e995289848c87/
如果您需要引用本文,请参考:
引线小白. (Jun. 28, 2026). 《大语言模型研究17——强化学习中KL散度惩罚问题》[Blog post]. Retrieved from https://www.limoncc.com/post/9e2e995289848c87
@online{limoncc-9e2e995289848c87,
title={大语言模型研究17——强化学习中KL散度惩罚问题},
author={引线小白},
year={2026},
month={Jun},
date={28},
url={\url{https://www.limoncc.com/post/9e2e995289848c87}},
}

'