大语言模型研究12——均方根层归一化(RMSNorm)

作者: 引线小白-本文永久链接:https://www.limoncc.com/post/459cffa89d9d94ff/
知识共享许可协议: 本博客采用署名-非商业-禁止演绎4.0国际许可证

1. 引言

在大模型架构设计中,归一化层看似不起眼,却直接影响训练的稳定性、收敛速度与最终模型质量。自 Transformer 诞生起,层归一化(LayerNorm) 一直是标准配置。然而,从 LLaMA 开始,RMSNorm 逐步取代 LayerNorm 成为事实上的行业标准。其核心理念来自张量与 Sennrich 的开创性工作《Root Mean Square Layer Normalization》,系统论证了“减均值”步骤的冗余性,并提出仅依赖重缩放便能实现同等甚至更优的性能。

核心思想:$\displaystyle y = \frac{x}{RMS(x)} * γ$,舍弃 $\displaystyle x - \mu$,只用均方根做归一化。

为什么这样“偷工减料”反而更好?下面我们从定义开始,逐层深入其背后的数学与工程智慧。

2. 数学定义对比

对于一个特征维度为 $d$ 的输入向量 $\displaystyle \bm{x}=[x_1,\cdots,x_d]^\T$,LayerNorm 与 RMSNorm 的前向计算对比如下。

$\displaystyle\bm{y}=\frac{\bm{x}-\mu}{\sqrt{\sigma^2+\varepsilon}}*\gamma+\beta$

其中 $\gamma$ 和 $\beta$ 为可学习的缩放与平移参数, $\varepsilon$ 为小常数(如 1e-5)用于数值稳定。

可以看到,RMSNorm[^1] 在数学上删减了三个操作:计算均值 $\mu$、广播减法 $\bm{x}-\mu$、以及可选的偏移参数 $\beta$。这些删减看似微小,但在大模型层层堆叠时,累积收益极为可观。

3. 主要优势

3.1 计算效率:训练时间可缩短 7%~64%

减少一次跨维度求和与广播减法,在 GPU 上减少了一次归约(reduce)操作。对于较深的网络,这个开销被逐层放大,实测在多种模型上训练时间可减少 7% 至 64%。注意,在现代 GPU 上,全局均值的计算往往成为内存带宽瓶颈,RMSNorm 省去该步骤后,并行效率更高。

3.2 显存与训练稳定性

LayerNorm 在反向传播时需要保存均值 $\mu$ 作为中间变量,RMSNorm 仅需保存均方根 $\mathrm{RMS}(\bm{x})$ 或平方和,显存占用更小。同时,简化的操作避免了因均值漂移引起的数值不稳定,深层网络训练中梯度范数更平稳。

3.3 “减均值”被证明冗余

理论分析与大量实验表明:在训练过程中,大模型的隐藏表示会自然变得与全 1 向量 $\bm{1}$几乎正交。这等价于均值 $\mu=0$,因此减去均值这一步近乎在减去零,纯属多余。下一节将从几何和梯度视角给出严格解释。

3.4 性能不减反增

虽然删减了一个操作,RMSNorm 学到的隐藏表示分布与 LayerNorm 高度相似,在多项语言建模、翻译等任务中性能持平或略有提升。这也是它能被大模型团队放心采纳的关键。

个人评述:工程上,“快而不差”的组件总能迅速铺开。RMSNorm 不仅更快,而且数学上更干净——这一特性使其成为新一代架构的默认选择。

4. 重缩放不变性与隐式学习率适应

RMSNorm 的深层优势在于它赋予了网络两种优雅的性质:重缩放不变性隐式学习率适应,二者共同保证了训练过程的鲁棒性。

4.1 重缩放不变性的证明

重缩放不变性是指:若对输入 $\bm{x}$ 或权重矩阵 $\bm{W}$ 乘以一个正常数 $\alpha$,RMSNorm 的归一化输出保持不变。

定理 1(输入缩放不变性) 对于任意 $\alpha > 0$,令 $\bm{x}’ = \alpha \bm{x}$,则

$$\begin{align}
\frac{x’_i}{\text{RMS}(x’)} = \frac{x_i}{\text{RMS}(x)}
\end{align}$$

证明

$$\begin{align}
\mathrm{RMS}(\alpha\bm{x}) = \sqrt{\frac{1}{d}\sum_i (\alpha x_i)^2} = |\alpha| \,\mathrm{RMS}(x)
\end{align}$$

代入得

$$\begin{align}
\frac{\alpha x_i}{\alpha\,\text{RMS}(x)} = \frac{x_i}{\text{RMS}(x)}
\end{align}$$

同理,对权重矩阵整体缩放 $\bm{W}’=\alpha \bm{W}$ 由于 $\bm{h}’=\alpha \bm{W}\bm{x}$,均方根变为 $\alpha \mathrm{RMS}(\bm{W}\bm{x})$,归一化输出也不变。这一性质使前向传播在参数幅度变化时保持稳定,防止输出范数异常波动。

4.2 隐式学习率适应机制

缩放不变性不仅影响前向,更通过反向传播实现了隐式的学习率自适应。考虑线性层 + RMSNorm 的简单组合:

$$\begin{align}
\bm{h} = \bm{W}\bm{x},\quad \bm{\hat{h}} = \frac{\bm{h}}{\mathrm{RMS}(\bm{h})},\quad \ell = L(\bm{\hat{h}})
\end{align}$$
当权重缩放 $\bm{W}\to \alpha\bm{W}$时,梯度 $\displaystyle \frac{\partial \ell}{\partial \bm{W}}$ 会相应地缩放 $\displaystyle \frac{1}{\alpha}$。具体来说:

$$\begin{align}
\frac{\partial \ell}{\partial (\alpha \bm{W})} = \frac{1}{\alpha}\frac{\partial \ell}{\partial \bm{W}}
\end{align}$$

定义参数的相对更新幅度为 $\frac{|\Delta \bm{W}|}{|\bm{W}|}$,它决定了参数在空间中实际移动的相对距离,这等价于“有效学习率”的作用。
1. SGD 优化器下的分析
在 SGD 更新中,参数更新量为 $\Delta \bm{W} = -\eta \frac{\partial \ell}{\partial \bm{W}}$。若权重缩放 $\alpha$ 倍,更新量变为 $\Delta (\alpha\bm{W}) = -\eta \frac{1}{\alpha}\frac{\partial \ell}{\partial \bm{W}}$。此时相对更新幅度为:
$$
\frac{|\Delta (\alpha\bm{W})|}{|\alpha\bm{W}|} = \frac{1}{\alpha^2} \frac{|\Delta \bm{W}|}{|\bm{W}|}
$$
即有效学习率等比于 $\frac{\eta}{\alpha^2}$。这意味着权重范数的变动会引起有效学习率的平方级变化。

  • 权重范数变大 → 有效学习率自动变小,抑制梯度爆炸;
  • 权重范数变小 → 有效学习率自动变大,加速逃离平坦区。

2. Adam 优化器下的分析

大模型通常采用 Adam 优化器。Adam 的核心在于引入了梯度的二阶矩(历史梯度平方的指数移动平均)进行逐元素归一化。简记梯度 $\displaystyle \bm{g} = \frac{\partial \ell}{\partial \bm{W}}$,其更新规则为:

$$\begin{align}
\bm{m}_t = \beta_1 \bm{m}_{t-1} + (1-\beta_1)\bm{g}, \quad \bm{v}_t = \beta_2 \bm{v}_{t-1} + (1-\beta_2)\bm{g}^2, \quad \Delta \bm{W} = -\eta \frac{\bm{m}_t}{\sqrt{\bm{v}_t} + \epsilon}
\end{align}$$

当权重缩放 $\bm{W}\to \alpha\bm{W}$ 时,梯度缩放 $\bm{g}\to \frac{1}{\alpha}\bm{g}$。由于一阶矩 $\bm{m}$ 和二阶矩 $\bm{v}$ 均为梯度的线性组合,它们也会相应缩放:$\bm{m}\to \frac{1}{\alpha}\bm{m}$,$\bm{v}\to \frac{1}{\alpha^2}\bm{v}$。
代入 Adam 的更新公式,在 $\sqrt{\bm{v}} \gg \epsilon$ 的正常训练阶段,更新量变为:
$$
\Delta (\alpha\bm{W}) = -\eta \frac{\frac{1}{\alpha}\bm{m}}{\sqrt{\frac{1}{\alpha^2}\bm{v}} + \epsilon} \approx -\eta \frac{\frac{1}{\alpha}\bm{m}}{\frac{1}{\alpha}\sqrt{\bm{v}}} = -\eta \frac{\bm{m}}{\sqrt{\bm{v}}} = \Delta \bm{W}
$$
这意味着 Adam 的更新量 $\Delta \bm{W}$ 对权重的缩放是不变的! 然而,由于分母(参数本身)变大了,其相对更新幅度变为:
$$
\frac{|\Delta (\alpha\bm{W})|}{|\alpha\bm{W}|} = \frac{1}{\alpha} \frac{|\Delta \bm{W}|}{|\bm{W}|}
$$
即 Adam 下的有效学习率等比于 $\displaystyle \frac{\eta}{\alpha}$。

SGD 与 Adam 的对比与意义

  • SGD:有效学习率 $\propto \frac{1}{\alpha^2}$(平方反比),适应过于激进,权重稍大就可能陷入梯度停滞,权重稍小则易引发爆炸。
  • Adam:有效学习率 $\propto \frac{1}{\alpha}$(线性反比),Adam 的逐元素梯度归一化(SignSGD 效应)抵消了梯度幅度 $1/\alpha$ 的变化,仅保留了参数尺度 $\alpha$ 带来的相对变化,使得隐式适应更加温和精准。

无论哪种优化器,RMSNorm 都赋予了网络天然的鲁棒性:

  • 权重范数变大 → 有效学习率自动变小,抑制梯度爆炸;
  • 权重范数变小 → 有效学习率自动变大,加速逃离平坦区。

无需手动调整学习率,训练过程对参数尺度天然鲁棒。这就是 “隐式学习率适应” 的实质。而 Adam 优化器的引入,将这种适应从“剧烈的平方级”平滑到了“温和的线性级”,这是深度神经网络结合 RMSNorm 与 Adam 能够极其稳定训练的底层数学原因。

个人评述:重缩放不变性与隐式学习率适应是一体两面:前向保证输出稳定,反向则动态调整更新幅度。在 Adam 的加持下,这种自适应变得更为平滑,避免了 SGD 下平方级波动带来的训练不稳定。这是 RMSNorm + Adam 组合能够稳定训练超大模型的关键数学支撑。

5. 梯度反向传播的严谨推导

为了看清 RMSNorm 在反向传播中的数值行为,我们给出完整的梯度推导。定义:
$$\begin{align}
r = \text{RMS}(\bm{x}) = \sqrt{\frac{1}{d}\sum_{k=1}^d x_k^2 + \epsilon}
\end{align}$$

另外定义

$$\begin{align}
\hat{x}_i = \frac{x_i}{r},\quad y_i = \hat{x}_i \cdot \gamma_i
\end{align}$$

损失 $\ell$ 对输入 $x_i$ 的梯度由两条路径贡献:直接路径与通过 r 的全局路径。

经过链式法则与合并,最终梯度为:

$$\begin{align}
\frac{\partial \ell}{\partial x_i} = \frac{\gamma_i}{r}\frac{\partial \ell}{\partial y_i} - \frac{x_i}{d \cdot r^2}\sum_{k=1}^d \left(\frac{\partial \ell}{\partial y_k} \cdot \frac{x_k \gamma_k}{r}\right)
\end{align}$$

若记 $\displaystyle \delta_k = \frac{\partial \ell}{\partial y_k}$ 可简写为:

$$\begin{align}
\frac{\partial \ell}{\partial x_i} = \frac{1}{r}\left( \gamma_i \delta_i - \frac{x_i}{d \cdot r}\sum_{k=1}^d \gamma_k x_k \delta_k \right)
\end{align}$$

该公式对称、简洁,且数值稳定。第一项是各维度的直接缩放梯度,第二项则通过均方根 r 引入全局耦合,实现自然的梯度均衡。

个人评述:实现时可以直接复用前向计算中得到的 r 与 x/r,减少重复计算,这也是 RMSNorm 在框架中易于高效实现的原因。

6. 与 LayerNorm 的几何统一性

尽管 RMSNorm 省略了减均值,但近期几何分析(Gupta et al., 2024)揭示了两者之间深刻的统一性。

LayerNorm 的标准化步骤可被几何分解为三步:

  1. 移除全 $\bm{1}$ 向量方向的分量:计算 $\displaystyle \mu = \frac{1}{d}\bm{1}^\T \bm{x}$,得到 $\bm{x}_\perp = \bm{x}-\mu \bm{1}$ ,即投影到 $\bm{1}$ 的正交补空间。
  2. 在子空间中归一化至单位球面: $\displaystyle \bm{y}=\frac{\bm{x}_\perp}{\sigma} $,其中 $\displaystyle \sigma^2 = \frac{1}{d}|\bm{x}_\perp|^2$。
  3. **缩放至半径 $\displaystyle \sqrt{d}:z = \sqrt{d} \bm{y}$ ,使得最终范数保持为 $ \sqrt{d}$。

而 RMSNorm 则是直接将原始向量 $\bm{x}$ 沿径向缩放到半径为 $ \sqrt{d}$ 的超球面上:

$$\begin{align}
\hat{x} = \sqrt{d} \cdot \frac{x}{|x|}
\end{align}$$

两者之差仅在于是否先执行“沿 \bm{1} 方向的正交投影”这一步。数学上可以写为:

$$\begin{align}
\mathrm{LayerNorm}(\bm{x}) = \mathrm{RMSNorm}(\bm{x} - \mu \bm{1})
\end{align}$$

因此,RMSNorm 可以看作 LayerNorm 的“无投影”版本。

7. 高维空间中向量天然与 1 正交

为什么去掉投影步骤是安全的?答案隐藏在高维空间的统计与几何特性中。

7.1 统计视角:余弦相似度 ~ $1/\sqrt{d}$

假设隐藏向量各维度独立且均值为零,则 $\bm{x}$ 与 $\bm{1}$ 的点积为 $\displaystyle \sum x_i$,其标准差为 $\sqrt{d}$,而 $|x|$ 的数量级也是 $\sqrt{d}$ 。二者余弦相似度为:

$$\begin{align}
\cos(\theta) = \frac{\sum x_i}{|x| \cdot |1|} \propto \frac{1}{\sqrt{d}}
\end{align}$$

当 $d=4096 $时,波动范围仅约 $ \pm1/64$,即向量与 $1$ 的夹角死死锁定在 $90°\pm 1°$附近;即使 d=768,波动也不过 $\pm1/28$。维度越高,正交锁定越强。

7.2 几何视角:测度集中

在高维单位球面上,绝大部分面积集中在“赤道”区域。对于任何给定向量如 $\bm{1}$,随机向量几乎必然落在其正交补空间附近。换句话说,正交是高维空间的常态而非特例

7.3 网络动态视角
  • 初始化:权重通常从零均值分布采样,初始隐藏状态天然满足 $\mu \approx 0$。
  • 信息最大化:若隐藏向量的均值显著偏离零,意味着各维度共涨共跌,浪费了表达能力。网络在训练中会自发去相关,促使均值趋于零。
  • 归一化层本身的强制:即使使用 LayerNorm,每次前向都会强制减均值,阻止了均值分量的累积。换成 RMSNorm 后,残差连接与权重衰减同样能约束幅度漂移。

实证测量发现,无论是在 LayerNorm 还是 RMSNorm 的 LLM 中,每一层隐藏向量与 $\bm{1}$的夹角始终保持在 87°~93° 之间,均值减法的实际效果微乎其微。

个人评述:在高维表示空间中,减均值如同打扫一间没有灰尘的房间,RMSNorm 果断砍掉了这个无用的步骤。

8. 小模型维度同样适用吗?

一个常见疑问是:当隐藏维度较小(如 $d=768$)时,“天然正交”的约束力是否会减弱到影响性能?

  • 数学上,d=768 时余弦相似度波动约是 d=4096 的 2.5 倍,但仍处于很小的量级,均值依然大概率在零附近。
  • 实证上,当前开源社区的大量小模型(TinyLlama、Qwen-0.5B、Phi-1.5 等)均已采用 RMSNorm,性能与 LayerNorm 基本无差。
  • 性价比权衡:在小模型上,显存与计算资源更为紧张,RMSNorm 省下的归约操作和中间缓存的收益更为显著。减均值那一点微弱理论增益,远不及算力节省来得实在。

唯一的潜在风险在于极浅网络(如 2~4 层)中,若输入先验分布极不均匀,可能会产生暂时的均值漂移。此时需要更精细的初始化或适当增大 ε 来保证训练平稳,但这种情况较为罕见。

9. 总结与实践建议

RMSNorm 的流行并非偶然,它用“约分”般的简洁设计,实现了对 LayerNorm 的高效超越:

  • 数学上:具备重缩放不变性和隐式学习率适应,训练更鲁棒;
  • 几何上:与 LayerNorm 仅差一个沿 1 的投影,而该投影在高维空间中天然冗余;
  • 工程上:省时、省显存、实现简单,加速效果随模型深度和规模递增。

实践建议

  1. 新模型设计时直接选用 RMSNorm,无需保留 β 参数。
  2. ε 可设为 1e-5 或 1e-6,与 LayerNorm 实践一致。
  3. 如果模型极浅且出现训练初期 loss 震荡,可适当增大 ε 或微调学习率。
  4. 高效实现应复用前向计算中的 r 与归一化结果,避免重复求平方和。

最终评述:RMSNorm 是大模型时代“奥卡姆剃刀”精神的典范——删除多余的操作,反而释放出更强的训练效率与稳定性。理解其背后的数学,不仅能更好地使用它,也能启发我们以更本质的视角审视深度学习中的每一个组件。

参考文献
[^1]: Zhang, B., & Sennrich, R. (2019). Root mean square layer normalization. In Advances in Neural Information Processing Systems (Vol. 32). Curran Associates, Inc. https://doi.org/10.48550/arXiv.1910.07467
[^2]: Gupta, A., Ozdemir, A., Gong, C., & Anumanchipalli, G. (2024, September 19). Geometric interpretation of layer normalization and a comparative analysis with RMSNorm. arXiv. https://doi.org/10.48550/arXiv.2409.12951


版权声明
引线小白创作并维护的柠檬CC博客采用署名-非商业-禁止演绎4.0国际许可证。
本文首发于柠檬CC [ https://www.limoncc.com ] , 版权所有、侵权必究。
本文永久链接https://www.limoncc.com/post/459cffa89d9d94ff/
如果您需要引用本文,请参考:
引线小白. (May. 18, 2026). 《大语言模型研究12——均方根层归一化(RMSNorm)》[Blog post]. Retrieved from https://www.limoncc.com/post/459cffa89d9d94ff
@online{limoncc-459cffa89d9d94ff,
title={大语言模型研究12——均方根层归一化(RMSNorm)},
author={引线小白},
year={2026},
month={May},
date={18},
url={\url{https://www.limoncc.com/post/459cffa89d9d94ff}},
}

'