自适应层归一化
Adaptive Layer NormalizationAdaLN进阶用条件信息(如扩散时间步)动态算出层归一化的缩放和偏移
层归一化会把每个 token 的特征标准化,再乘缩放系数 γ、加偏移 β,这两个参数通常是训练后固定的。自适应层归一化改为由条件向量(如扩散时间步、类别、语言特征)经一个小 MLP 回归出 γ 和 β,条件一变,整层特征的分布跟着变,从而把条件「注入」网络,思路与 FiLM 特征调制相同。它沿用了 GAN 和 U-Net 扩散模型里的自适应归一化,2022 年 Peebles 和 Xie 在扩散 Transformer(DiT)里系统使用,并提出 adaLN-Zero:再回归一个门控系数并初始化为零,让每个 Transformer 块初始时等于恒等映射,训练更稳。具身领域里,英伟达 GR00T N1 的 DiT 动作模块就用 AdaLN 注入去噪步,同时用交叉注意力接收 VLM 特征。
例子openpi 的 π0.5 实现把流匹配时间步经两层 MLP 编码成 adarms_cond,用自适应 RMSNorm 的方式调制动作 token 所在的归一化层。
- 也叫
- adaLN、adaLN-Zero、自适应 RMSNorm、adaRMS
- 相关
- FiLM 特征调制、扩散 Transformer、归一化层(层归一化 / RMSNorm / 批归一化)、动作专家、GR00T N1 系列、交叉注意力
- 来源
- Scalable Diffusion Models with Transformers (DiT, arXiv 2212.09748)
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)
openpi pi0.py 源码