具身智能新手名词表English

表征对齐

Representation Alignment (REPA-style)REPA进阶

训练时让模型中间层特征去对齐一个现成预训练编码器的特征。

REPA 由 Sihyun Yu、谢赛宁等人在 2024 年 10 月提出(ICLR 2025 口头报告),针对扩散 Transformer(DiT、SiT)训练慢的问题。做法是加一个辅助损失:把网络处理加噪图像时的中间隐藏状态经一个小投影层映射后,去对齐同一张干净图像在 DINOv2 等预训练视觉编码器里的特征。作者认为扩散模型训练的一个瓶颈是自己从零学视觉表征,借用现成的好表征能省下这部分功夫,SiT 的训练因此加速超过 17.5 倍。之后「REPA 式」对齐被推广到视频生成和机器人:例如 Spatial Forcing 把 VLA 的中间视觉 token 与 3D 基础模型 VGGT 的特征对齐,让只见过 2D 数据的 VLA 隐式学到空间感知。

例子Spatial Forcing 在 OpenVLA-OFT 和 π0 上加入与 VGGT 特征的余弦相似度对齐损失,不额外输入深度图或点云,训练最多加速 3.8 倍,并提升数据效率。

也叫
REPA 正则化、REPresentation Alignment、特征对齐损失
相关
表征学习、扩散 Transformer、DINOv2、辅助损失 / 辅助任务、VGGT、预训练视觉表征
来源
Yu et al. 2024: Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think
GitHub: sihyun-yu/REPA
Li et al. 2025: Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
信息截至
2025-10

在完整名词表里查看 →