交叉注意力
Cross-Attention常用让一组 token 去查询另一组 token 里信息的注意力,是跨模态融合的常用接口。
交叉注意力是注意力机制的一种。自注意力里,查询(Query)、键(Key)、值(Value)都来自同一个序列;交叉注意力则由序列 A 提供查询、序列 B 提供键和值,于是 A 的每个 token 可以按相关程度从 B 里取信息,而 B 本身不被改动。它最早出现在 2017 年 Transformer 论文的编码器-解码器结构中,解码器靠它读取编码器对原句的表示来完成翻译。后来它成了向模型注入条件信息的标准做法:文生图模型用它读取文字编码,机器人策略用它把视觉和语言特征送进动作生成部分。另一种做法是把两段 token 直接拼接后做自注意力,两者各有取舍,VLA 里都很常见。
例子英伟达 GR00T N1 的动作模块(一个 DiT 变体)交替堆叠两种块:自注意力块处理带噪动作 token 和机器人状态,交叉注意力块去读取 VLM 输出的视觉-语言 token。
- 也叫
- Cross Attention、编码器-解码器注意力
- 相关
- 注意力机制、自注意力、Transformer、多模态融合、编码器-解码器、扩散 Transformer
- 来源
- Attention Is All You Need (arXiv 1706.03762)
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)