注意力掩码
Attention Mask进阶规定序列里每个 token 能「看到」哪些 token 的矩阵
Transformer 的自注意力默认让每个 token 参考序列里所有 token。注意力掩码在计算注意力分数时把不允许的位置屏蔽掉(通常加上负无穷,经 Softmax 后权重变成 0),从而控制信息流向。最常见的有两种:因果掩码,每个 token 只能看自己和前面的,用于 GPT 这类逐个生成的模型;填充掩码,屏蔽为凑齐长度而补的空位。VLA 里常用块状因果掩码:把输入分成几块,块内互相都能看,块与块之间只能看前面的块。这样既能保护预训练 VLM 原有的输入分布,又能让前面块的 KV 缓存在多步去噪时重复使用,节省推理时间。
例子π0 把序列分成「图像+语言」「机器人状态」「带噪动作」三块:第一块不看后面新加入的输入,以减少对 PaliGemma 预训练分布的干扰;状态块不看动作块,所以它的 KV 可以在采样时缓存。
- 也叫
- 块状因果注意力掩码、Block-wise Causal Mask、Blockwise Causal Attention Mask
- 相关
- 注意力机制、因果注意力、自注意力、KV 缓存、动作专家、π0
- 来源
- π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)