具身智能新手名词表English

注意力机制

Attention Mechanism入门必知

让模型按相关程度给输入的各部分分配权重,再加权汇总信息的计算方法。

深度学习里的注意力机制一般追溯到 Bahdanau、Cho 和 Bengio 2014 年的神经机器翻译论文:翻译每个词时,模型自动去原句里找最相关的词,而不是把整句压成一个固定长度的向量。现在常用的做法是每个位置生成查询(Q)、键(K)、值(V)三个向量,用 Q 与各个 K 的相似度经 softmax 归一化成权重,再对 V 加权求和。2017 年 Vaswani 等人提出的 Transformer 完全用注意力取代循环和卷积,便于并行训练,此后成为大语言模型和 VLA 的基础结构。在具身模型里,自注意力让图像块、文字和动作 token 相互交换信息,交叉注意力常用来让动作模块读取视觉语言特征。

例子给机器人指令「把红杯子放进水槽」时,模型处理「红杯子」这几个文字 token,注意力权重会集中到画面中红杯子所在的图像块上,把语言和画面对应起来。

也叫
注意力、Attention
相关
Transformer、自注意力、交叉注意力、因果注意力、注意力掩码、KV 缓存
来源
Neural Machine Translation by Jointly Learning to Align and Translate (arXiv 1409.0473)
Attention Is All You Need (arXiv 1706.03762)
Attention (machine learning) - Wikipedia

在完整名词表里查看 →