编码器-解码器
Encoder-Decoder常用先把输入压成中间表示,再由另一部分据此生成输出的网络结构。
编码器-解码器是一种通用的神经网络结构:编码器把输入(一句话、一张图、一组传感器读数)转成中间表示,解码器根据这个表示生成输出,输入输出长度可以不同。2014 年 Sutskever 等人用两个 LSTM(一种循环神经网络)做英译法,是它在序列到序列任务上的代表作;2017 年的原始 Transformer 也是这种结构,解码器通过交叉注意力读取编码器的结果。后来 GPT 类大模型多改用仅解码器结构,但机器人里它依然常见:ACT 用 Transformer 编码器融合多路相机画面和关节状态,再由解码器一次输出一整段动作。自编码器、变分自编码器也属于这一框架。
例子ACT 控制 ALOHA 双臂:编码器读入 4 路相机图像和 14 维关节角,解码器输出未来 k 步(常取 100 步)的 14 维目标关节位置。
- 也叫
- 编解码器架构、Encoder-Decoder Architecture、序列到序列模型、Seq2Seq
- 相关
- Transformer、仅解码器架构、交叉注意力、自编码器、变分自编码器、ACT
- 来源
- Dive into Deep Learning: The Encoder–Decoder Architecture
Sequence to Sequence Learning with Neural Networks (arXiv 1409.3215)
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv 2304.13705)