仅解码器架构
Decoder-only Architecture进阶只保留 Transformer 解码器、用因果注意力逐个预测下一个 token 的模型结构。
仅解码器架构是把原始 Transformer 的编码器去掉、只堆叠解码器的结构。2018 年谷歌 Liu 等人在生成维基百科的工作里用它处理超长序列,同年 OpenAI 的 GPT-1 也采用这种结构,此后 GPT 系列、Llama 等主流大语言模型基本都是仅解码器。它用因果注意力(每个位置只能看到前面的 token)做下一个 token 预测,训练目标简单统一,容易扩大规模。多模态模型会把图像编成视觉 token 拼在文字前面一起输入。很多 VLA 直接沿用这种语言模型骨干,把动作也当成 token 输出。
例子OpenVLA 以 Llama 2 7B 这个仅解码器语言模型为骨干:图像特征和文字指令拼成一条序列输入,模型再逐个输出离散化后的动作 token。
- 也叫
- Decoder-only、纯解码器架构、仅解码器 Transformer
- 相关
- Transformer、编码器-解码器、因果注意力、自回归解码、大语言模型、下一个 token 预测
- 来源
- Generating Wikipedia by Summarizing Long Sequences (arXiv:1801.10198)
Generative pre-trained transformer - Wikipedia