PaLI-X
PaLI-X: On Scaling up a Multilingual Vision and Language Model进阶谷歌 2023 年约 550 亿参数的多语言视觉语言模型,RT-2 的骨干之一
Google Research 2023 年 5 月发布的多语言视觉语言模型(VLM),是 PaLI 的放大版:视觉编码器用 220 亿参数的 ViT-22B,语言部分是 320 亿参数的 UL2 编码器-解码器,合计约 550 亿参数。论文的主要结论是视觉、语言两侧一起扩大都有收益,训练时混合了前缀补全和掩码补全两种目标;微调后在 15 个以上基准上刷新当时最好成绩,还出现了复杂计数、用非英语类别名做目标检测等没专门训练过的能力。对具身领域来说,它最出名的身份是 RT-2 的骨干之一:RT-2 分别在 PaLI-X(55B)和 PaLM-E(12B)上,把机器人动作当成文字 token 一起训练,得到最早的一批视觉-语言-动作模型。
例子RT-2-PaLI-X-55B:把 PaLI-X 放在网页图文数据和机器人轨迹上协同微调,让它看图读指令后直接输出离散化的动作 token。
- 相关
- RT-2、视觉语言模型、PaLM-E、视觉 Transformer、视觉-语言-动作模型、编码器-解码器
- 来源
- arXiv 2305.18565: PaLI-X
RT-2 项目主页 - 信息截至
- 2023-07