具身智能新手名词表English

基础模型

Foundation Model入门必知

在海量数据上预训练、之后能适配到许多下游任务的大模型。

「基础模型」一词由斯坦福大学一百多位研究者在 2021 年的长篇综述中提出,指在大规模、多样的数据上训练(多用自监督学习,即不靠人工标注、从数据本身构造训练目标),之后能通过微调或提示适配到大量下游任务的模型,文中举的例子是 BERT、GPT-3、DALL-E。它改变了「一个任务训一个模型」的做法:先花大算力训一个通用底座,各任务在上面少量调整即可;代价是底座的缺陷会被所有下游模型继承。具身智能里,VLA 模型通常以视觉语言模型为底座,而用大量机器人数据预训练、可适配多种机器人和任务的模型,常被称为机器人基础模型或具身大模型。

例子π0 以谷歌开源的视觉语言模型 PaliGemma(30 亿参数)为底座,加上 3 亿参数的动作专家,用机器人数据训练成一个可以再针对具体任务微调的机器人基础模型。

也叫
基座模型、基模、预训练大模型、基座大模型
相关
大语言模型、视觉语言模型、具身大模型、预训练、微调、视觉-语言-动作模型
来源
On the Opportunities and Risks of Foundation Models (Bommasani et al., arXiv:2108.07258)
π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)
信息截至
2024-10

在完整名词表里查看 →