大语言模型
Large Language ModelLLM入门必知用海量文本训练、能理解和生成自然语言的超大神经网络。
大语言模型是用海量文本训练的神经网络,一般基于 Transformer 架构,主要训练目标是「预测下一个 token」(token 是模型处理文本的最小单位)。规模变大后,它们不改参数、只看提示里的几个例子就能做新任务:OpenAI 2020 年的 GPT-3 有 1750 亿参数,论文展示了这种少样本能力;2022 年底 ChatGPT 发布后大语言模型开始被广泛使用。机器人领域主要用它理解人的指令、把长任务拆成步骤(如 SayCan)、生成控制代码(如代码即策略)。多数 VLA 模型的主干也是大语言模型,例如 OpenVLA 基于 Llama 2,再接上视觉编码器。
例子对机器人说「我把可乐洒了,能拿个东西来清理吗」,SayCan 让大语言模型给机器人会的每个技能打分,再结合「这一步现在能否做成」的估计,依次选出「找到海绵、拿起海绵、拿给你、结束」,机器人逐步执行。
- 也叫
- 大模型、语言大模型
- 相关
- Transformer、token(词元)、下一个 token 预测、视觉语言模型、大模型任务规划、SayCan
- 来源
- Language Models are Few-Shot Learners (GPT-3, arXiv:2005.14165)
Large language model (Wikipedia)
SayCan project page