具身智能新手名词表English

参数量

Parameter Count (Model Size)入门必知

模型里可训练数值(权重)的总个数,常用 B(十亿)、M(百万)表示。

参数是神经网络里通过训练学出来的数值,主要是各层的权重和偏置,参数量就是它们的总数。7B 指 70 亿(billion)个参数,300M 指 3 亿(million)。参数量大体决定模型的容量,以及训练和部署要花多少算力、显存和时间。只算权重的话,显存可粗估为「参数量 × 每个参数的字节数」:名为 7B 的 OpenVLA 实际约 75 亿参数,用 bfloat16(每参数 2 字节)加载约占 15GB,运行时还要再多一些。机器人模型规模跨度很大:RT-2 最大 550 亿,π0 约 33 亿,Hugging Face 的 SmolVLA 只有 4.5 亿。参数多不一定更好:OpenVLA 的参数只有 RT-2-X(550 亿)的约七分之一,在 29 个任务上的总体成功率反而高 16.5 个百分点。

例子Figure 的 Helix 让两部分规模悬殊:负责理解的视觉语言模型 70 亿参数、每秒只跑 7–9 次,负责出动作的策略 8000 万参数、每秒跑 200 次。

也叫
模型规模、模型大小、B(十亿参数)、M(百万参数)
相关
神经网络、缩放定律、推理延迟、训练后量化、端侧模型、基础模型
来源
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)
RT-2: Vision-Language-Action Models (project page)
SmolVLA: Efficient Vision-Language-Action Model trained on LeRobot Community Data (Hugging Face blog)
信息截至
2025-06

在完整名词表里查看 →