批大小
Batch Size常用每更新一次参数时,一起送进模型计算的样本数量。
训练时不会一次用上全部数据,而是把数据切成一小批一小批(mini-batch),每批算一次平均损失和梯度、更新一次参数,一批里的样本数就是批大小。批大小越大,梯度估计越稳定、GPU 利用率越高,但显存占用也越大;太小则梯度噪声大、训练慢。它和学习率关系紧密,改批大小时通常要一起调学习率。显存不够又想用大批量时,可以用梯度累积(攒几批梯度再更新一次)或多卡数据并行。注意区分:一个训练轮次(epoch)是把全部数据过一遍,其中包含许多个批次。
例子OpenVLA 在 64 张 A100 上训练了 14 天,全局批大小为 2048、学习率固定为 2e-5,总共把训练集过了 27 遍。
- 也叫
- 批量大小、batch、批次大小
- 相关
- 学习率、训练轮次、梯度累积、分布式训练(数据并行 / 模型并行)、超参数、梯度下降
- 来源
- Google Machine Learning Glossary
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246) - 信息截至
- 2024-06