具身智能新手名词表English

卷积神经网络

Convolutional Neural NetworkCNN常用

用小卷积核在图像上滑动提取局部特征的神经网络,长期是视觉任务的主力。

卷积神经网络是专门处理图像这类网格数据的神经网络。核心是卷积层:一组很小的可学习滤波器(如 3×3)在图上逐位置滑动,计算局部加权和;同一个滤波器在所有位置共用参数,所以参数量远少于全连接网络,也天然适合识别出现在任何位置的边缘、纹理和部件。再配合池化层逐步缩小分辨率,就能从局部细节一路抽象到整体语义。发展上,LeCun 在 1990 年代用 LeNet 识别手写数字,2012 年 AlexNet 在 ImageNet 上大幅领先,2015 年 ResNet 用残差连接把网络做深。视觉 Transformer 出现后,大模型的视觉编码器多换成了 Transformer,但机器人小模型里 CNN 依然常见,例如 RT-1 用 EfficientNet、Diffusion Policy 用 ResNet-18 处理相机图像。

例子Diffusion Policy 把标准 ResNet-18 的全局平均池化换成空间 softmax 以保留位置信息,把 BatchNorm 换成 GroupNorm 以稳定训练,用它把每个相机画面编码成特征。

也叫
卷积网络、ConvNet
相关
残差网络、EfficientNet、视觉编码器、视觉 Transformer、骨干网络、空间 Softmax
来源
CS231n: Convolutional Neural Networks for Visual Recognition (Stanford)
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)
RT-1: Robotics Transformer (project page)

在完整名词表里查看 →