点云编码器
Point Cloud Encoder进阶把一堆无序的三维点转换成神经网络能用的特征向量的模块。
点云编码器把深度相机或激光雷达得到的点云(一组带 xyz 坐标、有时还带颜色的无序三维点)转换成特征。难点在于点没有固定顺序、数量也不固定,不能直接套用处理图像网格的卷积。2016 年斯坦福的 PointNet 用共享的多层感知机逐点提特征,再用最大池化这种与顺序无关的操作汇总,开创了直接处理点云的路线;之后有 PointNet++、Point Transformer 系列等更强的结构。具身智能里用 3D 输入的策略都离不开它:3D 扩散策略(DP3)先用最远点采样把点云降到 512 或 1024 个点,再用三层 MLP 加最大池化的轻量编码器得到 64 维特征,论文消融中它比 PointNet++ 等复杂编码器效果更好。
例子DP3 的点云编码器故意不用颜色通道,只用几何坐标,论文称这样对物体外观变化的泛化更好。
- 也叫
- 点云骨干网络、Point Cloud Backbone
- 相关
- 点云、PointNet、Point Transformer V3、3D 扩散策略、最远点采样、视觉编码器
- 来源
- PointNet: Deep Learning on Point Sets for 3D Classification and Segmentation (arXiv:1612.00593)
3D Diffusion Policy (arXiv:2403.03954)