具身智能新手名词表English

自编码器

AutoencoderAE常用

先把输入压成短向量、再还原回来,借此学到数据要点的网络。

自编码器由编码器和解码器组成:编码器把输入(如一张图片)压缩成低维向量,解码器再从这个向量重建输入,训练目标是让重建结果尽量接近原输入,不需要人工标注。中间向量比输入小,网络被迫只保留最关键的信息,因此常用于降维和特征学习。这个思路在神经网络领域已有几十年历史(LeCun 1987 等)。常见变体有:变分自编码器(VAE)让中间向量服从概率分布,从而能生成新样本;掩码自编码器(MAE)遮住部分输入再重建,用于视觉预训练;VQ-VAE 把向量换成码本里的离散编号。具身智能里,潜在扩散模型、视频分词器、潜在动作模型都靠它把高维数据压进潜在空间再处理。

例子《World Models》用卷积 VAE 把赛车游戏的每帧画面压成 32 维向量,后面的预测模型只在这 32 个数上工作。

也叫
自动编码器
相关
变分自编码器、条件变分自编码器、掩码自编码器、向量量化变分自编码器、潜在空间、潜在扩散模型
来源
Deep Learning, Chapter 14: Autoencoders (Goodfellow, Bengio, Courville)
World Models (Ha & Schmidhuber, interactive article)

在完整名词表里查看 →