表征学习
Representation Learning常用让模型自动从原始数据里学出好用的特征向量,而不是靠人工设计特征。
表征学习研究怎样把图像、文本、传感器读数等原始数据变成一组更好用的数字(表征,也叫特征或嵌入向量),让下游任务更容易学。Bengio 等人 2013 年的综述把它视为深度学习的核心问题:好的表征应把数据背后不同的变化因素分离开。学表征的途径很多,有监督分类、自监督学习(对比学习、掩码自编码器)、图文对齐(如 CLIP)等。具身智能里机器人数据少,常先用大规模图片或人类视频预训练视觉编码器,再冻结或微调它来学策略,这样只需少量示范,R3M、VC-1、DINOv2 都属于这条路线。世界模型的隐空间、潜在动作也是表征学习的产物。
例子R3M 用 Ego4D 人类第一人称视频,以时间对比学习和视频-语言对齐预训练视觉表征;把它冻结后接到 Franka 机械臂的策略上,在真实杂乱的公寓里只用 20 条示范就学会了操作任务。
- 也叫
- 表示学习、特征学习、Feature Learning
- 相关
- 自监督学习、对比学习、预训练视觉表征、嵌入向量、潜在空间、R3M
- 来源
- Representation Learning: A Review and New Perspectives (Bengio et al.)
R3M: A Universal Visual Representation for Robot Manipulation