HaMeR
HaMeR (Hand Mesh Recovery)进阶从单张 RGB 图像重建 3D 手部网格的 Transformer 模型。
HaMeR 由 UC Berkeley、密歇根大学、纽约大学的研究者提出,发表于 CVPR 2024。它用 ViT-H 视觉 Transformer 作骨干,从图像中的手部区域回归 MANO 手部模型参数(MANO 用少量姿态和形状参数描述一只手的 3D 网格)以及相机参数。作者把 10 个带 2D 或 3D 手部标注的数据集合并成约 270 万个训练样本,还从 Ego4D 等视频里标注了 HInt 评测集,专门考察真实场景中的手。它是单帧方法,但用在视频上结果也比较平滑。在具身智能里,它是从人类视频提取手指姿态的常用工具,结果可重定向给灵巧手或夹爪,作为模仿学习的动作来源。
例子OKAMI 从一段人类演示视频教人形机器人做操作时,身体动作用 SLAHMR 重建,手部姿态则对每只手用 HaMeR 估计。
- 也叫
- Reconstructing Hands in 3D with Transformers
- 相关
- MANO 手部模型、手部姿态估计、WiLoR、人体网格恢复、OKAMI、人类视频数据
- 来源
- arXiv 2312.05251: Reconstructing Hands in 3D with Transformers
HaMeR 项目主页
OKAMI: Teaching Humanoid Robots Manipulation Skills through Single Video Imitation - 信息截至
- 2024-06