具身智能新手名词表English

关键帧动作预测

Keyframe Action / Next-Best-Pose Prediction进阶

只预测任务中几个关键的末端位姿,两点之间的路径交给运动规划器。

常规视觉运动策略每秒要输出几十个连续动作;关键帧方法则把一条演示压缩成少数几个关键的末端执行器位姿(如抓取前、夹住时、放下前),策略只学「下一个关键位姿在哪」,两个位姿之间的路径由运动规划器生成。帝国理工 Stephen James 等人 2021 年在 Q-attention、C2F-ARM 中提出关键帧发现,2022 年的 PerAct 沿用:按关节速度接近零等简单规则自动挑出关键帧,一条 RLBench 演示通常只剩 2 到 17 个,再把位置离散成体素、旋转离散成角度区间,预测变成分类问题。PerAct 的消融实验显示,随机或等间隔选帧会让性能降到零。这种设定在少样本下学得快,RVT、3D Diffuser Actor 等 3D 操作策略也采用;代价是依赖规划器,难以处理需要连续调节力度和速度的动态任务。

例子让机械臂打开抽屉时,PerAct 只需依次预测几个关键位姿:把手前的预抓取位姿、夹住把手、向外拉到位;每两个位姿之间由运动规划器补全路径。

也叫
下一最佳位姿预测、关键帧动作、关键位姿预测、Next-Best-Pose Prediction、Next Best Action、Keypose Prediction
相关
PerAct、RVT-2、3D Diffuser Actor、运动规划、RLBench、动作表示
来源
Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation (arXiv:2209.05451)
Q-attention: Enabling Efficient Learning for Vision-based Robotic Manipulation (arXiv:2105.14829)
Coarse-to-Fine Q-attention (C2F-ARM, arXiv:2106.12534)
信息截至
2022-11

在完整名词表里查看 →