动作头
Action Head入门必知接在骨干网络后面,把提取出的特征转换成具体机器人动作的输出模块。
动作头沿用了视觉领域「骨干 + 头」的分法:骨干网络从图像、语言、本体状态中提取特征,头把特征变成任务需要的输出,在机器人策略里就是关节角、末端位姿、夹爪开合等动作。常见的动作头有三类:直接回归连续值的 MLP 头(用均方误差训练,遇到多种合理做法时容易取平均);把动作离散成 token 再分类的头;以及扩散头或流匹配头,能表达多峰的动作分布。Octo 在 Transformer 输出上接一个轻量的扩散动作头,微调到新机器人时可以换一个新动作头来适配新的动作空间;GR00T N1 用扩散 Transformer 作为动作模块。
例子Octo 预训练时用扩散动作头预测未来一段动作;迁移到一台动作维度不同的新机械臂时,保留 Transformer 主体的预训练权重、换上一个匹配新动作空间的新动作头,再用约 100 条演示把整个模型一起微调。
- 也叫
- 动作解码器、Action Decoder、策略头、Policy Head
- 相关
- 骨干网络、扩散动作头、动作专家、连续动作回归、Octo、动作多峰性
- 来源
- Octo: An Open-Source Generalist Robot Policy (arXiv 2405.12213)
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)