状态编码器
State / Proprioception Encoder常用把机器人关节角、夹爪开合等自身状态变成模型可用向量的小网络。
状态编码器处理机器人的本体感知信息,即关节角、末端位姿、夹爪开合度等不靠相机就能读到的自身状态。这些是几维到几十维的数值向量,要先映射到模型的嵌入维度,才能和图像、文字 token 一起送进 Transformer。实现通常很简单:π0 和 ACT 各用一个线性层;GR00T N1 为每种本体各配一个 MLP,以适配不同机器人的状态维度。状态输入让策略知道手臂此刻在哪,但也有副作用:Octo 团队发现加入本体状态后效果常变差,推测是模型过度依赖状态与动作之间的强相关,即因果混淆。
例子双臂 ALOHA 的状态是两臂共 14 个关节位置;ACT 用一个线性层把这 14 维向量投影成 512 维,作为一个 token 与图像特征一起送入 Transformer 编码器。
- 也叫
- 本体感知编码器、Proprioception Encoder、State Encoder、状态投影层、State Projector
- 相关
- 本体感知、投影层、本体专属头、动作与状态归一化、因果混淆、历史编码器
- 来源
- π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)
Octo: An Open-Source Generalist Robot Policy (arXiv 2405.12213)