具身智能新手名词表English

策略

Policy入门必知

根据当前观测决定下一步做什么动作的规则,通常是一个神经网络。

策略是强化学习和机器人学习的核心概念,指智能体从「当前状态或观测」到「动作」的映射,常记作 π。确定性策略对同一输入总给出同一个动作,随机策略则输出一个动作分布再从中采样。在具身智能里,策略通常是一个神经网络:输入相机画面、关节角等本体状态,有时再加一句语言指令,输出机械臂末端位姿、关节目标角或行走速度指令。训练策略主要靠模仿学习(照着人类演示学)和强化学习(靠奖励试错),VLA 模型本质上也是一种大规模策略。注意别和强化学习里的「模型」混淆:那里单说「模型」常指预测环境下一步怎么变化的动力学模型(如「基于模型的强化学习」),而策略负责选动作。

例子扩散策略在 Push-T 任务里读入相机画面和末端当前位置,每次输出接下来一小段末端移动目标,控制机械臂把 T 形块推到指定位置。

也叫
控制策略、策略网络、Policy Network
相关
视觉运动策略、模仿学习、强化学习、观测、动作空间、视觉-语言-动作模型
来源
OpenAI Spinning Up: Key Concepts in RL
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion

在完整名词表里查看 →