采样式 MPC
Sampling-based MPC进阶每个周期随机采样一批动作序列,在模型里推演打分,挑最好的执行第一步。
模型预测控制(MPC)每个周期都优化未来一小段的动作序列,只执行第一步再重算。传统求解靠梯度或二次规划,要求模型可导、代价光滑。采样式 MPC 改为:在上一轮最优序列附近加噪声采出几十到上千条候选,用动力学模型(常是物理仿真器)并行推演并算代价,再挑最好的一条或按代价加权平均出新序列。代表方法有 MPPI(权重正比于 exp(−代价/λ),λ 为温度系数)、交叉熵方法 CEM(保留代价最低的一批重新拟合采样分布),以及 DeepMind 2022 年随 MuJoCo MPC 发布的最简版 Predictive Sampling。它不需要导数、能处理接触这类不光滑动力学、易于 GPU 并行,缺点是动作维度高时采样效率下降。
例子CMU 等 2024 年提出的 DIAL-MPC 借鉴扩散模型逐步降噪的退火思路,不经训练直接在四足全阶动力学上做力矩级采样优化,论文报告跟踪误差比标准 MPPI 低 13.4 倍,并在真机上完成带负载的精准跳跃。
- 也叫
- 基于采样的MPC、采样MPC、Sampling-based Model Predictive Control
- 相关
- 模型预测控制、模型预测路径积分控制、交叉熵方法、DIAL-MPC(扩散式退火足式 MPC)、MuJoCo MPC、轨迹优化
- 来源
- Predictive Sampling: Real-time Behaviour Synthesis with MuJoCo (Howell et al., arXiv 2212.00541)
Information Theoretic Model Predictive Control: Theory and Applications to Autonomous Driving (Williams et al., arXiv 1707.02342)
Full-Order Sampling-Based MPC for Torque-Level Locomotion Control via Diffusion-Style Annealing (DIAL-MPC, arXiv 2409.15610)