模型预测路径积分控制
Model Predictive Path Integral ControlMPPI进阶每个周期随机采样大量控制序列并模拟,按代价加权平均出动作的采样式 MPC。
MPPI 是一种基于采样的模型预测控制,由佐治亚理工的 Grady Williams、Evangelos Theodorou 等人在 2015–2017 年间提出,理论来自路径积分最优控制和信息论。和普通 MPC 一样,它每个周期只执行优化结果的第一步,然后从新状态重来。不同在于求解方式:以上一轮的控制序列为中心加随机噪声,采样成百上千条候选控制序列,用动力学模型把每条向前模拟,算出各自的代价 S,再按 exp(−S/λ) 加权平均得到新的控制序列,λ 是温度参数,越小越偏向代价最低的几条。它不需要求梯度或线性化,代价函数可以不光滑(比如碰撞惩罚),动力学也可以是神经网络,各条样本互相独立,适合 GPU 并行。缺点是需要大量样本,动作维度高时效率下降。和交叉熵方法相比,后者只用代价最低的一批样本更新,MPPI 则按指数权重用上全部样本。
例子在 1:5 比例的 AutoRally 越野车上,MPPI 在 GPU 上并行模拟几千条 2–3 秒长的轨迹,控制频率 40–60 Hz,完成泥地赛道上的激进驾驶;ROS 2 导航框架 Nav2 也内置了 MPPI 控制器,默认每周期采样 1000 条轨迹,在普通 CPU 上可跑到 50 Hz 以上。
- 也叫
- MPPI 控制、信息论 MPC、IT-MPC
- 相关
- 模型预测控制、采样式 MPC、交叉熵方法、DIAL-MPC(扩散式退火足式 MPC)、Nav2、最优控制
- 来源
- Williams et al.: Information Theoretic Model Predictive Control: Theory and Applications to Autonomous Driving (arXiv:1707.02342, T-RO)
Williams, Aldrich, Theodorou: Model Predictive Path Integral Control using Covariance Variable Importance Sampling (arXiv:1509.01149)
Nav2 MPPI Controller README - 信息截至
- 2026-09