策略推理频率
Policy Inference Frequency常用学习型策略每秒被调用、算出新动作的次数,常低于底层控制频率。
策略推理频率指神经网络策略每秒做几次前向计算、给出新动作(或新动作块),单位 Hz。它和控制频率不是一回事:控制频率是执行器每秒收几次指令,关节控制环常在数百到上千 Hz。大模型算得慢,通常一次预测一整段动作(动作分块),两次推理之间把这段动作依次执行,所以推理频率远低于控制频率。以 π0 为例,它一次输出 50 步动作,在 50 Hz 的机器人上执行 25 步才重新推理,约合 2 Hz,单次推理在 RTX 4090 上约 73 毫秒。推理频率越低,对突发变化反应越慢,动作块衔接处也易卡顿,于是有了异步推理、实时动作分块和快慢双系统(如 Figure Helix 慢系统 7–9 Hz、快系统 200 Hz)。
例子π0 在 20 Hz 控制的 UR5e、Franka 上每执行 16 步(0.8 秒)推理一次,在 50 Hz 控制的机器人上每执行 25 步(0.5 秒)推理一次。
- 也叫
- 推理频率、策略频率、模型调用频率
- 相关
- 控制频率、推理延迟、动作分块、异步推理、实时动作分块、快慢双系统
- 来源
- π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)
Figure: Helix(System 2 7–9 Hz / System 1 200 Hz)
Real-Time Execution of Action Chunking Flow Policies (arXiv:2506.07339) - 信息截至
- 2025-06