连续动作回归
Continuous Action Regression常用让网络直接输出连续的动作数值,用 L1 或均方误差去对齐示范动作。
连续动作回归是机器人策略最直接的出动作方式:网络末端接一个回归头(通常是几层全连接),直接输出关节角、末端位移等实数,训练时用均方误差或 L1 损失(预测值与示范值之差的平方或绝对值)去逼近人类示范。它实现简单,推理只需一次前向计算,速度快。短板在于示范里同一场景有多种合理做法时(动作多峰性),回归会学成几种做法的平均,结果可能哪种都不是;Octo 论文就观察到 MSE 回归头学出的策略动作迟缓、犹豫。常见的替代方案是把动作离散成 token,或用扩散、流匹配生成。不过 2025 年的 OpenVLA-OFT 用 L1 回归配合动作分块和并行解码,把 LIBERO 四个任务集的平均成功率从 76.5% 提到 97.1%,说明回归在很多任务上仍然够用。
例子ACT(Action Chunking with Transformers)训练时用 L1 损失直接回归未来一段关节角序列;OpenVLA-OFT 把 OpenVLA 的离散 token 输出换成 L1 回归头,一次前向就算出整段动作,动作生成吞吐提升约 26 倍。
- 也叫
- 回归头、Regression Head、L1 回归、MSE 回归
- 相关
- 动作头、动作多峰性、L1 损失、均方误差、扩散动作头、分箱离散化
- 来源
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT, arXiv 2502.19645)
Octo: An Open-Source Generalist Robot Policy (arXiv 2405.12213) - 信息截至
- 2025-02