中间表示
Intermediate Representation进阶模型在指令和底层动作之间先预测出的过渡信息,如二维轨迹、关键点。
在机器人学习里,中间表示指不从图像和指令一步输出关节命令,而是先产出一种人能看懂、较少依赖具体机器人的信息,再由下游策略或控制器据此生成动作。常见形式有画在图像上的末端运动轨迹、物体关键点、可供性热图(标出可抓、可推的位置)、子目标图像和语言子任务。谷歌 DeepMind 等 2023 年的 RT-Trajectory 用粗略的轨迹草图作为策略的条件,能完成仅靠语言条件做不到的新任务;2025 年的 HAMSTER 让高层视觉语言模型预测 2D 路径,交给具备 3D 感知的底层策略执行,真机实验平均成功率比 OpenVLA 高约 20 个百分点。好处是高层可用无动作标签视频、仿真等便宜数据训练,也便于人检查和纠正;代价是信息被压缩,表示选得不好会限制精度。编译器领域也有同名概念(IR),含义不同。
例子只用抓取放置数据训练的语言条件策略,通常学不会「折叠」这种新任务;RT-Trajectory 改用画在图像上的手臂轨迹草图作条件,人手绘或由生成模型画出一条轨迹,策略就能照着执行训练中没见过的动作。
- 也叫
- 中间表征、中层表示、Mid-level Representation
- 相关
- 分层架构、RT-Trajectory、可供性、语义关键点、视觉提示、快慢双系统
- 来源
- RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches (arXiv:2311.01977)
HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation (arXiv:2502.05485) - 信息截至
- 2025-05