共享自主
Shared Autonomy进阶人和机器人同时出力:机器人推断人的意图,把人的指令和自主动作融合后执行。
共享自主介于纯遥操作和全自主之间:人通过摇杆、脑机接口等给出粗略、带噪声的指令,机器人一边执行一边推断人想达成的目标,再把人的输入和自己的自主动作融合,常见做法是按意图置信度加权混合(称为仲裁或策略混合)。它最早用于助残机械臂、智能轮椅和遥操作,目的是减轻操作负担又不剥夺人的控制权。CMU 的 Javdani 等人 2015 年把它建模成目标未知的部分可观测马尔可夫决策过程(POMDP),用逆最优控制从人的历史输入推断目标分布;用户完成更快、输入更少,但也有人反映失去了控制感。Reddy、Dragan、Levine 2018 年用深度强化学习做到不必预先知道目标集合。它与遥操作、人在回路纠偏关系密切。
例子Reddy 等人的实验中,人玩登月舱着陆游戏(Lunar Lander),辅助智能体先剔除 Q 值低于阈值的动作,再从剩下的动作里挑最接近人输入的那个执行,在不知道目标着陆点的情况下帮人更稳地着陆。
- 也叫
- 共享控制、Shared control
- 相关
- 遥操作、人在回路、人机协作、人机交互、意图理解(隐式指令)、部分可观测马尔可夫决策过程
- 来源
- Shared Autonomy via Hindsight Optimization (Javdani, Srinivasa, Bagnell, arXiv 1503.07619)
Shared Autonomy via Deep Reinforcement Learning (Reddy, Dragan, Levine, RSS 2018, arXiv 1802.01744)