具身智能新手名词表English

探索与利用

Exploration vs. Exploitation常用

在「试新动作找更好办法」和「用已知最好的动作拿奖励」之间做权衡。

这是强化学习和序贯决策里的基本矛盾。利用是按当前认知选看起来最好的动作;探索是去试不确定的新动作,短期可能吃亏,但可能发现更好的策略。只利用容易卡在次优解,只探索又拿不到回报。经典研究框架是多臂老虎机问题,常见策略有 ε-贪心(以小概率 ε 随机选动作)、UCB(上置信界,优先试不确定性大的选项)和汤普森采样;深度强化学习里还有熵正则化(鼓励策略保持随机性)和内在奖励(奖励「好奇心」)。机器人上的探索更难:真机乱试可能撞坏设备,所以常先用演示数据或仿真把策略带到合理区域,再有控制地探索。

例子SimpleVLA-RL 用强化学习微调 VLA 时,把推演采样温度从 1.0 提到 1.6,并把裁剪上限从 0.2 放宽到 0.28,让模型生成更多样的轨迹,以加强探索。

也叫
探索-利用权衡、探索-利用困境、Exploration-Exploitation Trade-off
相关
内在奖励、熵正则化、强化学习、样本效率、安全强化学习、真机强化学习
来源
Wikipedia: Exploration–exploitation dilemma
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning

在完整名词表里查看 →