自我提升
Self-improvement进阶机器人用自己练习产生的数据反复训练自己,越练越强,少靠人工。
自我提升指模型在少量人工数据起步后,靠自己与环境交互产生新数据、自动判断好坏、再训练自己的循环,目标是让数据增长不再完全依赖人工演示。关键在于怎么自动判断成败:常用成功检测器、奖励模型或价值函数,再配合过滤式行为克隆或强化学习更新策略。代表工作有 DeepMind 2023 年的 RoboCat,用自己练习产生的数据训练下一代模型;2025 年 Ghasemipour 等人的 Self-Improving Embodied Foundation Models 让模型预测「还剩几步完成」,由此同时得到奖励和成功检测,让机器人机群自主练习,比单纯多采演示数据更省样本。π*0.6 用 RECAP 从自主经验和人工纠正中学习,也属于这一类。
例子RoboCat 的一轮循环:人遥操作给出 100–1000 条新任务演示 → 微调出专用分支模型 → 分支自主练习平均约 1 万次 → 把新旧数据合并,训练下一版 RoboCat。
- 也叫
- 自我改进、自主提升、Self-Improving、自我迭代
- 相关
- RoboCat、数据飞轮、成功检测器、真机强化学习、π*0.6、拒绝采样微调 / 过滤式行为克隆
- 来源
- Google DeepMind Blog: RoboCat: A self-improving robotic agent
Bousmalis et al. 2023: RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation
Ghasemipour et al. 2025: Self-Improving Embodied Foundation Models - 信息截至
- 2025-09