长尾问题
Long-tail Problem常用单个罕见、总数却极多的情况,训练数据很少覆盖,最容易出错。
长尾来自统计里的长尾分布:少数常见情况(头部)占了大部分数据,大量罕见情况(尾部)各自出现很少,但加起来数量巨大。自动驾驶最早把它当作核心难题:绝大多数时间是正常行驶,但偶尔会遇到施工改道、路上的掉落物、突然冲出的行人等 corner case,这些场景数据少,又往往关乎安全。具身智能同样如此:家里的物体、摆放和意外状况千变万化,演示数据也天然偏向少数任务;ICRA 2026 的论文 Beyond the Majority 指出,通用机器人策略在数据稀少的尾部任务上泛化明显变差,常规的重采样方法效果有限。应对思路包括持续回收部署中的失败数据(数据飞轮)、用仿真和合成数据补尾部、提升模型泛化和失败恢复能力。长尾是「演示能跑通」和「产品能落地」之间差距的主要来源。
例子家务机器人能稳定收拾常见的碗筷,但遇到打翻的汤汁、卡在桌缝里的叉子或宠物突然跳上桌,这些少见情况就属于长尾。
- 也叫
- 长尾场景、Corner Case、边缘案例、长尾分布
- 相关
- 分布外、泛化、数据飞轮、失败恢复、鲁棒性、自动驾驶
- 来源
- Beyond the Majority: Long-tail Imitation Learning for Robotic Manipulation (ICRA 2026)
Dynamically Conservative Self-Driving Planner for Long-Tail Cases - 信息截至
- 2026-02