苦涩的教训
The Bitter Lesson常用萨顿的观点:长期看,能随算力扩展的通用方法胜过人工注入的领域知识。
强化学习奠基人之一 Rich Sutton 在 2019 年 3 月发表的一篇短文。他回顾 70 年 AI 研究后指出:长期真正有效的是能充分利用算力的通用方法——搜索和学习,而不是把人对领域的理解硬编码进系统。象棋、围棋、语音、视觉都走过同一条路:先靠人工知识取得短期进步,最后被规模化的搜索和学习超越,根本原因是单位算力的成本持续指数下降。在具身智能里,这篇文章常被用来支持「端到端 + 大数据 + 大模型」路线、反对过多手工设计的模块;争议点在于机器人数据远比文本和图像稀缺,能否照搬仍有分歧。
例子萨顿文中的例子:计算机围棋曾长期依赖人工棋理和围棋特有结构,最终被「大规模搜索 + 自我对弈学习价值函数」的方法全面超越。
- 也叫
- 惨痛的教训、痛苦的教训
- 相关
- 缩放定律、端到端、莫拉维克悖论、基础模型、数据荒、具身智能
- 来源
- The Bitter Lesson (Rich Sutton, 2019)