可解释性(机制可解释性)
Interpretability (Mechanistic Interpretability)进阶研究神经网络内部怎样得出输出;机制可解释性要把计算拆成人能懂的特征和回路。
深度网络有上亿参数,输入到输出之间的计算人看不懂。可解释性研究想回答「模型为什么这样输出」,方法从画注意力热图、显著性图,到机制可解释性:像逆向工程程序那样,找出网络内部表示了哪些概念(特征),以及这些特征怎样连成完成某项计算的回路。难点之一是单个神经元往往同时参与表示多个概念;Anthropic 在 2024 年 5 月用字典学习(一种稀疏分解方法)从 Claude 3 Sonnet 中提取出数百万个特征,例如一个对多种语言的「金门大桥」文字和图片都会激活的特征。对机器人来说,它关系到调试与安全:2025 年伯克利团队在 π0-FAST、OpenVLA 内部找到对应「快/慢」「高/低」的语义方向,推理时调整这些激活就能实时改变机器人动作,无需微调或奖励信号。
例子伯克利团队在 UR5 机械臂上运行 π0-FAST 搬运玩具,推理时增强模型内部与「快」相关的激活,机械臂移动得更快;增强与「低」相关的激活,搬运轨迹的最高点就变低,模型权重始终不变。
- 也叫
- 机制可解释性、Mechanistic Interpretability、可解释 AI、Explainable AI
- 相关
- 视觉-语言-动作模型、大语言模型、神经网络、具身安全、不确定性估计
- 来源
- Mapping the Mind of a Large Language Model(Anthropic, 2024-05)
Mechanistic interpretability for steering vision-language-action models (arXiv:2509.00328) - 信息截至
- 2025-08