具身智能新手名词表English

分布式价值函数

Distributional Value Function进阶

不只预测平均回报,而是预测未来回报完整概率分布的价值函数。

普通价值函数只输出未来回报(累计奖励)的期望值;分布式价值函数输出回报各种可能取值的完整分布。DeepMind 的 Bellemare、Dabney、Munos 在 2017 年 ICML 论文中系统提出这一视角,给出分布式贝尔曼方程和 C51 算法(用 51 个离散取值点表示回报分布),在 Atari 上取得当时最好成绩。常见实现是把回报切成若干区间,网络输出每个区间的概率,用交叉熵训练,比直接回归一个数更稳定,也能反映不确定性。近年的 VLA 强化学习方法常用它当评价器(critic)。

例子Physical Intelligence 的 π*0.6(RECAP)训练了一个多任务分布式价值函数:把「距成功还剩多少步」的回报离散成若干区间、用交叉熵训练,再据此估计优势来筛选好动作;智元等团队的 LWD(2026)也用分布式隐式价值学习(DIVL)处理机群采回的稀疏奖励数据。

也叫
分布式强化学习、Distributional RL、分布型价值函数、价值分布、Value Distribution
相关
价值函数、贝尔曼方程、回报、RECAP、π*0.6、交叉熵
来源
A Distributional Perspective on Reinforcement Learning (arXiv:1707.06887)
π*0.6: a VLA That Learns From Experience (arXiv:2511.14759)
Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies (arXiv:2605.00416)
信息截至
2026-09

在完整名词表里查看 →