价值函数
Value Function常用估计「从当前状态出发、按某策略做下去,未来总共能拿多少奖励」的函数。
价值函数是强化学习的核心概念。状态价值函数 V(s) 表示从状态 s 出发、一直按策略 π 行动的期望回报(未来奖励的折扣累加);Q 函数 Q(s,a) 是先执行动作 a 再按策略走的期望回报;A=Q−V 叫优势函数,衡量某个动作比平均水平好多少。有了它就能判断哪些状态、动作更值得追求。演员-评论家(Actor-Critic)架构把策略和价值结合:演员是策略网络,负责出动作;评论家是价值网络,给动作打分、提供优势信号来更新演员,PPO、SAC、TD3 都属于这一类。具身智能里,价值函数还被用来筛选数据、给 VLA 做强化学习,如 π*0.6 的 RECAP 方法。
例子π*0.6 训练了一个价值函数,预测「离任务成功还剩多少步」(失败轨迹给很低的值),据此算出每个动作的优势,告诉策略哪些动作更好。
- 也叫
- 状态价值函数、V 函数、Critic、评论家、演员-评论家、Actor-Critic、行动者-评论家
- 相关
- Q 函数、优势函数、贝尔曼方程、时序差分学习、回报、非对称演员-评论家
- 来源
- OpenAI Spinning Up: Key Concepts in RL(Value Functions)
Hugging Face Deep RL Course: Advantage Actor-Critic (A2C)
π*0.6: a VLA That Learns From Experience (arXiv 2511.14759)