A10 · 第 4 章 · 第二编 控制与策略
策略梯度与 actor–critic
由轨迹概率的 score-function 恒等式推导策略梯度和 return-to-go,证明动作无关 baseline 不改变期望,构造优势 actor–critic 更新,并分析评论器偏差、梯度方差、on-policy 数据约束与诊断指标。
报告页面错误本章目标
- 从参数化轨迹分布和对数导数技巧推导episodic策略梯度估计。
- 用因果性把整条回报替换为return-to-go,并保持折扣索引一致。
- 证明仅依赖状态的baseline期望贡献为零,并解释其方差作用。
- 用价值评论器构造TD优势,分别完成actor和critic的数值更新。
- 解释Monte Carlo与自举优势的方差偏差权衡以及on-policy数据要求。
本页目录
直接优化随机策略的期望回报
参数化策略 给定状态上的动作分布。有限回合轨迹记为
其概率可分解为
初始分布和环境转移在标准无模型设定中不依赖 ,参数只进入策略。定义相对折扣return-to-go
并以 为目标。策略梯度是对期望回报求导,不要求奖励函数本身对参数可微;环境可以是未知模拟器或真实交互过程,但必须能从当前策略采样。
score-function把分布导数变成样本梯度
对离散轨迹求和或连续轨迹积分,在可交换微分与期望等正则条件下,使用 :
环境概率从最后一行消失,是因为它不含策略参数,不是因为环境不影响轨迹。动作概率必须在采样它的策略下可计算;确定性argmax的对数概率梯度不能直接代入该估计。
动作一概率为 ,奖励为二;动作零奖励为零。期望目标是 ,解析梯度为 。初值 时 ,真梯度为 。
若本次采到动作一,,样本梯度为 ;若采到动作零,回报为零,样本梯度为零。二者各以一半概率发生,期望正好为 。本次采到动作一且学习率 时,梯度上升使 从零变为 ,新概率约为 。单次更新比真梯度步大,体现采样方差。
对softmax策略,设logits为 ,选中动作 时
所有分量之和为零,更新会相对抬高所选动作并压低其他动作,而不是把概率当作彼此独立参数。若直接对已经归一化的概率做无约束加法,可能得到负数或总和不为一。
三个logit初值均为零,所以概率均为三分之一。本次选中动作二,优势权重为三,则score向量为 ,策略梯度样本为 。
学习率 的梯度上升把logits更新为 。重新softmax后,动作概率约为 ,总和仍为一。若优势为负三,更新方向完全反转,所选动作概率会降低。
因果性允许只保留动作之后的奖励
在时刻 之前已经发生的奖励不可能被 改变。它乘以当前动作score的条件期望为零,因此可以从该时刻的权重中去掉,得到
是相对于回合起点的绝对折扣未来回报。某些实现省略外部 ,对应不同的状态访问加权约定;必须把目标和估计器成对写清,不能一边声明起点折扣目标、一边静默改变权重。
return-to-go不会改变同一目标下梯度的期望,却删除与当前动作无因果关系的随机奖励,通常降低方差。它仍包含动作后的环境噪声,长回合估计可能很不稳定。
一条三步轨迹奖励为 ,。先算 ,,。绝对折扣权重依次为 。
若三个标量score分别为 ,return-to-go估计为 。把整条 乘每个score会得到 。单条轨迹数值不同,但在正确采样下被删除的过去奖励项期望为零。
状态baseline不改变梯度期望
从每步权重中减去只依赖状态的 :
给定状态后,baseline项的动作期望为
因此动作无关baseline不改变期望,若接近条件回报均值可降低方差。baseline可以由另一个网络学习,但在actor更新中通常停止其梯度;否则会混入未由上式支持的额外项。依赖所选动作的baseline一般不能直接相减,除非加入相应校正。
某状态动作一概率 ,本次选中动作一,score为 ,回报为五。无baseline梯度样本为 ;取状态baseline三后变为 。学习率 时参数增量从 降到 。
baseline零期望可直接核对:动作一score为 ,动作零score为 ,所以 。这不保证每条样本绝对值都变小;不合适的baseline也可能增加方差。
actor–critic用价值估计构造优势
状态价值评论器 估计当前策略从状态出发的期望回报。优势
衡量动作相对该状态平均水平的好坏。一步TD误差
可作为优势样本。actor做梯度上升 ;critic回归自举目标,更新 。两个更新目标、学习率和停止梯度边界必须分开。
当前 ,观测奖励 ,下一状态 ,,转移未终止。TD目标为 ,优势样本 。
若actor的score向量为 、学习率 ,参数增量为 。若critic在该状态只有标量参数且 ,用目标减预测方向、学习率 ,则 从 更新到 。终止时目标应只剩 ,两项更新方向可能随之改变。
critic若与actor共享表示,actor损失和价值损失都会更新共享参数。此时“停止优势梯度”只阻止actor通过优势数值反向进入critic输出,不会阻止两个明确损失共同训练共享主干。实现应分别记录各损失对共享层的梯度范数,防止价值误差在尺度上淹没策略信号。
评论器训练数据必须来自与优势相同的奖励、折扣和终止合同。用未来完整回报训练 、却在actor中把时间截断当终止,会产生不同价值定义。critic在训练批量上的误差很低也可能过拟合,应按状态访问频率和独立轨迹检查校准。
方差和偏差来自不同选择
完整Monte Carlo return-to-go不依赖价值自举,在数据确由当前策略采样且目标权重一致时给出无评论器近似偏差的score估计,但长回合奖励噪声会造成高方差。一步TD优势方差通常较低,却依赖 ;评论器错误和自举会引入偏差,并可能让actor强化错误动作。
步回报在真正奖励与末端价值之间折中。广义优势估计把不同步长TD残差按参数 加权;较小 更依赖评论器,较大 更接近长回报。所谓偏差与方差方向是一般机制,实际大小还取决于任务、评论器训练和截断处理,需用重复轨迹测量。
优势标准化会改变一个有限批量的更新尺度和样本权重,通常有助于数值调节,但它不是baseline零期望证明本身。跨批比较时应记录标准化方式;批量很小时样本均值方差也可能不稳定。
on-policy要求数据与当前策略对应
上述期望以 为前提。若轨迹由旧策略或另一行为策略 产生,直接把当前 乘旧回报通常有分布偏差。重要性比率可校正动作概率:;完整轨迹比率是多个比率之积,可能随长度产生巨大方差,并要求目标策略有正概率的动作在行为策略下也有支持。
两步轨迹中,行为策略对已选动作的概率为 ,当前策略为 。逐步比率是 ,轨迹比率为 ;一个原值为三的轨迹梯度贡献经完整校正后变为 。
若某动作行为概率为 、当前概率为 ,单步比率已达二十,少数样本会主导估计;若行为概率为零,则无法由该数据校正。比率截断可控制方差,但会改变估计目标或引入偏差,必须和算法目标一起说明。
同一批on-policy轨迹做多轮参数更新后,后几轮使用的已不是严格由最新策略产生的数据。限制更新幅度、监测KL变化或重新采样可以控制偏离,但不能把任意经验回放直接称为on-policy。数据版本应保存采样策略参数或至少动作log概率,才能计算新旧比率。
回合边界和回报尺度决定优化对象
真正终止表示任务未来回报为零;时间上限截断可能只是观测被切断,若任务理论上继续,应在价值目标中保留适当自举。把二者合成一个done会系统性压低截断边界附近的价值。可变长度回合还会改变每回合和每时间步的加权:先对回合求和再平均,与把全部时间步平铺平均并不总等价。
奖励平移和缩放会改变策略梯度样本尺度。有限固定长度任务给每步奖励加常数时,若长度受策略影响,还会改变对长短轨迹的偏好;不能只把它看成无害baseline。奖励归一化、优势标准化和梯度裁剪都应纳入算法合同,并用未变换的原始任务指标评价。
连续任务常用折扣状态访问分布或平均奖励目标,梯度定理的权重随目标定义改变。本章公式针对从初始分布开始的折扣回合;迁移到持续任务前,必须重写目标和采样分布,而不是只删除终止标志。
批量估计要保留轨迹结构
一批包含多个不同长度回合时,先在每条轨迹内从后向前计算return-to-go和终止mask,再汇总score项。padding位置不能贡献回报、熵或critic损失。若环境向量化并在某个槽位终止后立即重置,重置状态属于新回合,不能沿旧回合继续递推回报。
优化器看到的是有限批量平均梯度。批量增大通常降低采样波动,却增加收集延迟,使数据相对当前策略更陈旧;批量减小则让单个异常回报主导更新。记录有效时间步数、回合数和每轮更新次数,才能比较不同配置的样本预算。
策略分布和数值实现也有边界
离散策略常从logits经softmax得到概率,应使用稳定log-softmax计算选中动作对数概率。连续动作可用高斯等可微密度;若再经tanh限制范围,变换后的log概率必须包含Jacobian修正。动作裁剪和概率分布截断不是同一操作,静默裁剪会让环境收到的动作与计算log概率的动作不一致。
策略过早接近确定性会降低探索,并让未选动作缺少梯度样本。熵奖励可加入原目标,鼓励一定随机性;它是额外目标项,不是无偏baseline。其系数、退火和动作维度归约都会改变更新尺度。
诊断同时检查策略、评论器和数据
每批记录回报分布、回合长度、策略熵、新旧策略KL、概率比率分位数、score范数、优势均值方差、critic误差和价值范围。actor改善而critic损失暂升不一定失败,critic损失下降也不保证策略改善;两者必须与独立策略回报结合。
评价时冻结策略和归一化统计,明确使用随机采样还是确定性均值动作。训练数据来自当前随机策略,部署若改成argmax或均值,评价对象已改变。至少跨多个算法种子和环境种子报告中心与离散程度,并检查约束违例,不能只选择最高回报轨迹。
练习
从轨迹期望推导最基本的策略梯度。
查看提示
查看解答
说明为何可以用未来回报替代整条回报。
查看提示
查看解答
证明状态baseline不改变策略梯度期望。
查看提示
查看解答
写出一条转移上的两套参数更新。
查看提示
查看解答
比较REINFORCE和一步actor–critic的估计误差。
查看提示
查看解答
解释为何普通策略梯度不能任意使用经验回放。
查看提示
查看解答
概念关系
- 马尔可夫决策过程 定义轨迹、回报和策略分布。
- 梯度 提供参数方向导数与链式法则。
- 期望、方差与协方差 支持无偏性和方差降低分析。
- 动态规划、蒙特卡洛与时序差分 提供价值自举与TD误差。
- Q-learning 提供off-policy动作价值控制的对照。
- 基于模型与离线强化学习 延伸旧策略与固定数据支持问题。
- 强化学习综合复习 比较策略、价值和模型方法。
资源
Reinforcement Learning: An Introduction, Second Edition
Richard S. Sutton, Andrew G. Barto
用于核对 A10 的定义、Bellman 推导、经典算法与收敛条件;高级离线与多智能体内容另标研究边界。
打开官方来源Stanford CS229 Course Materials
Andrew Ng
用于核对经典机器学习模型的目标函数、推导和适用前提。
年份未在已核验来源中明确提供,登记为“暂无可核实信息”;未作推测性补写。打开官方来源Sutton 与 Barto 第二版用于核对策略梯度定理、REINFORCE、baseline 与 actor–critic 更新;Stanford CS229 材料用于核对似然梯度、随机优化和验证协议。本章的无偏估计与方差降低结论按前者条件陈述,后者只支持优化和统计评价部分。