博主头像

斯坦福大学AA203最优与基于学习的控制课程2026春季学期第18讲:强化学习策略优化

外来客 • 2026-08-21 19:02:44

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 18: RL Policy Optimization)

🎯 强化学习策略优化核心机制

  • 课程进入强化学习策略优化阶段,区别于基于价值的方法,策略优化通过参数化策略 $\pi_\theta$ 显式表示策略,并直接最大化强化学习目标函数。
  • 将强化学习问题转化为关于策略参数 $\theta$ 的优化问题,采用梯度上升法求解,策略梯度本质上是最大似然估计梯度的加权版本,权重为轨迹的累积奖励,旨在增加高奖励轨迹出现的概率。
  • 轨迹分布 $p(\tau)$ 由初始状态分布、策略分布和转移动态分布因子化构成,其中策略分布依赖于参数 $\theta$,利用恒等式 $\nabla_\theta p(\tau) = p(\tau) \nabla_\theta \log p(\tau)$ 将梯度表达式转化为期望形式,消除对未知动态的直接依赖。
  • 对轨迹分布取对数后,仅策略项 $\log \pi(a_t|s_t)$ 包含参数 $\theta$,初始状态和转移动态项在求梯度时消失,最终策略梯度估计器为轨迹奖励总和与策略对数概率乘积的期望,可通过采样 $n$ 条轨迹计算经验均值来近似。
  • REINFORCE 算法基于此推导,通过蒙特卡洛方法估计回报并更新策略参数,属于无模型学习策略,策略优化通过试错机制,使高绩效行为更可能,低绩效行为更不可能,形式化了基于奖励的学习过程。

📉 策略梯度方差问题与成因

  • 当前策略梯度估计器存在极高方差,导致学习信号不稳定、训练收敛慢及性能下降,是主要局限性,高方差源于对回报(Return)的样本估计受随机性影响,且未中心化的回报会导致梯度方向偏差。
  • 降低方差是策略优化研究的核心目标,旨在提升样本效率与训练稳定性,策略优化天然支持连续与离散动作空间,通过参数化策略(如高斯分布)直接优化,无需像价值方法那样求解复杂的 argmax 优化问题。
  • 优化目标直接对强化学习目标(折扣奖励和)进行梯度上升,中间步骤的改进程度清晰可量化,策略类型属于 On-policy 算法,必须使用当前策略生成的经验数据,样本效率相对较低。

🛠️ 方差缩减策略与基线引入

  • 因果性技巧仅累加当前时刻 $t$ 及之后的奖励,排除当前动作无法影响的过去奖励,减少求和项数以降低方差,基线(Baseline)引入从回报中减去基线 $B$ 以中心化数据,使优于平均的行为概率增加,劣于平均的行为概率降低。
  • 无偏性证明数学推导表明,减去基线项的期望值为零,因此不改变梯度估计的期望值,即在无偏前提下免费降低方差,基线选择常用轨迹平均回报作为基线,能显著加速简单环境下的训练收敛。
  • Actor-Critic 方法旨在融合策略优化与基于价值方法的优点,通过同时维护策略网络(Actor)和评价网络(Critic)来降低策略梯度的方差,核心思想是结合策略梯度与价值方法,用参数化函数(Critic)拟合期望回报,替代高方差的样本回报估计。
  • 基线优化将基线设为状态价值函数 $V(x_t)$,即策略下 Q 函数的期望值,优势函数(Advantage Function)是核心概念,定义为动作价值与状态平均价值之差,用于衡量特定动作相对于平均水平的优势。

🤖 Actor-Critic 架构与 A2C 实现

  • 在连续分布或高维空间中,直接拟合 Q 函数复杂度较高,因此通常采用 A2C(Advantage Actor-Critic)架构,仅拟合状态价值函数 $V(s)$ 来近似优势,A2C 实现技巧为避免同时拟合 Q 函数和 V 函数,利用近似公式 $Q(s,a) \approx r + V(s')$,将优势重写为仅依赖状态价值函数 $V$ 的形式,从而简化网络结构。
  • 该框架的理论基础与拟合 Q 学习(Fitted Q-learning)一致,均通过最小化预测误差来拟合参数,但 Actor-Critic 显式地利用价值函数进行策略梯度更新,价值函数的拟合可通过蒙特卡洛(MC)或时序差分(TD)学习实现,具体选择取决于数据效率和偏差-方差权衡。
  • Actor-Critic 方法通过解耦策略学习与价值评估,解决了纯策略优化方差大和纯价值方法策略隐式定义的问题,尽管深度强化学习缺乏收敛性证明的理论保证,但 A2C 等算法在复杂任务中的成功证明了其工程有效性。

🏆 AlphaGo 案例验证与工程实践

  • 2014 年 AlphaGo 项目成功应用了 Actor-Critic 架构,其中策略网络映射棋盘状态到动作分布,价值网络映射状态到标量价值,AlphaGo 通过自我博弈(Self-play)收集数据,使用策略梯度更新策略网络,其中基线(Baseline)采用状态价值函数 $V(s)$ 以减少方差。
  • 行为克隆的影响早期版本通过行为克隆(Behavior Cloning)初始化,但后续研究表明该步骤对最终性能有负面影响,纯自我博弈学习效果更佳,搜索增强 AlphaGo 并非仅从策略分布采样,而是利用策略分布引导蒙特卡洛树搜索(MCTS),这是其超越纯 RL 算法的关键贡献。
  • 该框架为理解现代深度强化学习算法提供了基础,后续课程将延伸至基于模型的强化学习方法,策略优化通过试错机制,使高绩效行为更可能,低绩效行为更不可能,形式化了基于奖励的学习过程。

⚖️ 策略优化特性与理论局限

  • 动作空间天然支持连续与离散动作空间,通过参数化策略(如高斯分布)直接优化,无需像价值方法那样求解复杂的 argmax 优化问题,优化目标直接对强化学习目标(折扣奖励和)进行梯度上升,中间步骤的改进程度清晰可量化。
  • 策略类型属于 On-policy 算法,必须使用当前策略生成的经验数据,样本效率相对较低,当前策略梯度估计器存在极高方差,导致学习信号不稳定,是主要局限性,后续将讨论降低策略梯度方差的策略,以改善算法稳定性。
  • 策略优化通过试错机制,使高绩效行为更可能,低绩效行为更不可能,形式化了基于奖励的学习过程,Actor-Critic 方法通过解耦策略学习与价值评估,解决了纯策略优化方差大和纯价值方法策略隐式定义的问题。
  • 尽管深度强化学习缺乏收敛性证明的理论保证,但 A2C 等算法在 AlphaGo 等复杂任务中的成功证明了其工程有效性,价值函数的拟合可通过蒙特卡洛(MC)或时序差分(TD)学习实现,具体选择取决于数据效率和偏差-方差权衡。

0 条评论

发表评论

请先 登录 后参与讨论。