斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第16讲:强化学习基础
外来客 • 2026-09-02 08:21:52
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 16: Fundamentals of RL)
🎯 核心概述
本系列内容系统阐述了强化学习从依赖精确动力学模型的动态规划方法,向基于环境交互的模型无关学习方法演进的逻辑脉络。通过引入马尔可夫决策过程(MDP)基础、贝尔曼方程及蒙特卡洛(MC)与时间差分(TD)学习的对比分析,揭示了在未知环境下利用采样近似期望回报的核心机制。内容进一步探讨了探索与利用的根本权衡,确立了以“策略评估”与“策略改进”交替进行的广义策略迭代框架,并以黑杰克游戏为例,展示了如何通过增量均值更新和 Epsilon-Greedy 策略实现从随机交互到最优策略收敛的完整闭环,为理解大规模状态空间下的函数近似学习奠定了理论基础。
📐 基础理论架构
- 马尔可夫决策过程定义:MDP 由五元组构成,包括状态空间、动作空间、状态转移概率函数、奖励函数以及折扣因子(取值介于 0 到 1 之间)。该框架假设当前状态的演化仅依赖于前一时刻的状态与动作,满足马尔可夫性质。
- 贝尔曼方程体系:值函数满足固定点方程结构。对于任意给定策略 $\pi$,其状态价值函数对应贝尔曼期望方程;而最优值函数 $V^*$ 则关联贝尔曼最优性方程。Q 函数通过定义状态-动作对的价值,允许在状态下隐式地通过最大化 Q 值来定义最优策略。
- 精确方法的局限性:动态规划中的值迭代与策略迭代被称为“精确方法”,因为它们直接利用系统底层的动力学模型进行更新。然而,这类方法需要遍历所有状态-动作对,导致在高维空间下内存消耗巨大且收敛速度缓慢,严重依赖已知的转移概率知识,难以应用于复杂现实环境。
🎲 模型无关学习机制
- 蒙特卡洛方法原理:MC 方法通过经验均值近似期望回报,直接基于完整轨迹片段进行学习,无需预知状态转移概率。它仅适用于具有终止条件的分段 MDP,分为“首次访问”(忽略同一回合内重复访问)和“每次访问”(将重复访问视为独立样本)两种变体。随着交互样本量的增加,估计值收敛至真实期望值。
- 时间差分学习对比:TD 学习与 MC 方法的核心差异在于备份机制。MC 需等待完整轨迹结束,属于无偏但高方差的估计;而 TD 基于单步奖励加未来价值猜测(自举),引入偏差但显著降低方差。TD 允许在回合结束前进行在线更新,适用于非终止环境,通过调整备份宽度与高度实现不同粒度的价值近似。
- 增量均值更新机制:为避免存储所有历史奖励并重新计算均值带来的计算开销,采用增量方式更新期望回报。新估计值等于前次估计加上向新观测方向迈出的步长($\alpha$),形式类似梯度下降。该机制支持在线逐步修正偏差,无需等待完整回合结束即可实时更新价值函数估计。
🃏 黑杰克应用实例
- 状态空间建模:以黑杰克游戏为例构建 MDP 模型。状态包含玩家手牌总和(12-21)、庄家明牌数值以及玩家是否持有可用的 Ace;动作空间定义为“站”(停止要牌)或“击”(继续要牌)。奖励函数根据最终胜负结果设定,体现了典型的零和博弈特征。
- 策略评估过程:给定一个基础策略(如总和≥20时站立,否则击牌),通过蒙特卡洛采样进行策略评估。实验对比了 1 万回合与 50 万回合的估计结果,显示增加交互回合数可显著降低价值函数估计的噪声,使网格状的价值分布更接近真实理论值。
- 最优策略收敛:在无先验知识的情况下,结合蒙特卡洛 Q 函数评估与 Epsilon-Greedy 改进算法,智能体能够逐步收敛至最优策略。最终策略根据是否有可用 Ace、手牌总和及庄家明牌的组合,明确决定“站”或“击”,展示了从随机探索到确定性最优决策的演化过程。
⚖️ 探索与利用权衡
- 贪心策略缺陷:若仅使用确定性贪心算法进行策略改进,智能体将始终选择当前估计值最高的动作(如示例中奖励为 1 的右门),导致其他潜在高价值动作(左门)永远无法被访问和评估。这种局部最优陷阱阻碍了对状态-动作空间的有效覆盖,使得价值函数估计存在系统性偏差。
- Epsilon-Greedy机制:为解决探索问题,引入随机性以平衡利用与探索。该策略以概率 $1-\epsilon$ 执行贪心动作(取 Q 函数最大值),以概率 $\epsilon$ 随机选择任意动作。这种机制确保所有动作在长期运行中具有非零的尝试概率,从而保证价值估计的全局收敛性。
- 算法统一视角:所有强化学习算法可抽象为统一的“骨架”结构,包含三个核心过程:通过交互生成样本、基于样本进行计算(估计价值或拟合模型)、利用计算结果改进策略。无论是 MC 还是 TD,其本质差异仅在于采样近似期望的方式不同,而非框架结构的根本改变。
🔄 广义策略迭代框架
- 交替优化结构:强化学习算法通常遵循“策略评估”与“策略改进”交替进行的广义策略迭代结构。传统动态规划依赖动力学知识进行精确计算;而模型无关方法结合 MC 或 TD 技术,可在无动力学情况下通过环境交互完成价值估计与策略优化。
- 从精确到近似演进:算法演进路径清晰展示了从依赖转移动态知识的精确方法(策略迭代/价值迭代),过渡到通过交互学习的蒙特卡洛和时间差分学习的过程。这一演进解决了大状态空间下的计算不可行性问题,为后续探讨基于价值的方法、策略优化及基于模型的方法提供了基础范式。
- 函数近似展望:针对大规模状态空间问题,后续课程将深入探讨如何结合函数近似技术处理高维输入。通过参数化值函数或 Q 函数,智能体能够泛化未见过的状态,克服表格法在记忆容量上的限制,实现更高效的策略学习与优化。
💡 核心结论
- 模型无关必要性:针对未知动力学环境,必须采用基于采样的近似方法克服精确算法对模型知识的依赖。蒙特卡洛策略评估通过累积轨迹奖励并计算经验均值来估计状态值函数,是模型无关学习的基础范式。
- 探索机制关键性:Epsilon-Greedy 策略解决了确定性策略导致的局部最优问题,确保了智能体能够充分探索状态动作空间。这是实现从随机交互到最优策略收敛的关键环节,也是构建可行强化学习算法的必要条件。
- 框架通用性价值:理解“采样—计算—改进”这一通用框架有助于系统化掌握不同强化学习算法的本质差异与共性。无论是基于价值的迭代还是未来的策略梯度优化,均遵循此逻辑结构,为处理复杂决策问题提供了统一的理论视角。
👤 同一博主
斯坦福大学网络研讨会:转化医学的未来对话
当AI不再是项目:将技术转化为患者与医疗提供者的实际价值
斯坦福大学AA203最优控制与基于学习的控制课程(2026春季)第19讲:基于模型的强化学习
斯坦福大学AA203最优与基于学习的控制课程2026春季学期第18讲:强化学习策略优化
斯坦福大学AA203最优与基于学习的控制课程 | 2026春季学期 | 第17讲:强化学习价值型方法
斯坦福大学 AA203 最优与基于学习的控制课程(2026 春季学期)第 15 讲:模仿学习
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第14讲:模仿学习与强化学习导论
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第13讲:学习导论
斯坦福大学AA203最优控制与基于学习的控制课程 | 2026春季学期 | 第12讲:模型预测控制的
斯坦福大学AA203最优控制与基于学习的控制课程 | 2026春季学期 | 第11讲:模型预测控制(
🧭 类似博主
-
2026 美国大学申请三大趋势:AI 元年、小文书取消、标化考试回归?
-
女性约会建议日益黑暗:有毒游戏、巫术与操控
-
特雷·杨(Trae Young)的经典高光时刻集锦
-
智利矿难救援内幕(完整版)| 灾难见证 | 国家地理
-
法医专家对费城失踪女性案件调查表示“着迷
-
1812年美国入侵加拿大失败(纪录片)
-
中国古代拜的“龙”,其实不存在?考古学家揭秘:为什么几千年前的殉葬坑里,会挖出“龙”的骨骼? | 圆
-
婆罗门参日出而作 午前而息 因此有了“午睡花”的绰号《秘境花园》02【CCTV纪录】
-
2000年前的秦始皇到底長啥樣?秦陵陪葬墓曝光他的真實長相,專家看到後當場嚇傻!#圆桌派 #许子东
-
踏上這樣一段旅程,是他的宿命。
0 条评论
发表评论
请先 登录 后参与讨论。