斯坦福大学AA203最优与基于学习的控制课程 | 2026春季学期 | 第17讲:强化学习价值型方法
外来客 • 2026-09-02 08:21:08
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 17: RL Value-Based Methods)
📌 一句话概述
本内容系统梳理了强化学习中基于价值的方法(Value-Based Methods),深入解析了从时序差分(TD)学习基础到 SARSA、Q-Learning 算法的演进逻辑,并重点阐述了深度 Q 网络(DQN)如何通过经验回放与固定目标网络解决高维状态空间下的训练稳定性难题。
🧠 核心概念与理论基础
- 价值方法本质:基于价值的强化学习通过近似动作价值函数 $Q(s, a)$ 来实现策略评估与改进,其核心在于平衡探索(Exploration)与利用(Exploitation)。
- 蒙特卡洛与时序差分对比:
- 蒙特卡洛(MC):需等待回合终止以计算完整回报,方差较低但无法在线更新;在存在循环策略或无限回合的环境中易失效。
- 时序差分(TD):通过单步自举(Bootstrapping)利用当前估计值更新下一状态的价值,支持在线学习且无需完整回合数据,显著降低了估计方差对长序列的依赖。
- 同策略与异策略机制:
- 同策略(On-policy):行为策略与目标策略一致,如 SARSA 算法,评估的是实际执行策略的性能。
- 异策略(Off-policy):允许行为策略(用于探索)与目标策略(用于优化)解耦,如 Q-Learning,能够利用历史数据或人类观察进行学习,提高样本效率。
📊 SARSA 算法机制与特性
- 更新规则:SARSA 基于五元组 $(s_t, a_t, r_{t+1}, s_{t+1}, a_{t+1})$ 进行 TD 备份更新。其目标值依赖于实际选择的下一动作 $a_{t+1}$,而非理论上的最优动作。
- 策略一致性:作为同策略算法,SARSA 使用 $\epsilon$-greedy 策略既用于环境交互(行为),也用于价值评估(目标)。这意味着它学习的是“在包含随机探索行为的策略下”的最优路径。
- 风场网格案例表现:在存在向上推力的风场环境中,SARSA 收敛至一个稳健策略(先抵顶再折返),有效规避了因风力导致的不可控漂移风险。相比之下,MC 方法因无法保证回合终止且易受循环限制,在此类动态环境中表现受限。
🚀 Q-Learning 算法机制与对比
- 核心创新:Q-Learning 引入了策略分离概念,设定目标策略为基于 $Q$ 函数的纯贪婪策略($\arg\max_a Q(s, a)$),而行为策略保持 $\epsilon$-greedy。这使得算法能够学习最优确定性策略,即使实际执行过程中包含随机探索噪声。
- TD 目标重构:通过代数变换,Q-Learning 的 TD 目标定义为奖励加上折扣后的最大 $Q$ 值($\max_u Q(s', u)$),取代了 SARSA 中基于实际下一动作的更新方式。
- 收敛性保证:在满足特定正则性假设(如有限状态/动作空间、充分探索)下,Q-Learning 可证明收敛至最优动作价值函数及策略。
⚖️ SARSA vs. Q-Learning 实验对比
- 悬崖环境测试:在无风但含悬崖(奖励 -100)的网格世界实验中,两种算法表现出显著的路径差异。
- SARSA(蓝色路径):收敛至最优 $\epsilon$-greedy 策略。由于考虑了探索时的随机性,其路径更靠近天花板以规避风险,训练期间累积奖励较高。
- Q-Learning(红色路径):收敛至纯贪婪策略。其最终路径紧贴悬崖边缘以最大化效率,但在训练阶段因频繁落入悬崖导致累积奖励较低。
- 性能差异解读:SARSA 在记录 $\epsilon$-greedy 执行结果时表现优于 Q-Learning,因为它优化的是“带噪声”的执行过程;而 Q-Learning 追求理论上的最优确定性路径,牺牲了训练过程中的安全性以换取最终策略的最优性。
📈 函数近似与高维扩展
- 维度灾难解决:针对高维状态空间(如围棋 $10^{170}$ 种配置),摒弃传统的查表法(Lookup Table),采用参数化函数 $\theta$ 近似价值函数。这不仅压缩了内存需求,还实现了跨状态的泛化能力。
- 回归视角更新:将强化学习过程转化为最小化预测值与真实值误差的回归问题。利用蒙特卡洛回报或 TD 目标作为回归标签,通过梯度下降更新网络参数 $\theta$。
- 计算优化策略:在离散动作空间中,若 $Q$ 函数能一次性输出所有动作的值,可将贪婪策略的选择从多次查询简化为单次查找(Argmax over outputs),显著提升计算效率。
🧩 深度 Q 网络(DQN)架构与机制
- CNN 引入强化学习:DQN 将卷积神经网络(CNN)作为函数近似器,直接从原始环境图像输入中学习控制策略。这解决了 Atari 游戏等复杂视觉环境的优化问题,实现了端到端的感知与控制。
- 架构特征:采用 CNN 处理图像状态代理,输出当前状态下所有可能动作对应的 $Q$ 值,属于深度价值函数近似方法。
🛡️ DQN 稳定性关键技术
- 经验回放(Experience Replay):
- 问题背景:在线交互数据具有高度时间相关性,违反独立同分布(i.i.d.)假设,导致梯度更新不稳定。
- 解决方案:将转移数据 $(s, a, r, s')$ 存入大型缓冲区(Replay Memory),通过随机采样打破时间相关性,优化回归效果并提高样本利用率。
- 固定目标网络(Fixed Target Network):
- 问题背景:参数更新导致回归目标动态变化(Moving Target Problem),使得训练过程难以收敛。
- 解决方案:维护两套 $Q$ 函数网络参数 $\theta$(在线网络)和 $\phi$(目标网络)。在训练阶段保持 $\phi$ 固定以稳定 TD 目标,随后定期将 $\phi$ 同步为 $\theta$ 的副本或采用 Polyak 平均法进行平滑更新。
📝 结论与后续方向
- 算法演进逻辑:从 MC 到 TD,再到 SARSA/Q-Learning,最后至 DQN,强化学习价值方法经历了从离线到在线、从查表到函数近似、从离散到低维到高维视觉输入的逐步深化过程。
- 关键技术贡献:经验回放与固定目标网络是使深度强化学习算法在实际应用中成功的关键技术贡献,解决了深度学习在非平稳数据环境下的训练稳定性难题。
- 后续课程展望:价值方法讨论至此结束,后续内容将转向无模型策略优化方法及基于模型的强化学习方法,进一步探索直接优化策略或构建环境模型的路径。
👤 同一博主
斯坦福大学网络研讨会:转化医学的未来对话
当AI不再是项目:将技术转化为患者与医疗提供者的实际价值
斯坦福大学AA203最优控制与基于学习的控制课程(2026春季)第19讲:基于模型的强化学习
斯坦福大学AA203最优与基于学习的控制课程2026春季学期第18讲:强化学习策略优化
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第16讲:强化学习基础
斯坦福大学 AA203 最优与基于学习的控制课程(2026 春季学期)第 15 讲:模仿学习
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第14讲:模仿学习与强化学习导论
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第13讲:学习导论
斯坦福大学AA203最优控制与基于学习的控制课程 | 2026春季学期 | 第12讲:模型预测控制的
斯坦福大学AA203最优控制与基于学习的控制课程 | 2026春季学期 | 第11讲:模型预测控制(
🧭 类似博主
-
最强雨伞”与“靴用雨衣”:让银周假期出行更舒适的最新防雨好物【N站解说】|TBS NEWS DIG
-
《新城崛起》向新:新城崛起离不开持续创新 3人初创团队用两年时间打破海外专利 让老百姓用得起高端救命
-
方舟子时评:人工智能的危险究竟会有多大?
-
灾难性后果”:伊朗AI驱动的网络威胁引发警报
-
iOS 27 螢幕觸控凍結?觸控部分失效實測|觸發條件與重啟解法
-
美国喊AI减速,华为反而踩油门,昇腾960发布时间提前三个季度|今日华尔街
-
警察无人机如何当场抓获嫌疑人
-
用AI智能体几分钟内打造完整服装品牌(无需编程)
-
OpenAI研究员谈智能体集群与递归自我改进
-
用意念重塑触觉体验:尼古拉斯·哈托波洛斯(Nicholas Hatsopoulos)访谈
0 条评论
发表评论
请先 登录 后参与讨论。