斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第14讲:模仿学习与强化学习导论
外来客 • 2026-09-02 08:22:43
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:Stanford AA203 Optimal and Learning-Based Control | Spring 2026 | Lecture 14: Intro to IL and RL)
🎓 自适应控制理论回顾
- 系统辨识基础:将数据收集过程视为回归问题,利用线性回归等统计方法近似未知的动力学模型。这一过程旨在从观测数据中提取系统的数学描述,为后续控制策略提供依据。
- MRAC(模型参考自适应控制)机制:属于直接自适应方法,核心目标是调整控制器参数以跟踪给定的参考信号。其稳定性分析依赖于 Lyapunov 理论,需证明耦合系统(被控对象与自适应律)的整体稳定性。
- 激励条件约束:在 MRAC 中,若参考信号过于简单,会导致参数不可辨识;若信号过于复杂,则必须满足持续激励(Persistent Excitation)条件才能准确估计真实物理参数。这一限制使得 MRAC 在特定动态环境下应用受限。
- MIAC(模型识别自适应控制)架构:结合系统辨识与控制器设计,将模型估计作为内环反馈。分为“确定性等价”方法(完全信任点估计值)和“谨慎方法”(维护参数的不确定性分布)。相比 MRAC,MIAC 结构更灵活,但由于依赖对未知参数的准确估计,其稳定性保证更为复杂且难以推导。
🤖 模仿学习与强化学习定位
- 范式转变:从经典控制理论转向端到端学习方法,旨在解决机器人、自动驾驶及大语言模型对齐中的部署难题。这一转变强调直接从数据中学习策略,而非依赖显式的物理建模。
- 模仿学习(IL)方法论:
- 行为克隆(Behavior Cloning):通过监督学习直接建立状态到控制的映射。其性能上限受限于专家数据的质量与覆盖范围。早期案例包括 20 世纪 80 年代末 CMU 的研究,利用小型神经网络将车辆图像映射至转向角。
- 逆强化学习(IRL):不直接克隆行为,而是从演示中估计奖励函数,进而反推最优策略。相比行为克隆,IRL 获得的奖励表示(如“靠近目标为优”)具有更强的泛化能力,能更好地应对环境配置的变化。
- 强化学习(RL)方法论:通过试错机制学习,利用评分函数评估动作优劣,无需明确的行为示范。其核心在于从交互数据中优化策略以最大化累积奖励。
- 技术基础与训练策略:两者均基于监督学习的最大似然估计或负对数似然最小化原理拟合输入输出映射。当前自主系统通常采用分层训练策略:先通过模仿学习获取初始可行策略,再利用强化学习进行微调以突破人类演示的性能瓶颈并优化特定目标。
⚠️ 模仿学习的局限与挑战
- 误差累积问题:与纯监督学习不同,模仿学习面临误差随时间指数级累积的风险。由于智能体在部署时可能进入训练数据未覆盖的状态空间(协变量偏移),微小的初始偏差会导致后续动作偏离专家轨迹,最终导致任务失败。
- 物理约束限制:直接映射状态到控制往往忽略底层物理动力学约束,可能导致生成的策略在真实世界中不可执行或不稳定。
- 数据分布偏移:部署时的状态分布往往偏离训练数据的支持范围。行为克隆假设测试时状态分布与训练时一致,但在闭环控制中,智能体的自身动作会改变后续状态分布,导致“分布 shift”问题,这是模仿学习泛化能力的主要瓶颈。
🔄 强化学习核心机制
- 马尔可夫决策过程(MDP)框架:RL 基于 MDP 建模,智能体与环境交互产生轨迹,包含状态、动作和奖励序列。策略通常表示为给定状态下动作的概率分布 $\pi(a|s)$。
- 信用分配难题:由于缺乏直接监督信号,仅依赖稀疏或延迟的奖励函数,智能体需解决如何归因长期结果到具体早期动作的问题。这种延迟反馈机制增加了学习难度。
- 数据非独立同分布(Non-IID):当前动作直接影响未来状态,导致采集的数据序列具有强相关性。这与传统监督学习中样本独立假设不同,直接应用标准梯度下降会导致训练不稳定,需引入经验回放等技术缓解。
- 探索新颖解法:RL 的独特优势在于能发现超越人类演示的新颖策略。例如在 Atari Pong 游戏中挖掘隧道策略,或在 AlphaGo 中击败李世石的第 37 手棋。此外,RL 擅长优化复杂物理任务目标,已成为四足机器人运动控制的事实标准。
📊 数学形式化与符号约定
- 符号体系差异:课程沿用最优控制文献记号,使用 $X$ 表示状态,$U$ 表示控制输入;区别于计算机科学社区常用的 $S$(State)和 $A$(Action)。这种选择有助于连接控制理论与机器学习领域。
- 优化目标定义:核心目标是最大化轨迹分布下的期望折扣未来奖励总和。引入折扣因子 $\gamma \in [0, 1)$ 作为数学技巧,既用于权衡即时与长期奖励的重要性,也确保无限时域问题的收敛性与可解性。
- 模型分类标准:根据是否显式学习环境动态模型,RL 算法分为基于模型(Model-based)和无模型(Model-free)两类。基于模型方法需先学习环境动力学 $P(s'|s,a)$,再利用规划或策略优化;无模型方法则直接从数据中学习价值函数或策略,无需显式模型。
🎯 价值函数与决策机制
- 状态价值函数 $V(s)$:衡量在特定策略 $\pi$ 下,从某状态出发预期获得的总奖励。它反映了该状态在当前策略下的“好坏”程度,是评估策略性能的基础指标。
- 动作价值函数(Q 函数)$Q(s,a)$:进一步评估在该状态下执行特定动作后的预期回报。相比 $V(s)$,Q 函数提供了更直接的决策机制,因为它包含了动作维度的信息。
- 最优策略提取:通过估计最优 Q 函数 $Q^*(s,a)$,智能体可通过对动作空间执行 $\arg\max$ 操作直接获取最优策略 $\pi^*$,无需显式优化策略参数。这种“隐式”策略表示简化了优化过程,尤其适用于离散动作空间。
- 算法分类与权衡:RL 算法分为基于模型和无模型两类。无模型方法又细分为直接优化目标的策略优化方法和隐式优化目标的基于价值的方法。选择算法需权衡样本效率、训练稳定性及环境特性(如离散/连续状态空间、有限/无限视界)。
📊 关键事实与论据分析
- MDP 要素实例化:以棋盘游戏为例,状态为棋子位置,动作为落子,奖励函数简单定义为赢 +1、输 -1;在四足机器人中,状态为姿态向量,动作为关节力矩,奖励基于前进速度(正)、跌倒(负)或静止(零)。这些实例展示了如何将抽象 MDP 映射到具体物理系统。
- 策略依赖性:价值函数严格依赖于特定策略 $\pi$。不同策略对应不同的价值函数排序,最优价值函数 $V^*$ 对应能产生最大预期奖励的策略 $\pi^*$。理解这一依赖关系是分析策略改进算法的基础。
- 模型表示难度差异:以倒立摆为例,近似其非线性动力学模型极其困难,需处理复杂的微分方程;而直接编码行为规则(如“杆向左倾则车向左移”)相对简单。类似地,人类调节淋浴水温依赖直觉反馈而非热力学建模,说明在某些高维或复杂场景中,直接学习策略比估计环境模型更高效且鲁棒。
- 样本效率与稳定性权衡:低样本效率算法通常具有更高的训练稳定性。在可低成本并行模拟或获取廉价经验的环境中(如机器人仿真),使用更稳定但样本效率较低的算法是合理选择,因为墙钟时间(wall clock time)不等于计算效率。这种权衡指导了实际工程中的算法选型。
💡 结论与系统架构展望
- 建立算法导航心智模型:学生需掌握价值函数、策略优化及模型/无模型分类等核心概念,以便在后续课程中理解不同 RL 算法的适用场景。这些基础理论构成了选择合适算法以解决特定控制问题的决策框架。
- 构建端到端自主系统架构:现代自主系统(如 VLA 模型)采用脚手架式训练流程,结合多种技术栈。模仿学习负责基础技能习得,提供初始策略以避免随机探索的危险;强化学习用于最终性能对齐与提升,优化长期目标并适应动态环境。
- IL 与 RL 的互补性:前沿自动驾驶系统并非将模仿学习与强化学习视为互斥选项,而是构建分层训练管道。通常采用监督学习预训练、模仿学习微调,最后利用 RL 对齐人类价值观并极致优化性能。这种混合架构充分利用了 IL 的数据效率和 RL 的探索能力,共同构成完整的自主性堆栈(Autonomy Stack)。
- 未来方向:随着计算能力的提升和数据规模的扩大,端到端学习方法将在更多领域取代传统模块化控制架构。理解各方法的局限性与优势,对于设计鲁棒、高效且安全的自主智能体至关重要。
👤 同一博主
斯坦福大学网络研讨会:转化医学的未来对话
当AI不再是项目:将技术转化为患者与医疗提供者的实际价值
斯坦福大学AA203最优控制与基于学习的控制课程(2026春季)第19讲:基于模型的强化学习
斯坦福大学AA203最优与基于学习的控制课程2026春季学期第18讲:强化学习策略优化
斯坦福大学AA203最优与基于学习的控制课程 | 2026春季学期 | 第17讲:强化学习价值型方法
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第16讲:强化学习基础
斯坦福大学 AA203 最优与基于学习的控制课程(2026 春季学期)第 15 讲:模仿学习
斯坦福大学AA203课程《最优与基于学习的控制》2026春季学期第13讲:学习导论
斯坦福大学AA203最优控制与基于学习的控制课程 | 2026春季学期 | 第12讲:模型预测控制的
斯坦福大学AA203最优控制与基于学习的控制课程 | 2026春季学期 | 第11讲:模型预测控制(
🧭 类似博主
-
2026 美国大学申请三大趋势:AI 元年、小文书取消、标化考试回归?
-
女性约会建议日益黑暗:有毒游戏、巫术与操控
-
特雷·杨(Trae Young)的经典高光时刻集锦
-
智利矿难救援内幕(完整版)| 灾难见证 | 国家地理
-
法医专家对费城失踪女性案件调查表示“着迷
-
1812年美国入侵加拿大失败(纪录片)
-
中国古代拜的“龙”,其实不存在?考古学家揭秘:为什么几千年前的殉葬坑里,会挖出“龙”的骨骼? | 圆
-
婆罗门参日出而作 午前而息 因此有了“午睡花”的绰号《秘境花园》02【CCTV纪录】
-
2000年前的秦始皇到底長啥樣?秦陵陪葬墓曝光他的真實長相,專家看到後當場嚇傻!#圆桌派 #许子东
-
踏上這樣一段旅程,是他的宿命。
0 条评论
发表评论
请先 登录 后参与讨论。