博主头像

强化学习:核心概念

外来客 • 2026-08-27 03:13:35

分享
𝕏 f
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:Reinforcement Learning: Essential Concepts)

🎓 强化学习核心概念

  • 定义与本质:强化学习是一种让计算机基于经验进行学习和适应的方法论。其核心逻辑类似于人类通过试错积累经验,旨在通过不断调整策略以最大化长期回报。
  • 应用领域:该技术被广泛应用于多种场景,包括提升计算机在跳棋、围棋等游戏中的表现,辅助自动驾驶汽车行驶,以及优化大型语言模型(如 ChatGPT)使其回应更具人性化。
  • 基本术语映射
  • 环境(Environment):指代理需要探索和互动的对象或系统。在示例中,这对应于两家薯条店(Squatch's Fry Shack 和 Norm's Fry Hut)。
  • 代理(Agent):指在环境中进行探索、做出决策并执行动作的主体。在示例中,指代做出选择的“我们”。
  • 策略(Policy):代理用于决定行动的概率分布或规则。在示例中,表现为访问每家店的概率值。
  • 奖励(Reward):环境对代理行为给出的反馈信号,用于评估行为的好坏。在示例中,对应“薯条评分”(Fry Score),满意为 1,不满意为 0。

📊 概率更新机制与学习率

  • 初始状态设定:由于对两家店均无先验知识,初始访问概率均设为 0.5。通过生成 0 到 1 之间的随机数来决定去向,若随机数落在某家店对应的概率区间内,则前往该店。
  • 更新公式逻辑
  • 新概率 = 旧概率 + (学习率 × (奖励 - 旧概率))。
  • 在示例中,当获得满意薯条(奖励为 1)时,新概率 = 旧概率 + (学习率 × (1 - 旧概率))。
  • 当获得不满意薯条(奖励为 0)时,新概率 = 旧概率 + (学习率 × (0 - 旧概率)),即概率降低。
  • 学习率(Learning Rate)的作用
  • 控制每次更新时概率变化的幅度,取值范围通常在 0 到 1 之间。
  • 学习率为 0:概率完全不发生变化,无法从经验中学习。
  • 学习率为 1:概率直接跳变为奖励值(0 或 1),导致策略过于激进,完全放弃探索其他选项,不利于发现潜在更优解。
  • 适中学习率(如 0.1):允许概率小幅调整。例如,初始概率 0.5,获得奖励 1 后,新概率变为 0.55。这种小幅调整既反映了当前体验,又保留了对其他选项的探索机会,平衡了“利用”与“探索”。

🍟 探索与利用的动态平衡

  • 探索(Exploration)与利用(Exploitation)
  • 即使某家店曾提供满意服务,由于样本量有限,不能确定其长期表现,因此仍需保留一定概率去尝试其他店(探索)。
  • 随着经验积累,表现较好的店概率逐渐升高,表现较差的店概率逐渐降低,最终策略趋向于高奖励选项。
  • 迭代过程示例
  • 第一轮:随机数 0.7 指向 Norm's,获得满意薯条(奖励 1)。Norm's 概率从 0.5 升至 0.55,Squatch's 降至 0.45。
  • 第二轮:随机数 0.2 指向 Squatch's,获得不满意薯条(奖励 0)。Squatch's 概率从 0.45 降至 0.41,Norm's 升至 0.59。
  • 后续迭代:随着多次访问,Norm's 因多数时候提供满意薯条,其概率持续上升;Squatch's 因多数时候表现不佳,概率持续下降。
  • 收敛结果:经过多次重复,概率分布趋于稳定。在示例中,Norm's 的访问概率最终稳定在约 0.81,Squatch's 稳定在约 0.19。这表明代理已学会优先选择高奖励来源,同时保留少量探索概率以应对环境可能的变化。

⚖️ 核心结论

  • 目标导向:强化学习的最终目标是修改策略,以最大化累积奖励。在示例中,即最大化获得满意薯条的次数。
  • 适应性:该方法不要求奖励恒定,能够适应环境反馈的变化(如 Norm's 偶尔也会提供少量薯条)。
  • 通用性:虽然示例简化了术语和复杂度,但其核心机制——基于概率的策略、基于奖励的反馈、通过学习率控制的渐进式更新——是强化学习在复杂系统(如游戏 AI、自动驾驶)中应用的基础逻辑。

0 条评论

发表评论

请先 登录 后参与讨论。