博主头像

Eric Jang:从AlphaGo重构看自博弈、强化学习与大语言模型的未来

外来客 • 2026-08-20 03:10:29

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:What rebuilding AlphaGo teaches us about self-play, RL, and future of LLMs - Eric Jang)

🎯 核心概述

AlphaGo 及其后续变体(如 AlphaZero、KataGo)的核心突破在于利用深度神经网络解决围棋巨大的状态空间(约 $3^{361}$)与延迟奖励特性导致的计算不可行问题。通过引入价值网络(Value Network)和策略网络(Policy Network),系统成功将原本需要穷举至终局的蒙特卡洛树搜索(MCTS)转化为可计算的优化问题。这一机制不仅实现了测试时计算量的摊销,更揭示了深度学习在处理高维、长时序决策任务中的核心优势:通过函数逼近替代深层搜索,将宏观模拟压缩进单次前向传播,从而在完美信息博弈中高效逼近纳什均衡策略。

🧠 神经网络架构与直觉模拟

  • 双头网络结构:系统包含策略网络与价值网络。策略网络输出 361 维分布,预测动作概率,充当“直觉”以优化搜索广度;价值网络输出单一 Logit,预测当前棋盘状态的胜负概率,用于截断搜索深度。两者均为分类问题,可通过交叉熵损失训练,且共享底层表征以保持一致性,提升学习效率并减少计算冗余。
  • 架构选择逻辑:在低数据预算下,ResNet 通常优于 Transformer,因其具备局部卷积的归纳偏置,更适合捕捉棋盘局部特征。Transformer 需更多数据才能通过全局注意力连接远距离特征,但在拥有强初始化(如对抗 KataGo 训练)后,其全局特征聚合能力变得有用。
  • 状态编码与规则:输入需区分黑、白、空三种状态。所有围棋 AI 均基于无歧义的 Tromp-Taylor 规则训练,而非依赖人类共识的模糊判定(如“双活”),这确保了算法判定的确定性。
  • 计算效率演进:早期 AlphaGo Lee 使用 TPU Pod 进行数万级模拟,将价值网络预测与真实随机推演结果加权平均。现代引擎如 KataGo 将更多计算负担推入网络权重,测试时仅需单次前向传播即可达到强效,实现了 40 倍计算量缩减,且借助 LLM 编码,原本需数百万美元算力的工作现仅需数千美元。

📊 MCTS 机制与搜索优化

  • PUCT 算法应用:MCTS 使用 PUCT(Predicted Upper Confidence with Trees)算法选择动作,平衡利用(Q 值)与探索(未访问次数)。Q 值定义为在随机搜索分布下的期望动作价值,而非绝对胜率。
  • 搜索流程四步法:每步棋重新构建树,执行选择(UCB 准则)、扩展、评估(价值网络预测)、备份四步。备份步骤将终局胜负值沿路径反向传播,更新父节点的平均动作价值。
  • 去推演化趋势:AlphaGo 后续版本移除了昂贵的完整推演(playout),仅依赖策略网络自博弈生成样本,以“接地”价值估计,避免脱离现实。这种机制将 MCTS 转化为策略网络的改进算子,通过自博弈将搜索结果蒸馏回网络。
  • 软标签蒸馏:训练策略网络时模仿 MCTS 分布而非单一动作,利用软标签的高熵特性包含更多信息,比硬标签提升蒸馏效果。即使最终输掉比赛,中间步骤仍可作为高质量训练数据,类似 DAgger 算法。

💡 强化学习困境与方差控制

  • 信用分配难题:现代 LLM 的 RL 训练常被视为“通过吸管吸取监督信号”,因为仅奖励最终获胜动作导致高方差。在实力相当的对弈中,若一方仅因随机噪声获胜,其余动作无差异,则有效监督信号极少,导致梯度方差随时间步长二次方增长。
  • 优势估计机制:为降低方差,RL 采用优势估计(Advantage Estimation),通过减去基线(如 TD 学习估计的价值函数)来消除中性动作的影响,仅保留优于平均水平的动作梯度。
  • Off-Policy 风险:若 Replay Buffer 中包含大量当前策略永远不会访问的状态,模型将浪费容量学习无效动作。理想数据分布应包含最优轨迹及少量偏离状态,以提供纠错能力。
  • 替代方案:在无法进行树搜索的游戏(如 StarCraft)中,采用神经虚构自博弈(Neural Fictitious Self-Play):固定对手,使用 PPO 等模型无关算法训练“最佳响应策略”,并通过蒸馏多个最佳响应策略生成混合策略,确保策略不弱于联盟中平均水平的对手。

🛠️ 训练策略与冷启动

  • 监督学习初始化:建议先使用人类专家对局数据进行监督学习初始化,验证规则实现正确性,再引入自对弈。仅靠策略网络取 Argmax 动作,模型已能击败大多数人类玩家。
  • 冷启动技巧:可利用 9x9 小棋盘通过随机博弈(如 5 万局)快速建立基础价值直觉,再迁移至 19x19 大棋盘;或利用开源引擎数据训练价值函数,特别是针对终局状态。
  • 风险警示:若训练数据缺乏多样性(如机器人过早认输),价值网络可能遗忘终局评估能力,导致 MCTS 备份值错误,进而误导策略选择。必须确保价值函数有可靠的“接地”机制(如强制部分对局进行到底),否则搜索过程可能放大错误而非纠正错误。
  • Scaling Laws 前提:研究扩展定律需先确保系统无 Bug、架构合理且数据质量高;在策略未收敛或数据不佳时强行拟合扩展定律会导致错误结论。

📉 计算资源与“苦涩教训”

  • 算力演进影响:随着 GPU 性能提升(如从 V100 到 Blackwell),复杂的异步分布式 RL 基础设施可简化为同步训练。早期针对旧硬件优化的算法技巧(如加速收敛)重要性降低,收益具有暂时性。
  • 成本差异:AlphaZero 训练消耗约 3e23 FLOPs,远超当时其他模型;重建项目仅花费约 1 万美元,证明“首创”所需算力远高于“追赶”。
  • 技术迭代规律:“苦涩教训”正在发生:许多早期巧妙技巧因硬件进步和基础架构简化而变得冗余。核心在于快速获得强对手进行自博弈,而非单纯追求算力效率或复杂算法。
  • 算法可堆叠性有限:看似独立的优化方案常因相互干扰导致整体效果下降,需统一顶层设计。不同优化手段间收益重叠,难以线性叠加。

🧩 通用 AI 启示与未来方向

  • LLM 推理借鉴:LLM 推理可能借鉴围棋中的前向搜索思想,但需解决动作空间维度与价值评估难题。数学等结构化任务更适合树状搜索,而开放域任务需不同机制。
  • 自动化科研局限:当前模型能灵活调整代码和数据增强以优化指标,但在实验树分支选择上表现不佳,常需人工介入以识别“死胡同”或底层 Bug。缺乏横向思维,难以判断实验方向是否正确或识别根本性错误。
  • 验证闭环困境:围棋等游戏环境虽提供胜率反馈,但难以自动识别如缩放定律等深层规律;通用 AI 的经济效用难以量化,导致自我改进缺乏可靠的外部验证标准。
  • 研究建议:需精准判断当前阶段“苦涩教训”能带来的收益上限,避免过度依赖短期算法技巧。建议关注 Go、MCTS 与大语言模型推理之间的深层联系,该领域在 LLM 热潮下相对被低估,且可用较小预算进行研究。
  • 资源获取:可通过 Eric Jang 的个人网站(evjang.com)查看教程博客,或在 GitHub(用户名 Eric Chang)获取 AutoGo 代码库以复现训练结果;推荐阅读关于“思考作为计算机科学原语”的相关博文。

博主头像 👤 同一博主

查看该博主全部 16 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。