博主头像

我让AI同时打768局街霸2,两天后它杀死了所有角色!

外来客 • 2026-10-11 14:09:36

分享
𝕏 f ◉
声明:本文为对公开内容的摘要整理, 未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

🎮 AI训练策略与架构演进

  • 混合专家(MoE)架构:将神经网络复制12份并配置简单路由器,根据关卡自动分配至对应“专家”。该模型在街霸2中执行3亿次实战操作后实现无伤通关,但硬件要求极高,无法在普通设备上运行。
  • 知识蒸馏技术:利用大AI作为教师,通过5000万次操作将判断逻辑刻入小AI。此过程使小AI的学习速度达到从零训练的6倍,成功实现了单命通关12关的目标,但实战稳定性较差,表现波动剧烈。
  • 并行训练突破:放弃串行关卡学习,改为同时开启768个游戏窗口(12个对手各64局)。利用M Ultra Max Studio的高带宽统一内存池,在48小时内完成5亿次操作的学习量,相当于人类玩家连续高强度对战385天。

👁️ 视觉感知与课程优化

  • 抽帧间隔调整:将画面抽取间隔从每4帧改为每8帧。此举解决了小AI在面对动作缓慢的泰王时因信息冗余而无法分析局势的问题,同时保留了对快速对手的反应能力。
  • 运动前景提取:引入预处理器高亮画面中变化幅度大的区域。该方案有效解决了大兵关卡中敌人与观众着装相似导致的识别困难,以及镜像龙关卡中敌我波技无法区分的问题,显著提升了目标锁定精度。
  • 课程学习修正:早期“输了退回第一关”的策略导致新经验被旧操作稀释,造成训练停滞。分析发现泰王、大兵和镜像龙的难度实际高于最终Boss警察,原有的线性课程安排不符合AI的认知规律,需通过并行多关卡训练来平衡学习曲线。

📊 实战表现与模型特性

  • 稳定性提升:新模型在三轮完整实战中均成功通关12关,不再依赖极致的漏洞利用或投机取巧,而是展现出随机应变的格斗能力。
  • 泛化能力验证:小AI在未见过训练数据的奖励关中,能正确执行踢碎汽车、打烂砖墙等操作以获取高分,证明其真正理解了游戏机制而非单纯记忆路径。
  • 轻量化部署:最终模型仅包含三层卷积神经网络,结构极致精简。该模型不仅性能强劲,且对硬件要求极低,可在Mac mini、MacBook Air及普通PC设备上流畅运行,实现了“经得起观众检验”的目标。

🧠 核心结论与技术启示

  • 并行优势最大化:强化学习在格斗游戏领域的最大优势在于并行处理能力。通过同时应对数百个独立战斗场景,AI能高效积累多样化经验,避免陷入单一关卡的局部最优解。
  • 感知先于策略:在视觉驱动的游戏AI中,解决“看清”问题(如敌我识别、动作捕捉)比优化“打法”更关键。针对特定对手特征调整输入数据预处理方式,是突破训练瓶颈的核心手段。
  • 开源与迭代:项目最终模型及代码将在GitHub开源。尽管当前算法和数据仍显稚嫩,但通过结合MoE、蒸馏及并行训练等前沿技术,成功解决了长期困扰格斗AI的泛化性与稳定性难题,为后续更复杂对局的研究奠定了基础。

0 条评论

发表评论

请先 登录 后参与讨论。