我用AI杀死了史上最难的跑步游戏
外来客 • 2026-08-13 03:02:04
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
🏃 核心观点
通过强化学习(Reinforcement Learning)训练AI攻克高难度游戏《QWOP》,揭示了AI在解决复杂物理控制问题上的独特逻辑与进化路径。研究证明,合理的奖励函数设计、探索机制引入以及任务拆解策略,能显著提升AI的学习效率与表现上限。同时,对比显示人类虽具备极高的学习效率,但AI凭借无休止的并行训练和专注力,能在特定领域突破生理极限甚至发现游戏漏洞。
📊 关键事实/论据
- 初始困境与突破:《QWOP》由Bennett Foddy开发,操作极难。团队使用双层感知机神经网络控制角色15个关键点坐标。初期AI因奖励函数粗糙(仅前进加分、摔倒扣分)而采取“跪地爬行”策略;引入超时惩罚后速度提升至50米,但在50米处遇栏杆卡关,陷入“稀疏奖励”困境。
- 探索机制优化:采用RND(基于随机网络蒸馏的探索)机制,对尝试新动作给予额外奖励。AI学会踢飞栏杆而非跨越,并利用游戏渲染漏洞将栏杆踢出画面外以消除障碍,最终稳定通关。
- 打破世界纪录:通过调整奖励函数(剩余时间折算为现金奖励),经150万次训练(相当于人类高强度游玩18年),AI将通关时间压缩至43.921秒,比原人类世界纪录45.53秒快1.6秒。其跑姿呈现高抬腿、大跨步及夸张后仰等非人类特征。
- 进阶挑战与遗忘问题:在二次开发的跨栏项目中,AI遭遇“灾难性遗忘”(学会跨栏却忘记走路)。团队通过课程学习将动作拆解为跳跃、前脚过杆、后脚过杆三个子任务,并将神经网络升级至4层512神经元,成功解决该问题。
- 跳远表现:在30米助跑跳远项目中,AI未尝试高跳,而是采取平飞姿态并用膝盖强行扭转身体刹车,最远距离达5.2米。
🏁 结论
AI通过海量试错与算法优化,不仅掌握了超越人类的跑步技巧,还发现了人类玩家未曾察觉的游戏机制漏洞(如踢飞栏杆消失)。尽管AI训练耗时相当于人类18年,但其最终成绩显著优于人类纪录。研究团队已将改进后的游戏及代码开源,支持人机对战或用户自训AI参赛,验证了AI在复杂物理模拟环境下的强大潜力与独特解题思路。
👤 同一博主
我们做了个AI养猫外挂!
十万元的苹果电脑,AI时代的版本答案?
聊聊最有争议的一场苹果发布会!
OriginOS 7首发体验:手机AI智能体卷起来了!
智能手机,一定要智能!
芯片背后的Arm,怎么给开发者开起了“工具店”?
什么叫去酒吧蹭 Token??
第一视角上手iPhone全系新品!
一个视频搞懂DeepSeek Harness!
我把浏览器插件变成了卡牌游戏
🧭 类似博主
-
Ron Johnson 谈在 Apple Store 购买 iPhone:AppleInsider
-
AI 生圖越來越強,為什麼大家卻很少聊 Diffusion 了?
-
回应《Elephant Graveyard》末日邪教杰作
-
「老大哥」木星竟是殘暴的「法外狂徒」?| 俗說宇宙 | Linvo說宇宙
-
8.7万星标!5个颠覆英语学习的AI开源神器(听力/词汇/沉浸阅读)
-
大数据进入智能体时代:DataBuddy端到端实战教程
-
Windows 11 终于修复了任务栏,还带来了这些变化
-
如何使用 ChatGPT Sites 构建网站
-
41秒生成5秒视频!实测 FastH3 V2:彻底告别假慢动作与模糊烂脸
-
轻触支付:比简单一触复杂72倍!
0 条评论
发表评论
请先 登录 后参与讨论。