来客网

阿尔法狗从首演到退役的25个月:超越人类成围棋之神

声明:本文转载自 「澎湃新闻」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

围棋,最早据说是秦始皇为指导他儿子发明的。它的规则简单有限:棋分黑白,执黑子棋手先下,使用棋子在19*19的网格棋盘来圈地盘,最后谁在棋盘上占的地盘多,谁就获胜。

但在看似简单的规则背后,围棋实际上是一项非常讲究策略的博弈游戏。在至今2千多年的发展历史中,纵然偶有佼佼者出现,但都未达到“围棋之神”的境界。

直到2015年,一个名为AlphaGo的计算机程序横空出世,大杀四方。

在短短25个月的时间里(2015年10月,AlphaGo正式公开与人类对弈),AlphaGo斩落了中日韩的顶尖围棋高手,不断地挑战了人类对围棋的认知,让人大开眼界,叹为观止。人类棋手更是经历了难以置信、震惊、震撼,再到最后转为拜它为师,奉之为“围棋之神”的过程。

如今,AlphaGo教学工具上线,更多的人可以通过它来学习下围棋。从挑战人类,到无人能及,再到回馈人类, AlphaGo的使命已经完成。那么它是如何走到这一步,对人类围棋历史又做出了什么样的贡献?

从备受轻视到惊艳世人

2015年年末,欧洲围棋冠军、职业围棋二段樊麾在接到DeepMind的邀请,希望他能到伦敦与计算机程序下棋时,他想得非常简单,也很有自信。樊麾那时的自信不是没有道理。即便1997年,IBM用暴力算法赢下国际象棋第一人卡斯帕罗夫后,人类仍坚信围棋这项古老的游戏,对于计算机而言还有很长的路要走。

因为在19*19的棋盘上,可走的粗略的数目估计为10^170。它大概是我们可见宇宙中所有原子总和(大概在10^80的数量级)的100倍那么多。在围棋数百回合中,任一回合大约有250种下法,也被称为分支因子。因为选择其中任一种下法又将会出现250种可能的下法,以此往复直到游戏结束。这意味着围棋是无法采取数学意义上的暴力算法。

另外,每位围棋选手都知道,围棋局部小的战术可能在后面的对弈中会产生巨大的战略影响。围棋还有足够多的定式,围棋选手会说到一些特征,例如梯子、墙和假眼,这些都是从规则中有机演化出来的,而不是规则规定的。同时,围棋也很讲究选手在下棋时的气势,这些对于冰冷的机器而言,很难掌握。

要解决上面这些难题,至少在AlphaGo出现前,人们认为至少需要10年的研究。只是这一次,人类真的低估AlphaGo了。

在5盘的对弈中,樊麾很快败下阵来,而且输得让他不忍看赛后媒体对他的评价。不过,很快地,作为第一个真正感受到AlphaGo实力的人,樊麾加入了DeepMind团队,一起为提升它的技能努力。

2016年1月份,《自然》杂志发表了DeepMind关于AlphaGo的第一篇论文,重点阐述了如何通过神经网络和蒙特卡洛树搜索让计算机程序掌握下围棋的方法。这篇文章引起的波澜不小,但更多人愿意讨论的是,当时DeepMind宣布,将在3月份,挑战围棋职业九段、韩国棋手李世石。

文章配图

北京时间2016年3月9日下午3点31分,韩国首尔,谷歌旗下人工智能公司DeepMInd开发的智能系统AlphaGo(阿尔法围棋)和韩国职业围棋选手李世石九段的第一场比赛正式结束。  本文图片均为视觉中国 资料图

“围棋是这个世界上历史最悠久的桌游,最简单,也最抽象。人工智能长久以来面临的一项挑战,就是击败专业围棋选手。我们在人工智能中尝试过的所有方法,都无法解决围棋问题。棋盘上可能的排列组合,比宇宙中的原子数还多。但AlphaGo学会了下围棋。到目前为止,AlphaGo完成了所有我们设计的挑战。但在它对阵当时最强的棋手,比如李世石之前,我们还无从了解它的真正实力。”这是《AlphaGo》纪录片在回顾这场对决前的描述。

确实,关于这场比赛,包括中国围棋界在内,很多人对李世石抱有更多的信心。即便在李世石输掉前2局比赛后,当今世界围棋第一人柯洁仍对人类信心十足,他在自己的微博上写到:“就算阿尔法狗战胜了李世石,但它赢不了我”。最终的比分定格在4:1,如果不是第四盘,李世石下出 “神来一手”,抓住AlphaGo的漏洞,比分可能会更悬殊。

挑落职业棋手,AlphaGo引来了全球的关注。DeepMind称,全球有2000万观众通过电视直播观看了它与李世石的比赛。直播后,关于人工智能、神经网络、深度学习的讨论热闹非凡,人工智能浪潮也由此展开。正是因为输掉了李世石一盘棋,AlphaGo获得了韩国棋院颁发的“职业九段”证书,世界排名上甚至一度超越柯洁排在第一位。

如果说赢下李世石让世人震惊外,那么AlphaGo接下去的进步和发展,只能用震撼来形容。2017年1月份,AlphaGo换上“Master”的马甲,潜伏野狐围棋平台,直接以60:0的战绩横扫了中日韩顶尖的棋手。在不到1年的时间里,AlphaGo正如它的新名称一样,真正成为了围棋大师,也开始朝着“围棋之神”的方向前进。

柯洁对AlphaGo的态度也有了180度的转变。“我们两年前总以为AI计算力强,现在发现是大局观、宏伟蓝图更强,压制我们,远远领先我们人类,令我非常震撼。”他在微博上说到。

文章配图

2017年5月27日,浙江乌镇,2017AlphaGo Vs 柯洁大赛第三局。

同年5月,柯洁与AlphaGo约战乌镇,比赛结果并没有出人意料,柯洁0:3输掉了比赛。在最接近击败阿尔法狗的第二盘比赛后,柯洁哭了,他说他以为自己有机会击败它了,他有了情绪,但没有控制住,而坐在他对面的AlphaGo却一直冷静、稳定。这样的对比,不知道对于人类来说,是幸事还是不幸。与柯洁的三盘比赛也成为了AlphaGo与人类对战的绝唱。随后,DeepMind宣布AlphaGo退役。

但退役并不意味着AlphaGo停止进步,相反它还在以人类难以企及的速度学习。

今年10月,《自然》杂志发布DeepMind的第二篇论文。这一次AlphaGo的进步可以说到了让人惊艳的地步。DeepMind推出了最强版AlphaGo ,代号AlphaGo Zero,而它是“自学成才”。即从一张白纸开始,零基础学习,在短短3天内,就成为顶级高手。在对阵曾赢下韩国棋手李世石那版AlphaGo时,AlphaGo Zero取得了100:0的压倒性战绩。

不以人类为师,又能无师自通,AlphaGo “围棋之神”由此诞生。

取得无数胜绩后,AlphaGo选择将自己所学授予人类,12月11日晚间,AlphaGo教学工具上线。柯洁第一时间表示人类可以重新学围棋了。

从以人为师到无师自通

用如此短的时间就研究透了拥有几千年历史的围棋,AlphaGo的“神迹”让人惊叹。回顾成名史,经过了多个版本升级的它,实际上离不开背后的技术和硬件支撑。而这一切或许得从2014年的那笔收购开始。2014年1月,谷歌以4亿英镑的价格收购了DeepMind。

在这之前,DeepMind的办公楼位于伦敦市国王十字车站的潘克拉斯广场7号, 从建筑外墙看,你根本不会发现这里竟然孕育着未来会改变围棋发展的科技公司。谷歌的收购改变了DeepMind公司的命运,也推动了AlphaGo项目的进展。

据DeepMind的高级研究员,AlphaGo团队的领导成员之一黄士杰回忆,在谷歌收购前,这个项目总共只有3个人,即创始人戴密斯·哈萨比斯(Demis Hassabis)、大卫·席尔瓦(Dave Sliver)和他本人。

得到谷歌的加持,AlphaGo团队迅速得到了扩张。更重要的是, AlphaGo团队在硬件和数据训练上得到了巨大的支持。因为深度学习与这两样东西密不可分:足够多的处理单元及足够多的可供学习的数据。

先来看看AlphaGo这个系统主要的构成部分。根据DeepMind在2016年《自然》杂志上发表的论文,AlphaGo的成功主要依靠以下几个方面:1. 走棋网络(Policy Network),给定当前局面,预测/采样下一步的走棋。2. 快速走子(Fast rollout),目标和1一样,但在适当牺牲走棋质量的条件下,速度要比1快1000倍。3. 估值网络(Value Network),给定当前局面,估计是白胜还是黑胜。4. 蒙特卡罗树搜索(Monte Carlo Tree Search,MCTS),把以上这三个部分连起来,形成一个完整的系统。

有了系统构成或者说计算模型后,就需要数据输入。据了解,打败李世石的版本,DeepMind用了3000万棋谱样本来训练机器,这些棋谱来自业余和职业选手聚集下棋的在线服务器。另外AlphaGo还通过自己互相对弈,进行微调,从而能快速产生更多的训练数据。

深度学习网络贡献地快速学习能力,帮助AlphaGo打败了李世石。到哪结束与李世石的比赛后,DeepMind追求极限的目标仍再继续。

从Master到对战柯洁,这一时期,AlphaGo又完成了三大升级:首先,AlphaGo大师版摈弃人类棋谱,单纯向AlphaGo李版的经验学习;其次,AlphaGo大师版的计算量只有AlphaGo李版的十分之一,只需在单个TPU机器上运行;最后,AlphaGo大师版拥有更强大的策略网络和价值网络。

这里需要特别指出的是TPU的作用,这是谷歌专门为加速深层神经网络运算能力而研发的芯片,它的使用让AlphaGo在硬件上有了很大的提升。

据席尔瓦介绍,这次升级后,AlphaGo的系统做了简化降低搜索树宽度的策略网络和降低搜索树深度的价值网络,但性能却得到了提升。

AlphaGo李版首先运用策略网络进行深度学习,将大量人类棋谱输入其中,根据人类经验排除掉搜索树上一部分的分杈。也就是说,虽然围棋当前的每一步都有上百种可能性,但根据人类经验,只有一部分是好的选择,AlphaGo只需要搜索这些分杈,另一些根本就是“臭棋”。

同时,AlphaGo也不需要在这些分杈上一路搜索到底,模拟到棋盘结束才知道当前这步棋的优劣。在当前某个特定的选择往下,AlphaGo只模拟几步,就能得出一个分数。这个数值越大,AlphaGo获胜的概率就越高。

接着,在强化学习中,AlphaGo就可以根据策略网络推荐的走法自我对弈,左右互搏,在经过反复自我训练,积累了大量数据之后,AlphaGo就能更快地对当前走法的胜率有一个概念。

策略网络和价值网络配合形成的深度强化学习,能让AlphaGo更“聪明”地计算。

也是从这里开始,AlphaGo开始不再以人为师,而是在深度学习环节,使用的大量训练数据进行自我对弈。AlphaGo也因此开启了无人能敌的进阶之路。

今年10月份,DeepMind对外推出了最强版AlphaGo,代号AlphaGo Zero。这一次,AlphaGo Zero用了490万盘比赛数据。经过3天的训练,AlphaGo Zero就以100:0的比分赢下了李世石版AlphaGo,并且只用了1台机器和4个TPU。相比之下,李世石版AlphaGo则用了48个TPU。

在《自然》杂志上为DeepMind论文撰写的评论中,密歇根大学计算机科学和工程学院教授Satinder Singh写道,这是强化学习转化为应用领域里取得的最大进步之一。

从改变围棋到改变生活

AlphaGo和AlphaGo Zero取得的进步已经证明,基于强化学习的人工智能比基于人类知识经验的智能表现地更好。12月11日,AlphaGo还推出了教学工具,旨在帮助公众能用新的、创新方式下围棋。

“围棋人工智能的出现,重启了人类究竟对围棋这项游戏了解多少这个问题。”美国围棋协会的Andy Okun和Andrew Jackson在《自然》杂志上曾这样评价AlphaGo给围棋界带来的改变。通常一个世纪才会出现一位传奇的围棋棋手,他能改变人类对围棋的理解。而当AlphaGo打败李世石,Master以60:0的成绩横扫各国顶尖棋手,并以3:0赢下柯洁后,关于人工智能给围棋带来的启示一直不绝于耳。

显然,AlphaGo带来的进步肯定也是围棋棋手日后学习的宝库。要知道,AlphaGo Zero是独立学习训练的,但它使用的招数却超越了许多人类棋手的下棋顺序和招法。也就说,人工智能丰富了我们下围棋的选择。或许它在下棋过程中有些下法是人类无法理解的,甚至认为是错误的,但在机器的理解看来确实万分正确的。从这些经验中,人类棋手看到了与以往不同的围棋世界。

包括柯洁、古力等多位职业围棋九段棋手已经多次在自己的个人微博账号上表示了AlphaGo对他们带来的启发。尤其是在AlphaGo教学工具上线后,柯洁第一时间转发评论到:“重新学围棋”。世界围棋冠军、职业九段棋手常昊认为:“教学工具不一定是标准答案,更多的是给予了我们无限的思考空间。”曾为乌镇人机大战选手之一、职业九段棋手周睿羊则表示:“定式什么的还是不要随便学了,看到工具一些高级下法之后感觉到又可以起飞了。”

“之前,人类与人工智能对话总是显得非常遥远,甚至像科学小说。但现在对于围棋选手来说,对话已经发生了,就在这里。” Andy Okun和Andrew Jackson说。

但改变围棋并不是AlphaGo的最终目的,DeepMind创始人戴密斯·哈萨比斯(Demis Hassabis)曾在多个场合提到过,自己成立公司主要是想用人工智能技术改变我们的生活。

而他们确实在这样做,至少在医疗领域已经开始行动。目前,他们与伦敦帝国理工学院英国癌症研究中心领导的健康研究机构,以及Google的人工智能健康研究团队共同合作,用机器学习技术对抗乳腺癌。在此之前,它们还曾宣布与英国国家医疗服务体系(NHS)合作,为其开发患者健康风险警告系统。

“最终,我们想要将这些技术应用到真实世界的重要问题中。因为我们用的方法是通用的,我们希望有一天,它们能延伸得更广,帮助解决最紧迫的社会问题,从医药诊断到环境模型。”哈萨比斯说。

评论 (0)