DeepMind以AlphaZero击败全球三大棋艺AI,连AlphaGoZero也是手下败将

AlphaZero在30小时的训练后击败了同门师兄AlphaGo Zero。
Deepmind
Alphabet的人工智能子公司DeepMind 上周五(12/7)公布了人工智能系统AlphaZero的完整评估报告,并刊登于《科学》(Science)期刊上,各路棋艺高手则称赞AlphaZero发展出自己的风格,不但具备创造力,还可能成为重要的教学工具。
AlphaZero与其它传统AI棋艺引擎最大的不同在于它并非仰赖众多的规则,或是自专家的棋戏中学习,而是透过深度神经网络(Deep Neural Network)与通用目的算法展开自我学习,顶多只知道各种棋艺的基本规则。
AlphaZero挑战的对象是全球最强大的国际象棋程式Stockfish、将棋程式Elmo,以及同样由DeepMind所打造的围棋程式AlphaGo。它花在国际象棋的训练时间为9小时,将棋为12小时,围棋为13天,训练完毕之后,它在4个小时之后就胜过了Stockfish,在2小时之后便凌驾Elmo,并于30小时之后击败了AlphaGo。
研究人员解释,在学习每一款棋艺的过程中,AlphaZero从一个完全未经训练的神经网络,经由与自己对战数百万回合进行强化学习(Reinforcement Learning),一开始它完全是随机地下子,但它会从赢家与输家的走法中学习,同时调整其神经网络参数,而训练时间则取决于各种棋艺的风格及复杂程度。
现今世上最优秀的日本将棋棋士羽生善治(Yoshiharu Habu)指出,AlphaZero的某些走法,例如把王将(King)移到棋盘中央,根本有违将棋理论,从人类的角度来看,这让AlphaZero处于险恶之地,但令人难以置信的是,AlphaZero依然掌控着棋局,它的独特风格向大家展示了该游戏新的可能性。
经过完整训练的AlphaZero在与Stockfish、Elmo及AlphaGo竞赛时,展现了它的强大,在与Stockfish对战时,在1,000盘的棋戏中赢了155盘,只输了6盘;与Elmo对战的胜率更高达91.2%,与AlphaGo对战的胜率则是61%。
而令棋士们感到最有趣的部分在于自我学习的AlphaZero并没有受到传统的游戏智慧规范,而发展自己的直觉与策略,带来新鲜的想法,颠覆了几个世纪以来人们或专家对这些棋艺的思考。
国际象棋大师Matthew Sadler指出,他率先注意到的就是AlphaZero的风格,它有目的地以大量的棋子有力地围绕着国王,尽可能提高自己的行动力与移动性,同时最大限度地减少对方棋子的活动力及移动性,它完全不像传统的游戏程式,而好似获得了一本武林秘笈。
Sadler还说,传统的游戏程式几乎很少犯下明显的错误,但在缺乏没有具备或可计算的解决方案时即会游移不定,然而,AlphaZero却会在此时发挥它的感觉、洞察力或直觉。
另一名国际象棋大师Natasha Regan则说,AlphaZero的走法不管是与游戏程式或国际级专家都不同,可望成为强大的教学工具。
DeepMind的研究人员则认为,AlphaZero展现一个单一的算法如何能在一系列的设定中挖掘新知识,尽管目前仍处于早期开发阶段,但AlphaZero具备创意的见解再加上诸如AlphaFold等专案的结果让他们有信心能够建立一个通用的学习系统,有朝一日将可协助人们以新方法来解决重要及复杂的科学问题。
