APP下载
报价宝  ›  综合  › 

AlphaGo幕后开发心路历程大公开!一手打造AlphaGo传奇首席工程师黄士杰回台解密

报价宝 来源:baojiabao.com 发布时间:2018-01-10 17:25:00 09月11日更新
报价宝综合消息AlphaGo幕后开发心路历程大公开!一手打造AlphaGo传奇首席工程师黄士杰回台解密

近来机器与人类史上最有名的正面战役,莫过于今年5月,Google旗下AI实验室DeepMind所开发的AlphaGo,与人类围棋世界冠军柯洁的对弈,AlphaGo最终以3:0赢得胜利,打响了AI的名声,不管是学术界或是产业界,都纷纷投资AI应用。

近日,DeepMind更推出了比AlphaGo还要厉害的AlphaGo Zero,不需要事先学习人类下棋的棋谱,拥有自我学习的能力,而一手打造出AlphaGo传奇的首席工程师黄士杰,今日(10日)于中研院举办的第一届台湾人工智能年会的演讲中,以“AlphaGo-深度学习与强化学习的胜利”为题,揭露未曾对外公开的AlphaGo发展历程,以及开发AlphaGo所用到的深度学习与强化学习(Reinforcement Learning)技术关键。

黄士杰日前曾在个人脸书简短的介绍AlphaGo Zero的特性,并表示这次回台将会介绍AlphaGo Zero的开发历程。

AlphaGo Zero主要达成的成果是从零开始自我学习下围棋,并且靠着自我学习,在短短的36小时后,摸索出所有基本且重要的围棋知识,围棋程度达到与李世乭九段对战的AlphaGo v18相同水平,又经过3天后,AlphaGo Zero对战AlphaGo v18达到100%的胜率,之后又达到了年初在网络上达成60连胜的Master的水准。

而40天后,AlphaGo Zero对战Master达到近90%胜率,成为有史以来AlphaGo棋力最强的版本,他表示,虽然AlphaGo Zero还未公开下围棋棋,但DeepMind已将AlphaGo Zero的80局棋公开发表于《自然》(Nature)期刊。

尽管AlphaGo Zero仍然以围棋为开发范本,但DeepMind认为类似的技术将可被应用在其他的结构化问题上,例如蛋白质折叠、降低能源损耗,或是寻找革命性的新材料等,将有潜力对社会带来正面的影响。

黄士杰研究电脑围棋已经10年,他一开始到加拿大做研究时,第一个就是要解决语言沟通的问题,花了很多心力在加强英文的沟通,他指出,虽然现在AlphaGo已经完成所有的任务,但是,DeepMind认为应该还要继续往AI技术前进,可以见得,DeepMind有非常远大的目标。

他表示,2016年5月AlphaGo真正赢了人类的那一刻,是他人生最开心的时候。当初他没有想过电脑围棋会变得这么厉害,但是仍然不断尝试,最后终于成功。其实,过去就连圣诞节AlphaGo也还在下棋,团队也都不间断在训练AlphaGo。

黄士杰从小就喜欢下棋,他自己的棋力是业余6段,研究电脑围棋是他的兴趣,而更令他开心的是,因为AlphaGo的关系,竟然能够与自己的围棋偶像面对面下棋。

AlphaGo带给黄士杰最大的感触是,AI与人类合作的气氛慢慢在形成。在韩国与李世乭​对弈时,可以明显感受到他背负人类必须赢得胜利的压力,然而在中国乌镇围棋峰会与柯洁对弈时,黄士杰真正感受到 AI和人类合作的氛围,柯洁在赛后也表示非常荣幸能跟AlphaGo下棋。

AlphaGo专案的起源

AlphaGo的起源要从黄士杰在攻读博士班时,用单机开发的电脑围棋程式Erica说起。Erica其实是他的妻子的名字,当时,他现在的主管David Sliver写了封信表示,对他的研究成果非常惊艳,还问他要不要加入DeepMind,黄士杰后来在隔年,2012年11月才正式加入DeepMind,当时最后面试的主管问了他做出Erica的感想,“我觉得很有成就感!”David Sliver还表示与他有相同的想法。

他指出,DeepMind的目标是要打造通用的人工智能,当时要开始投入研究电脑围棋AI程式时,DeepMind的共识就是不要复制Erica,因为会有既定的限制。

AlphaGo专案一开始是因为DeepMind的首席执行官Demis Hassabis提议要研究电脑围棋专案,于是黄士杰与他的主管David Sliver开启了研究专案,后来研究团队又加入了Chris Maddison、llya Sutskever,一同参与开发AlphaGo,而“为什么要做围棋?”,这是许多人的疑问,他说,IBM深蓝在国际象棋战胜人类之后,就只剩下围棋这项挑战了。

至于“为何判断深度学习可以用在围棋呢?”黄士杰的答案是,如果人类可以马上判断下这一步是好棋,那么以神经网络就可以做到。当时他利用人类的棋谱来让AlphaGo学习,建立策略网络(Policy Network),用人类的直觉来下围棋。

他表示,每天的工作就是反复训练网络、测试、观察胜率,不断地重复这样的过程,包含要研究神经网络要建立多深、资料集有没有问题、神经网络需要几层等等的问题。其实在刚开始的第一个月,AlphaGo是行不通的,胜率不高,不过在后来发现Overfitting的问题后,解决之后AlphaGo的胜率就大幅达到95%。

之后,AlphaGo最主要的突破即是加入价值网络(Value Network),将强化学习结合深度学习,让AlphaGo拥有学习的能力,另外,也因为硬件上TPU给了很大的帮助,他指出,相同的程式码,用TPU执行的胜率,会变得非常高。AlphaGo将直觉和判断一起训练,就能将直觉和判断达到一致性,并将策略和价值网络结合在一起,变成Dual Network,之后再不断的加强训练流程。

为了测试AlphaGo的能耐,黄士杰努力说服团队要在线上测试AlphaGo的棋力,后来终于在2016年底,让AlphaGo Master在网络上邀来中日韩台顶尖棋手,帮忙训练,一天连下10盘,就这样在自家的房间低调地用单机训练AlphaGo Master。当时下一步棋平均要4 ~8秒,一局下完大约需要1小时,而与职业棋手的对战都是全胜,他认为,电脑围棋AI的价值在于“扩展围棋界的理论和思路”。

真正脱离人类知识的AlphaGo Zero

近日,DeepMind释出的AlphaGo Zero正式脱离人类知识的资料,不再需要人类的资料。AlphaGo原本的版本需要用数千盘人类棋手的对战来训练,然而AlphaGo Zero则可以在完全不懂围棋的状况下,自己跟自己对战,透过神经网络算法,不断调整与更新,进而预测棋子的最佳落点。AlphaGo Zero采用了强化学习,过程中完全没有经过人类的干预,也从未使用过去的棋谱资料,总共只花了40天,就成为历史上最强的棋手。他觉得这是一种趋势,经过10几年的研究,电脑围棋的研究在AlphaGo Zero上,有很好的收尾。

他指出,目前AlphaGo Zero棋力还在持续精进中,DeepMind的团队合作创造许多不错的成果,包含发表了两篇论文,以及与人类大战两次的大战,在网络上有60个棋局训练,最后还拍了《AlphaGo》的纪录片。

他表示,AlphaGo的成功是深度学习与强化学习的胜利,从专案起始到收尾,都是靠着大家一同合作,而硬件资源与TPU也扮演很重要的角色,最后,近日AlphaGo Zero也展示了强化学习的巨大潜力,他认为,AI要成为人类的工具,与人类合作。

文章标签: 报价宝 降噪耳机价格 耳机价格 红米手机价格 华为手机价格 小米手机价格 电视机价格 笔记本电脑价格 笔记本价格 汽车价格 报价宝 汽车价格 笔记本价格 华为手机价格 降噪耳机价格