强化学习有哪些特点?这5大领域你有了解吗?
强化学习的特点
前面曾经提到强化学习与机器学习的其他正规化(监督学习、无监督学习)不同,具体有以下5个方面。没有监督者,只有奖励讯号(Reward Only):监督学习要基于大量的标注资料进行(标注资料是训练与学习的目标)。而在强化学习中没有监督者,这意味着强化学习不能够由已经标注好的样本资料来告诉系统什么是最佳的动作,智慧体只能从环境的反馈中获得奖励。换言之,系统不能够马上获得监督讯号,只能从环境中获得一个奖励讯号。反馈延迟(Feedback Delay):反馈延迟实际上是延迟奖励。环境可能不会在每一步的动作上都获得奖励,有时候需要完成一连串的动作,甚至是当完成整个任务才能获得奖励。试错学习(Trail-and-Error):因为没有监督,所以没有直接的指导资讯,智慧体要不断与环境进行互动,通过试错的方式来获得最优策略(Optimal Policy)。智慧体的动作会影响其后续资料:智慧体选择不同的动作,会进入不同的状态。由于强化学习基于马尔可夫决策过程(当前状态只与上一个状态有关,与其他状态无关),因此下一个时间步所获得的状态发生变化,环境的反馈也会随之发生变化。时间序列(Sequential)很重要:机器学习的其他正规化可以接受随机的输入,而强化学习更加注重输入资料的序列性,下一个时间步t的输入经常依赖于前一个时间步t-1的状态(即马尔可夫属性)。
哪些领域已涉及?
深度学习已经被许多传统制造业、互联网公司应用到各种领域,与之相比,强化学习的应用还相对有限,本节将对强化学习的已有应用进行简单介绍。强化学习模仿人类和动物的学习方法。在现实生活中可以找到很多符合强化学习模型的例子,例如父母的表扬、学校的好成绩、工作的高薪资等,这些都是积极奖励的例子。无论是工厂的机器人进行生产,还是商业交易中的信贷分配,人们或者机器人不断与环境进行交流以获得反馈资讯的过程,都与强化学习的学习过程相仿。更加真实的案例是AlphaGo的出现,其通过每步走棋的反馈来调整下围棋的策略,最终赢得了人类最顶尖的围棋职业选手。AlphaGo中所使用到的深度强化学习也紧随深度学习之后,成为了目前人工智能领域最热门的话题。事实上,强化学习也确实可以通过对现实问题的表示和人类学习方式的模拟解决很多的现实问题。
一方面,强化学习需要收集大量的资料,并且是现实环境中建立起来的资料,而不是简单的模拟模拟资料。不过幸运的是,强化学习可以通过自我博弈的方式自动生成大量高质量的可用于训练模型的资料。另一方面,与部分算法的研究成果易复现不同的是,复现基于强化学习的研究成果较为困难,即便是对于强化学习的研究者来说,需要重复实现已有的研究成果也十分困难。究其原因是强化学习对初始化和训练过程的动态变化都十分敏感,其样本资料基于线上采集的方式。如果没有在恰当的时机遇到良好的训练样本,可能会给策略带来崩溃式的灾难,从而无法学习到最优策略。而随着机器学习被应用到实际环境的任务中,可重复性、稳健性以及预估错误的能力变得不可缺失。
因此,就目前的情况而言,对于需要持续控制的关键任务而言,强化学习可能并不是最理想的选择。
即便如此,目前依然有不少有趣的实际应用和产品是基于强化学习的。而由强化学习实现的自适应序列决策能够给包括个性化、自动化在内的许多应用带来广泛的益处和更多的可能性。
1.制造业
日本发那科株式会社大量地使用强化学习算法去训练工业机器人,使它们能够更好地完成某一项工作。如图1.10所示,图中黄色的FANUC机器人使用深度强化学习在工厂进行分拣工作,目标是从一个箱子中选出一个物品,并把该物品放到另外一个容器中。在学习阶段,无论该动作成功还是失败,FANUC机器人都会记住这次的动作和奖励,然后不断地训练自己,最终能以更快、更精确的方式完成分拣工作。

图1.10 自动化工厂通过使用6台FANUC机器人,组成一个分拣系统来分拣瓶子
中国的智慧制造发展迅速,富士康等工厂为了让机器制造更加方便、快捷,正在积极地研发智慧制造来装备机器人。未来的工厂将会装备大量的智慧机器人,智慧制造将是工业4.0乃至工业5.0的重心。强化学习在未来智慧制造的技术应用将会进一步被推广,其自动化前景更是引人注目。
2.自动化系统
2017年6月,日本软银公司(Softbank)宣布收购Google旗下的波士顿动力公司(Boston Dynamics)。在这之前,波士顿动力的平行机器人的知名度非常高,其能通过各种巧妙的姿势轻松躲避障碍物。如图1.11所示,波士顿动力在2009年与斯坦福大学的吴恩达(Andrew Ng)教授合作,基于强化学习方法,通过讯号进行策略搜寻控制仿生狗的姿态以越过障碍。

图1.11 波士顿动力的仿生狗
在自动化领域,还有非常多使用强化学习来控制机器人进而获得优异效能的实际应用案例,如吴恩达教授所带领的团队利用强化学习算法开发了世界上最先进的直升机自动控制系统之一。
3.医疗服务业
在医学领域,医生的主要责任是为病人找到有效的治疗方案,而动态治疗方案(Dynamic Treatment Regime,DTR)一直是热门的研究方向。想要更好地进行动态治疗方案的研究,疾病的治疗资料对于从业者和研究者来说是弥足珍贵的。尤其是诸如类风湿、癌症等不能够马上治愈,需要长期服用药物和配合长期治疗疗程的疾病治疗资料。
而在这个过程中,强化学习可以利用这些有效的或无效的医疗资料作为奖励或者是惩罚,从患者身上收集各种临床指标资料作为状态输入,并利用有效的临床资料作为治疗策略的训练资料,从而针对不同患者的临床反应,找到最合适该患者的动态治疗方案。
4.电子商务个性化
南京大学和淘宝联合发表的论文(Virtual-Taobao: Virtualizing Real-world Online Retail Environment for Reinforcement Learning)详细介绍了淘宝使用强化学习优化商品搜寻的新技术。新构建的虚拟淘宝模拟器可以让算法从买家的历史行为中学习,规划最佳商品搜寻显示策略,并能在真实环境下让淘宝网的收入提高2%,这是一笔非常可观的交易额。
电子商务最初主要解决了线下零售商的通病——资讯不透明所导致的价格居高不下、物流不发达造成的区域性市场价格垄断。近年来,线下门店的价格与电商的价格差别已经不是很明显,部分使用者反而转回线下零售商,为的是获得更好的购物体验。
未来,对于零售商或者电子商务而言,需要主动迎合客户的购买习惯和定制客户的购买需求,只有个性化、私人订制才能在新购物时代为使用者提供更好的消费体验。
事实上,强化学习算法可以让电商分析使用者的浏览轨迹和购买行为,并据此制定对应的产品和服务,以匹配使用者的兴趣。当用户的购买需求或者状态发生改变的时候,可以自适应地去学习,然后根据使用者的点选、购买反馈作为奖励,找到一条更优的策略方法:推荐适合使用者自身购买力的产品、推荐使用者更感兴趣的产品等,进而更好地服务使用者。此外,[Nair, Arun, et al.]发表的文章也揭示了Google以使用强化学习作为广告的推荐框架(Gorila),从而大大提高了Google的广告收益(4%左右),如图1.12所示。

图1.12 Gorila被应用在Google的推荐系统中,每天为Google带来数以
亿计的点选量[Nair et al. 2015]
5.游戏博弈
强化学习应用于游戏博弈这一领域已有20多年历史,其中最轰动的莫过于AlphaGo围棋程式(见图1.13)。AlphaGo使用基于强化学习与深度学习的蒙特卡洛树搜寻模型,并将强化学习与深度学习有机融合。在第12章,我们会对AlphaGo程式背后的原理和设计思想进行详细介绍,这里不再赘述。

图1.13 AlphaGo围棋程式中的蒙特卡洛树搜寻[Min et al. 2017]
强化学习的应用案例还有很多,例如爱奇艺使用强化学习处理自适应码流播放,使得基于智慧推荐的视讯观看率提升了15%;又如阿里巴巴使用深度强化学习方法求解新型的三维装箱问题,提高了菜鸟网络的货物装箱打包效率,节省了货物的打包空间。
总而言之,强化学习让机器人处理一些难以想象的任务变得可能,但这仅仅是强化学习的开始,这一技术将会带来更多的商业价值和技术突破!

本书构建了一个完整的深度强化学习理论和实践体系:从马尔可夫决策过程开始,根据价值函式、策略函式求解贝尔曼方程,到利用深度学习模拟价值网络和策略网络。书中详细介绍了深度强化学习相关算法,如Rainbow、Ape-X算法等,并阐述了相关算法的具体实现方式和代表性应用(如AlphaGo)。此外,本书还深度剖析了强化学习各算法之间的联络,有助于读者举一反三。
本书分为四篇:初探强化学习、求解强化学习、求解强化学习进阶和深度强化学习。涉及基础理论到深度强化学习算法框架的各方面内容,反映了深度强化学习领域过去的发展历程和研究进展,有助于读者发现该领域中新的研究问题和方向。