APP下载
报价宝  ›  综合  › 

交大学生如何在AWS迷你自驾车赛夺下世界第三?让RL模型克服真实环境变化是关键

报价宝 来源:baojiabao.com 发布时间:2020-01-10 13:48:00 09月30日更新
报价宝综合消息交大学生如何在AWS迷你自驾车赛夺下世界第三?让RL模型克服真实环境变化是关键

交大CGI实验室的学生朱咏嘉(Roger),去年在拉斯维加斯的AWS DeepRacer League中获得第三名,今天也在一场活动中分享参赛的经验秘诀。

图片来源: 

摄影/翁芊儒

交大资工系电脑游戏与智慧实验室(CGI)的学生朱咏嘉(Roger),继去年6月获得AWS自动驾驶迷你车竞赛(AWS DeepRacer League)台北场的冠军后,同年12月更在拉斯维加斯举行的世界杯比赛中,打败一众顶尖的AI工程师,获得全球第三的佳绩。由交大资工系教授吴毅成领导的CGI团队,如何设计出能适应现实环境的算法、提高强化学习模型的表现?昨天一场活动上,CGI团队现身说法,分享了参赛半年的经验秘诀。

AWS的DeepRacer是一款原比例1/18的模型赛车,搭载Intel Atom CPU、400万像素的深度学习镜头,专为强化学习(Reinforcement Learning)驱动的赛车比赛所设计。选手参赛前,需先使用Amason SageMaker RL平台,线上训练强化学习模型,再以USB传输直接部署到迷你小车中,让车子能根据输入的影像来做出相应决策。

要训练出RL模型,参赛者可以直接选用平台上提供的模型进行训练,也能选择自行以奖励函数(Reward Function)来开发,根据赛车是否正确转弯、超出赛道、速度快慢等行为,来给定正负回馈,定义各项行为的参数数值越精细,就有机会训练出能力越强的模型。朱咏嘉说明,官方预设提供了7个方向与3种速度可用来训练模型,这个参数组合可以训练出能预测21种行为分布概率的模型,车子再选择概率最高的行为,作为最后采取的行为。

CGI团队成员陈源灏也举例说明,若要让车子维持在中心线,可以将函数设定成,当车子距离赛道中心小于0.1的值时,就给一分的奖励,反之则不给奖励,“这种设定方法是希望车子待在赛道中心以防出界,但训练出来的AI也较保守,转弯的时候不会切西瓜、速度比较慢。”但这时,如果在奖励的部分多加上“速度”的参数,就可能再优化AI的表现。

除了奖励函数的设定之外,要让模型表现更好,还得再进一步调整深度强化学习算法PPO(Proximal Policy Optimization)的超参数,但朱咏嘉也表示,AWS在SageMaker中有提供RL、奖励函数等初阶课程,但对于调整PPO超参数等进阶课程的资源较少,“初学者从奖励函数下手比较有趣一点。”

实体赛虚拟赛双料冠军!CGI团队揭露参赛的经验秘诀

CGI团队首先参加了去年6月在台北举办的实体赛车比赛。准备过程中,由于团队训练的多个模型只有在模拟器中测试过,并无在实体场域运行的经验,因此产生了sim2real(从虚拟到真实)的问题,“这是我们当时遇到的最大挑战。”陈源灏说明,RL模型的训练过程中,得经过几百万次的试错过程,但因只能用虚拟环境来训练,不会遭遇到真实环境的情况,例如光影变化,也不会有震动造成的影像模糊问题,这些特殊情况,都可能影响训练好的RL模型无法适应实际上场时的场地条件。

为了解决这个问题,团队决定在训练过程的输入影像中,随机加上光影,先取中心点当阴影中心,再随机制造出角度、周长、光影深度不同的椭圆形,来模拟实体环境中可能出现的噪声。训练完的模型,尽管没有任何实体赛车的经验,仍顺利为4名团队成员分别夺得一、三、五、七名的佳绩。

在训练过程的输入影像中,随机加上光影,来克服sim2real(从虚拟到真实)的问题。

接着,团队也报名了10月举行的线上虚拟赛,同时也是6场全球虚拟赛中的最后一场。虚拟赛的赛制,是让参赛者在为期一个月的时间内,能无限次的提交训练完的模型,并以最快的秒数作为最终成绩。而且,不同于先前实体赛中,训练用的赛道与比赛用的赛道相同,虚拟赛使用两个不同的赛道,就是要考验参赛者模型应变的能力,“所以不能只是死背赛道。”CGI团队成员黄劲博表示。

这次虚拟赛中,团队遇到的问题,则是每次提交了模型去比赛时,无法看到赛车在模拟器中实际比赛的状况,只会得到一个秒数成绩及log档,“这是很大的问题,因为我们不知道比赛过程发生什么事,是跑太快、太慢,或是模型已经过适(Overfitting)导致特定的弯都出错?”

黄劲博表示,为了解决问题,团队开发出一个可以从log档画出赛车路径的分析工具,不仅能视觉化行进路线,每一段的车速还能根据高、中、低速以不同颜色标记出来,比如从最后以7.172秒得冠的路径中,可看到大多数的路段都以高速完成。

该工具能从log档画出赛车路径,路径每一段的车速还能根据高、中、低速以不同颜色标记出来。

另一个分析工具,则是为了持续监测模型更新前后的表现差异。如图示,左图的每一轨,就是每个模型在模拟器中运行50次后的平均速度比例分布图,绿色代表高速、橘色是中速、蓝色是低速,协助团队观察该模型较常用哪种速度去比赛;右上方的图表则代表模型的平均完成进步图,随着迭代次数增加而持续进步;右下方图表则是平均完圈率,“透过以上三种工具,我们更容易选择出要用哪个模型去比赛。”黄劲博说。

借着本身的实力以及辅助的小工具,团队最后分别获得了1、2、4、5名的成绩,其中获得第一名7.172成绩的陈源灏(Eric),更是虚拟赛中有史以来最好的成绩,顺利晋级获得参加AWS世界杯决赛的资格。

买错实体赛道!世界杯决赛前紧急调整作战策略

为了在最后的实体赛中脱颖而出,团队也决定要购入一张实体赛道,来演练在实体场域中的可能遇到的问题,并借此测试出表现最好、最适合上场参赛的模型。然而,十月取得赛道时,才发现帆布材质的赛道造成了严重的反光,导致模型无法根据输入影像来有效做出判断,朱咏嘉甚至把台北场的冠军模型放上去测试,“结果连半圈都跑不完。”后来,团队又花费约8万元来制作一张实体赛道,才解决了反光问题。

除了实体场域的建置,团队也再开发了两个视觉化的分析工具,分别是模型注意力分布图,以及模型决策的分析图。前者以红色、绿色、蓝色作为注意力由高到低的表现,“从影像来,红色在中线跟边界的白线上,代表模型是根据这两者来决定要不要前进,这就是正确的。”反之则代表模型训练有问题;后者则是将模型选择21个动作的概率视觉化,来分辨模型的决策是否正确,“算是除错用的工具之一。”朱咏嘉表示。

模型注意力分布图,以红色、绿色、蓝色作为注意力由高到低的表现,

模型注意力分布图,能视觉化该模型选择21个动作的概率,如右图的21个指标,决策率最高的会亮红色。

正当团队以为软硬件都准备完成,可以在实体场地进行模型的训练与优化时,“我们11月中才发现,实体赛道印错了,比赛用的是另外一个,但也来不及重印了。”对此,团队只好重新拟定策略,改成先以错误赛道的虚拟模拟器来训练模型,并放到错误的实体赛道中去测试,从中挑出几组表现好的超参数后,再放进指定比赛赛道的模拟器中测试,最后到拉斯维加斯比赛场地中,再根据实际测试结果选择比赛用的模型。

朱咏嘉表示,比赛过程很惊险,一度面临被淘汰的危机,甚至有一场跑出8秒多的成绩却没被裁判纪录到,不过经历层层关卡,最终仍夺下全球第三,在一众AI好手中脱颖而出。他也表示,未来将鼓励学弟妹也去参赛,并把这次累积的经验与知识传承下去。

文章标签: 报价宝 降噪耳机价格 耳机价格 红米手机价格 华为手机价格 小米手机价格 电视机价格 笔记本电脑价格 笔记本价格 汽车价格 笔记本价格 小米手机价格 红米手机价格 耳机价格 降噪耳机价格