克服增强学习缺陷,Google让AI拥有好奇心、自我激励学习

现实世界中奖励很少,因此多数的增强学习算法都努力的解决这种奖励稀疏性,而解决方式之一就是让人工智能自己创造奖励,Google Brain、DeepMind和ETHZürich合作发表了基于情景记忆的模型,能够提供增强学习获得类似好奇心的奖励以探索环境,这扩展了增强学习可以解决问题的范围。
增强学习现在是机器学习中热门的研究领域之一,当人工智能代理做了正确的事给予奖励,反之则给予惩罚。DeepMind以这种方式教DQN算法游玩Atari游戏,也让AlphaGoZero能与人类在围棋打得难分高下,OpenAI也是用增强学习训练Open Five游玩线上战斗竞技类游戏Dota 2。另外,Google也以增强学习教机器手臂以近似人的行为抓握物体。
Google提到,标准的增强学习算法有其问题,人工智能总会在回馈稀疏的环境中挣扎,而现实世界通常是这样的环境条件。以在大型迷宫寻找宝藏为例,当人们在迷宫中四处搜寻,但都没找到宝藏时,在缺乏寻得宝藏的正向回馈奖励下,如果都不继续坚持而直接放弃,则永远无法得知自己是否朝向正确的方向前进,而不会让人类在迷宫中原地打转的驱动力便是好奇心,激励人类朝向一个不熟悉的方向探索以追寻宝藏。
而Google Brain、DeepMind和ETHZürich最新的合作成果,是以基于情景记忆的模型提供代理人好奇心奖励,让代理人有动力继续探索环境,但是探索环境也并非终极目标,而只是达成原始任务的手段,完成任务仍然是最重要的事情,因此研究团队将模型提供的好奇心奖励添加到原始任务的稀疏奖励中,这样的结合使得奖励不再稀疏,标准增强学习能够从中获得良好学习的驱动力。这个好奇心方法扩展了增强学习可以解决问题的范围。
这个方法的关键想法是把代理人从环境中获得的观察结果储存在情景记忆中,并奖励代理人取得尚未在记忆中出现的观察。因此不在内存中,是这个新方法对好奇心的定义,驱使代理人寻求不熟悉事物,而这将带领人工智能代理人前往新的位置,进而防止原地打转的行为出现。
过去也有类似的研究,最近一篇论文Curiosity-driven Exploration by Self-supervised Prediction探讨了名为ICM的方法,是透过对即将要发现的事物进行预测,当预测与实际不符时便获得惊讶奖励。ICM方法建立了世界动态的预测模型,在模型未能做出良好预测的时候给予代理人奖励,但由于探索未曾发现过的位置不在算法中,代理人到这些新位置,只是为了要获得惊讶奖励,因此在某些情况下,代理人为了要获得最大化的奖励而故意造成自我惊讶,导致奇怪的行为。
ICM算法的这个自我惊讶的问题,会让代理人发生拖延症,以上述在迷宫中找宝藏的例子,当代理人在迷宫中遇到电视物件,代理人可以随意的切换节目频道,当预测下一个频道的节目与实际切换的不符合时,便能获得惊讶奖励,而ICM代理人为了最大化奖励,便会在电视前随机切换频道,借由预测错误获得源源不绝的奖励。
Google基于情景记忆的好奇心模型,被证明不容易产生类似自我放纵获取即时满足感的现象,同样已在迷宫中切换电视频道来说,最终所有频道的内容将都在内存中,因此所有内容都会变得熟悉,即便节目随机变换也是一样,好奇心模型不是对未来进行预测,而检查过去是否已经观察过相同的情景。
但要让代理人判断看到与内存中相同的事物这件事情本身也是个问题,无法以完全匹配的方法来实作,因为在实际情况中,代理人很少会看到两次完全相同的事情,即便第二次进入相同房间,也会因为记忆中看房间的角度不同,而被认为是不一样的经验。最后研究团队以深度神经网络来判断两种经验相似的程度,而非对内存进行精准匹配。在训练这个神经网络时,研究团队让时间作为判断经验远近的重要考量,时间接近度高则会被视为同一经验。另外,研究人员还以可达性来评断新颖性,以神经网络来评估经验之间的距离,决定新颖与否。
研究团队分别在ViZDoom和DMLab这两个视觉丰富的3D环境中测试好奇心模型,在这些环境中,代理人的任务是处理各种问题,像是在迷宫中搜寻目标物、收集好物体以及避开坏东西。
研究团队提到,他们的方法与先前的研究在相同的条件下相比,更能学习合理的探索行为,这是因为基于情景记忆的好奇心模型不会尝试预测行为的结果,而是寻求在情景记忆中未曾出现的观察,换句话说,代理会倾向追求目标,而这些目标是需要更多努力才能达成,而非仅靠单一操作。另外,这个方法给予奖励的方式会惩罚代理人绕圈子的行为,因为代理人在同一空间绕完一圈后,就不会再观察到与内存中不同的事物,因此也不会获得任何奖励,这也让代理人有更好的探索行为。
