脸书发布AI动态基准测试平台Dynabench

脸书推出了新的神经网络基准测试平台Dynabench,其借由人类与模型交替循环,创建出更具挑战性的资料集,使得研究社群能够用来训练,更强大且灵活的人工智能模型,脸书提到,动态资料收集技术平台,能够衡量人们愚弄人工智能的方法,进而提供比当前基准测试,更好地评估模型品质。
基准测试在人工智能研究中,具有相当重要的功能,能够以量化的方式,清楚比较模型的效能,提供人工智能社群前进的方向,但脸书提到,基准测试越来越容易达到饱和,尤其是在自然语言处理上,人工智能在MNIST基准测试达到人类的水准,花了约18年的时间,而在ImageNet花了6年超过人类,但在GLUE基准测试的语言理解,只花约1年的时间就击败人类。
脸书提到,尽管人工智能在特定基准测试都超越人类水准,但自然语言处理的研究者也都必须承认,人工智能离真正理解自然语言的阶段,还有很长的路要走。
当前的静态基准测试有两个主要的问题,第一个是容易包含偏差与注解失真,而现在的机器学习算法,非常善于利用基准资料中的偏差,因此容易使算法发生过适(Overfitting)的现象。
而且静态基准测试会让社群过度专注特定指标,脸书提到,人们最终在意的其实不是特定指标或是任务,而是人工智能是否能够以人类期望的方式,与人类进行互动,因此人工智能真正的指标,不应该是精确性或是困惑度,而是与人类互动时,直接与间接的错误率。
因此脸书认为,应该从根本上思考,人工智能进行基准测试的方式,并且摆脱静态基准测试的局限,为此脸书开发了一个称为Dynabench的基准测试平台,透过加入人类的参与,挑战人工智能的能力。
Dynabench能够以静态基准测试无法达到的方式挑战模型,脸书举例,这就像是学生可能会透过死背课本内容来应付考试,但是在口试中死背是行不通的,在碰到试探性以及意料之外的问题,学生必须真正理解课本内容,才能回答。
当人工智能研究人员使用Dynabench评估模型效能时,该平台能够追踪欺骗模型且导致错误的范例,Dynabench会收集这些范例,并且放到新的Dynabench资料集中,研究人员可以利用这些更新资料集,训练更强大的模型。脸书提到,Dynabench的本质是一个科学实验,目的是要了解人工智能社群,是否能够更好地评估系统能力,并且使人工智能技术进步更快速。
Dynabench动态基准测试,克服了静态方法主要的限制,机器学习算法在测试过程不容易饱和,也不容易出现偏差或是失真,能够以人类真正在意的方式,衡量算法的效能。
Dynabench具有四项著名的自然语言处理任务,分别是自然语言推理、问题解答、情感分析和仇恨言论,能够更精确地衡量现今自然语言模型的品质,借由测试的过程,研究人员能够发现当前模型所犯的错误,透过反复训练与修正的循环,开发更先进的人工智能模型。
