APP下载

图灵测试在评估对话式AI方面毫无价值

消息来源:baojiabao.com 作者: 发布时间:2026-07-22

报价宝综合消息图灵测试在评估对话式AI方面毫无价值

作者:Puneet Mehta是msg.ai的创始人兼首席执行官,msg.ai是面向营销、商业和客户服务的对话式AI平台。

图片来源:iStock/BahadirTanriover

AI正成为新的用户界面。从自动驾驶汽车和亚马逊Alexa到机器人顾问和面部识别锁,消费者正以前所未有的方式与AI进行互动。而这仅仅是个开始。

长期以来,AI爱好者使用图灵测试(Turingtest)作为开发对话式机器人的指南。1950年开发出来的图灵测试侧重于可信度,分析机器的行为与人类无法区别的能力;研究人员历来认为通过图灵测试就是AI的终极目标。然而,这个基准测试是在AI不常见的时代搞出来的,那时候各团队研制机器的目的是研制克隆人类的机器。

在过去的几十年,好莱坞在《Her》和《我,机器人》等影片中尽情描绘AI,也试图克隆人类特征。好莱坞影片展现的场景远超出了当今商业技术所能达到的水平,但我们仍然似乎以这些虚构的解读来衡量AI的现代应用。

解决问题,不仅仅是模仿人类

今天,我们介于图灵测试和好莱坞咄咄逼人的机器人之间。AI在诊断疾病等方面超越人类的能力。这项技术在幕后支持消费者技术市场中一些最先进的应用,我们处于即将实施的阶段。

在现代AI的应用中,首要目标是解决问题。克隆人类特征只是精心设计复杂而高效的AI的一个方面,许多人类特征甚至产生了相反的效果。不过我们仍看到工程师在开发对话式AI响应方面时间延迟之类的机制,以便看起来好像机器人在“思考”,并采用类似策略好让技术设法通过图灵测试。

航空工程师当初设计747飞机时,测试了飞机是否可以飞越大西洋,他们没有试图制造一只机械鸽。与之相仿,自动驾驶汽车以一种独特的方式来学习,其行为与人类驾驶的汽车大不相同。为什么AI非得遵循人类模式不可呢?

由于对话式AI日益重要,对于我们认为成功的系统、我们认为未满足今日标准的系统有一种普遍的、实际的认识,这至关重要。AI会犯不同于人类的一系列错误,也会以不同的方式从这些错误中学习。这意味着我们衡量机器成功的方式要不同于衡量人类成功的方式。

衡量AI成功的新标准

那么,我们如何为对话式AI的实际应用来更新图灵测试呢?我们需要摆脱AI让人觉得多“先进”,而是专注于首要目标:效率。我们应该认为AI在今天我们解决问题方面提供了一种好得多的选择。随着我们不断前进,还需要扩大范围,涵盖对于最终用户有用的所有智能行为。研究人员可以运用以下几个关键绩效指标(KPI),更准确地衡量AI的成功。

它如何感知情境:AI并不在真空环境下工作,而是应该可以感知环境。对话式AI能够越来越多地接触各种情景信息,有望定制体验;它们拥有得天独厚的条件,以人类未必可行的方式来利用这些数据。比如说,作为一名消费者,如果真人客户服务代表知道我具体在哪里,我可能反而觉得不适。换成AI,我可能觉得这很酷,如果它为我提供精准的服务就更酷了。

它如何逐渐学习:AI应该从每一次交互中学习。比如说,研究人员应考虑机器人是否根据个人的反应和语气提供了正确的信息。他们还可能希望更仔细地分析机器无法回答的用户问题。判断一个AI好不好,关键不是看头一天的最佳性能,而是看逐渐上升的曲线。

它的综合性和关联性多好:迄今为止,大多数“优秀”的对话式AI其实擅长于处理一项任务,这从长远来看不实用。AI需要连接不同系统以覆盖整个客户旅程,好让客户在一个地方就能完成所有事情。比如说,零售商AI需要提供个性化的产品推荐、管理客户关系管理(CRM)系统、执行订单、提供状态更新以及管理客户支持。

它的记忆力有多好:人不应该再次自我介绍。对话式AI要有短期记忆和长期记忆,记住某个人过去喜欢的东西,并采取相应行动。今天当你致电客户服务、发送电子邮件或走进一家商店时,你是陌生人;你的偏好、过去购买的商品以及关于某品牌的社交评论都是未知的。出色的AI会根据某人在整个对话过程中提供的信息来采取相应行动。

它如何预测需求:AI需要利用预测型算法,根据历史情景和当前情况,预测消费者可能需要什么。AI应分析汇总的数据,从类似情况下导致最积极情绪的信息来确定最佳的行动方案。

它有多灵活:消费者在哪里,AI就需要在哪里。好的AI不是只出现在聊天、网站或语音通话等途径中。区别成功的AI与其他AI的将是跨平台的表现以及在每个接触点保持同一知识库的功能。

AI不是人类,人类也不是AI。总会有一些事情是人类更胜一筹的,拥有同理心和解决复杂的首次问题就是几个典例。只有当AI展示它能够比人类更快速、更智能地解决问题时,我们才能开始飞越海洋,避开机械鸽的蓝图。





2018-05-20 02:32:00

相关文章