瞄准医疗小数据痛点,整合视觉和知识语言AI来破除

HTC健康医疗事业部DeepQ总经理张智威 (摄影/洪政伟)
从事AI开发工作,常面临训练资料不足的问题,在资料被视为敏感个资的医疗业更是如此。为打破这个限制,坊间也出现不少方法,像是透过迁移学习(Transfer Learning)来进行预训练,或是利用生成对抗网络(GAN)来产生训练资料,提高AI模型准确度。
这些方法对HTC健康医疗事业部DeepQ来说,一点都不陌生。2年前,DeepQ就应用迁移学习来改善中耳炎AI辨识率,首先透过降低维度,将耳道照片转换为抽象的局部特征图像,再利用相似但与中耳炎无关的影像,比如柳丁切片、咖啡拉花等图片来训练AI算法,让准确率从7成跃升到9成以上。
这幕后的关键推手,就是HTC健康医疗事业部DeepQ总经理张智威。十多年前,他担任Google中国研究院院长,主导AI复兴初期的平行机器学习算法研发。后来,Google撤离中国后,他回到台湾,全心投入医疗AI的研究。对他来说,医疗小数据是一道有趣的挑战题,除了迁移学习,近年来他也将重心放在充满创作潜力的GAN上,要透过这个方法来产生可靠的医疗影像。
GAN自2014年问世以来,已衍生出数百种变形,就连获得图灵奖的脸书AI研究院首席科学家Yann LeCun都认为,GAN及其变形是机器学习近10年来最有趣的想法。
GAN最为人熟知的应用就是创作,比如生成名画画风的图片、古典乐风的曲子,或是去除照片中的物体、产生如假包换的假影片等。GAN的原理是利用两套类神经网络来互相竞争、产生仿真的资料,这两套网络包括了生成器(Generator)和鉴别器(Discriminator),生成器负责产生类似输入值的资料,鉴别器则负责判别生成资料的真伪,两者互相对抗、竞争,随着时间推进,两者表现也越来越好-生成的品质越来越高,鉴别的能力越来越强。
也因为GAN的特性,不少产业运用它来解决训练资料不足的状况,比如医疗业者利用GAN产生特定的医疗影像,再用这些影像来训练另一套AI模型来辨识特定疾病。虽然GAN创作潜力高,但仍有其限制,像是会生成不符合现实条件的影像,或者是在自身训练资料代表性不足的情况下,难以生成多元的影像。
举例来说,如果要GAN生成出血性和缺血性脑中风的医疗影像,就可能发生两种状况。第一是产生不合逻辑的影像,比如出血点在神经周围,而非在血管附近。第二则是训练资料代表性不足时,如果只有缺血性中风影像作为输入值,GAN就难以产生出血性中风的医疗影像。而这就是医疗业所面临的小数据痛点之一。
结合专业知识,引导GAN产生训练样本中未出现的类别影像
张智威团队透过生成未知花卉的任务来验证KG-GAN。左边两排为实际花卉影像,中间是KG-GAN成功生成的花卉影像,右边则是不成功的样本。(图片来源/DeepQ)
为改善这个问题,张智威带领DeepQ团队锁定GAN,历时一年研发出知识型AI框架Knowledge-Guided GAN(简称KG-GAN),整合了专业知识和GAN框架,要在训练样本代表性有限的情况下,来提高生成影像的多样性,以及精准度。
“KG-GAN运用了AI表现最好的两个领域,也就是自然语言处理和影像处理。”在架构上,KG-GAN可分为两大部分,一是建构任务所需的专业知识,二是训练两组生成器G1和G2,分别针对已知和未知的影像特征来学习。首先,团队将专业知识化为约束函数,来判断一张影像是否具备特定的特征,同时藉这个专业知识来引导G2,来探索、产生训练样本中未包含的特征,并让鉴别器合理容忍生成影像的多元性。
与此同时,专业知识也扮演约束角色,来避免G2产生不合逻辑的影像,比如在神经周围出血的影像,或是自然界不存在的灰色玫瑰。此外,团队也设计G1和G2间可共享权重,以让KG-GAN利用两者所学习的知识。
“我们利用花卉生成的任务,来验证KG-GAN框架。”张智威指出,团队的验证目标,是要让KG-GAN产生训练样本中未出现过的花卉种类。首先,团队从牛津花卉资料集(Oxford Flower Dataset)中取得花卉影像及其文字描述,并分为82种已知花卉和20种未知花卉,目标是要用这82种花朵影像,以及这20种未知花朵的文字描述,来产生这20种花朵的影像。在专业知识部分,团队利用语义嵌入表征(Semantic Embedding Representation)和深度类神经网络构成的约束函数,来找出不同花卉种类的关系与其文字特征,并以此来导引KG-GAN产生目标花卉影像。
| 要发展人类水准AI,好比整合大脑枕叶、额叶、顶叶、颞叶功能,得将认知、语言、视觉、问题解决和记忆处理等能力融会贯通。─── HTC健康医疗事业部DeepQ总经理张智威 (摄影/洪政伟) |
结果显示,KG-GAN可生成未知的花卉影像,在颜色部分“非常准确。”但张智威也坦言,KG-GAN仍有进步空间,像是花瓣形状等细节可再更细致、更具体,团队也根据不足之处,持续改善、精进研究。因为,KG-GAN要是发展成熟,就能在医疗专业知识的导引下,生成可靠、真实的影像,来补足医疗小数据缺口。也因为KG-GAN的潜力,DeepQ将其订为未来三大发展目标之一。
对张智威来说,KG-GAN不只是解决医疗小数据的尝试,更是AI发展的突破。因为,“一直以来,AI擅长视觉辨识,就像是只发挥人脑的枕叶功能。”但要发展近似人类水准的AI,就好比要整合人类大脑的枕叶、额叶、顶叶和颞叶,将认知、语言、问题解决、记忆处理等能力融会贯通,就连去年获得图灵奖的三位得主,也如此认为。而KG-GAN结合了自然语言和视觉处理,有如运用大脑的枕叶和额叶功能,是发展人类水准AI的第一步。
改良式增强学习突破医疗问诊困境
除了医疗小数据,医疗问诊也是张智威团队的AI精准医疗研究方向之一。他指出,医疗问诊的重点在于精准提问,要从有限的已知资讯中,透过最少量的问题来判断病症,并给予最准确的诊断建议。
以AI进行医疗问诊的方法有很多种,其中之一就是透过决策树来分类病患的状况。但是,“决策树无法缩减问题范围。”而在2年前一场国际医疗竞赛之后,张智威团队灵机一动,要藉AlphaGo成功运用增强学习的经验,透过代理人(Agent)奖惩机制,结合美国开源的问诊资料集,来训练代理人询问病患病症,并根据病患回答来预测疾病状态。要是提问正确,就给予奖励,要是提问太多或偏题,就给予惩罚。
不过,代理人问诊的初期表现并不理想。张智威分析了原因,将AlphaGo与医疗问诊这两种应用情境相比,首先,围棋棋谱的可能组合有限,但人体健康状况却是无限。再来,围棋结果只有输赢两种,但人体有上百种症状,诊断结果可能只是其中2、3种。除此之外,AlphaGo能够任意探索新棋路,然而问诊AI受限于医药规定,无法随意探索新方法。
这些反思,催生了后来的改良方法。2017年时,张智威与团队利用阶层式增强学习,组成代理人医师团队,每个代理人负责不同的身体部位,透过主代理人选择一个部位的代理人来问诊,同时考量病症情境,比如病症地理资料、患者医疗病史、疾病好发时间等,来综合诊断。这个作法,代理人平均只要7.24个问题就能完成问诊,而AI问诊的准确率也从63%提高至76%。
张智威团队更在这个基础上,于去年发表了一套改良式增强学习方法REFUEL,透过稀疏特征探索(Sparse feature exploration)来进一步减少问诊问题、更快速得到患者“是”的答案。他解释,人体约有200种症状,而患者可能只得其中3种,因此在问诊初期,如果只随机选择症状来询问,容易得到“否”的回答,对问诊并无助益。
REFUEL就针对这个情况,提出两个机制来改善。首先是奖励设计(Reward Shaping),只要代理人的症状提问得到正面回答,就给予额外奖励,并同时保持马可夫决策过程(MDP)的最佳策略,将策略搜寻导引至更好的方向。再来是特征重建(Feature Rebuilding),根据关联性来重新分配特征权重,借此找到关键症状。
这个机制,将AI问诊准确率从76%提高至85%,论文也在国际AI顶级学术会议AAAI与NeurIPS发表。此外,团队也将REFUEL理论实际运用于导诊功能,内嵌在万芳医院的AI问诊机器人万小芳中,可根据使用者的病况,来进行导诊判断和挂号,并根据医生反馈来不断精进背后的算法。
精准医疗另一目标,要靠多层次区块链弥补传统区块链缺陷
DeepQ未来发展三大目标,不只将火力集中于AI,还包括了区块链。张智威看好区块链应用于医疗产业的潜力,去年便与台湾大学、史丹佛大学共同发表一套多层次医疗区块链(Multilayer Blockchain for Healthcare),首波瞄准医疗隐私资料的分享,要透过区块链智能合约(Smart Contract)机制来交换电子病历。
他首先指出,在设计和部署分散式应用时,存有三个核心需求,也就是分区容错性(Partition tolerance)、连贯性(Consistency)和可用性(Availability);其中,分区容错性指的是在分散式系统里,就算有台机器故障,仍不影响其他机器运作。
这三者合称为CAP定理,但CAP定理强调,分散式应用最多只能满足两个需求,难以三管齐下。以CAP定理看来,区块链因去中心化关系,具备了分区容错性和连贯性这两个特点,但可用性就差强人意,因为交易速度并非即时。
为强化可用性、保护医疗数据的个人隐私,团队与台大资工系教授廖世伟联手,设计了多层区块链架构,可分为基础层和分支层。基础层保留了比特币区块链的属性,保存了区块头的梅克尔树根哈希值,来提高交易速度;而分支层则设计来满足隐私、储存等需求,透过智能合约机制来进行病历交换,而且,智能合约上储存、记载的是程式码,并非病历资料本身,因此免除了资料隐私问题。
一如DeepQ的改良式增强学习理论REFUEL,这个多层次医疗区块链机制也实际应用于产业中,在今年初发表的彰基兰医师AI智慧聊天机器人中首次亮相、提供跨院病历交换功能,团队也与史丹佛大学的开源虚拟助理实验室计划OVAL联手,以这个多层次医疗区块链机制共同申请到美国国家科学基金会(NSF)支援,要来发展更多元的智慧聊天机器人应用,延伸DeepQ的精准医疗研究。
CTO小档案
张智威
HTC健康医疗事业部DeepQ总经理
学历:美国史丹佛大学电机工程博士
经历:1999年完成学业后,受聘为加州大学圣塔芭芭拉分校电机电脑工程系助理教授,后晋升终身职正教授。2006年担任Google中国研究院院长,主导大数据驱动平行机器学习算法研发,6年后加入HTC,担任健康医疗事业部DeepQ总经理至今,亦是斯坦福大学电脑科学客座教授。
公司档案
DeepQ
● 地址:新北市新店区北新路三段207-5号13楼
● 成立时间:2017年
● 主要业务:开发与销售医疗人工智能和医疗虚拟、扩增实境产品
● 员工数:80人
公司大事纪
● 2017年:成立HTC健康医疗事业部DeepQ公司,与万芳医院推出全台首个AI医疗服务聊天机器人万小芳,其中导诊功能采改良式增强学习机制
● 2018年:推出云端DeepQ人工智能平台;与内湖三总医院合作开设亚洲首个VR智慧外科SDM诊间;与台北医学大学成立VR解剖学教室;推出疾管署防疫聊天机器人疾管家2.0,导入自然语言处理扩充传染病咨询功能
● 2019年:与万芳医院建置多人体验VR团体卫教诊间,透过VR一体机实现医病共享决策;与彰化基督教医院推出跨院AI+区块练医疗照护对话机器人‘兰医师’,应用区块链于病历交换;推出医疗DeepQ人工智能平台
