美国国卫院建立国家级医疗AI数据库,未来资料将完全共享

负责建置美国国卫院(NIH)IT系统和大型数据库的主任范扬政表示,目前NIH正建置国家级医疗AI数据库,透过去识别化,未来将全数资料共享。
摄影/王若朴
随着医疗AI兴起,近年来,不少国家开始建置国家级医疗AI数据库,台湾科技部也在2017年时,先锁定影像,发起巨量医疗影像数据库计划,要建造属于国人的AI医疗影像数据库。
而美国则不限定影像领域,“在去年启动了医疗AI数据库计划,”美国国家卫生研究院(NIH)神经异常暨中风研究中心(NINDS) 资讯科技与生物资讯部门主任范扬政说道。他在美国国卫院任职近20年,建置过不少主要IT系统和大型生医数据库,像是可预测蛋白质交互作用的数据库IBIS、生医转译研究资讯系统(BTRIS)、生医研究讯息运算系统(BRICS)等,近来更专注于医疗AI数据库的建置。
他指出,2018年时,美国国卫院与Google、微软、麻省理工学院等在医疗AI领先的团队,共同讨论未来方向,一致认为唯有NIH建置AI-ready的数据库,医疗AI才能大幅进步。
FHIR和FAIR是美国国卫院医疗AI数据库的2大准则,首重资料可取性和共享性
于是,NIH订定了几个大方向,并启动了医疗AI数据库的建置计划。首先,医疗AI数据库的目标有两个,第一是要创建、管理可用于AI生医应用的资料集,而且这些资料集要可用、有代表性且合乎伦理;第二则是要共享和维护这些资料集。
要达到这两个目标,“FHIR和FAIR就是2大准则。”其中,FHIR指的是一套资料标准,能用来描述资料格式(Data format)和元素(Element),此外,它也指用来交换电子病历或生医研究资料集的应用程序界面(API)。FHIR旨在强化医疗资讯的流通,不仅能让医疗讯息用于多种装置,比如电脑、手机、平板,还可提供资讯给第三方服务开发者,有助于医疗资讯的互通。
对NIH来说,FHIR还包括一个关键,也就是数位物件识别码(DOI)。DOI就像参考文献的身份证号码,具永久且唯一的特质,不必担心连结失效问题,因此可帮助研究人员快速找到数据库中的特定数据,是进行整合分析(Meta Study)的利器,“这也是NIH这1、2年建置数据库的重点。”
再来则是FAIR,也就是资料共享的原则,包括了可搜寻(Findable)、可取得(Accessible)、可交互使用(Interoperable)、可重复使用(Reusable)等特点。范扬政指出,FAIR原则是要确保研究员能储存、使用和分享NIH产出的资料与软件,来加速创新技术的研发。
在这个基础上,他表示,未来NIH医疗AI数据库建置完成后,将提供完全开放的资料共享(Data Commons)服务,“这也是NIH未来5至10年的AI数据库走向,”就如同其他100多个已开放的研究数据库一样。
然而,资料开放难免引起个资隐私争议。范扬政解释,美国国卫院遵照新一套资料共享规则(Common Rules),除特殊疾病如精神疾病、艾滋病等之外,其他临床实验资料只要经去识别化,即可公开共享。这套规则,也适用于过往研究成果,也就是说,过往研究要是含有病人资料、且无法再次联络上病人时,只要将其资料去识别化即可释出。
有别于美国做法,科技部前瞻司则指出,台湾医疗影像AI数据库是透过台大、北医、台北荣总团队来标记院内资料,数据库未来完成后将置于国网中心平台,但考量资料来源为病人病历,数据库将只限于学研团队申请使用,来开发AI模型。文◎王若朴
