APP下载

【台湾本土医院首次联合学习试验】台北荣总靠超级电脑验证可行性,要让本土AI有国际杯实力

消息来源:baojiabao.com 作者: 发布时间:2026-09-03

报价宝综合消息【台湾本土医院首次联合学习试验】台北荣总靠超级电脑验证可行性,要让本土AI有国际杯实力

台北荣总在国网中心进行联合学习模拟试验,发现联合学习方法训练的脑瘤辨识模型,虽只经过一次迭代,模型表现与真实基准(Ground truth)相比,其相似系数就达0.77。 (摄影/王若朴)

影像辨识AI要有良好的成效,就需要够多样的训练资料。“用台北荣总资料训练的AI模型,放到别家医院是否还能用?”台北荣总放射线部主任郭万祐问道。他就是两年前,催生台北荣总脑瘤辨识AI模型DeepMets的关键人物,更是国内第一家由医院发起联合学习(Federated Learning)试验的推手。 

这套DeepMets,是台北荣总利用20多年来累积的加马刀脑部MR影像,与台湾人工智能实验室(AI Labs)共同开发而成,30秒就能揪出脑部病灶、自动计算肿瘤体积,表现更媲美人类医生。虽然如此,有个问题一直困扰著郭万祐:模型是否也能精准判读,不同于台北荣总的异质MR影像?

为找出答案,他先利用转诊患者的脑部MR影像,来测试DeepMets。这些转诊影像来自不同医院,拍摄的环境、机器厂牌、型号和扫描参数都与台北荣总不同。结果发现,DeepMets虽有能力判读,但表现并不理想。

于是,去年六月,他决定“走出台北荣总墙外,”申请了健保资料AI应用服务试办计划,要利用健保署云端集中式的异质医疗影像,来强化DeepMets的判读力。

当时,他利用健保署提供的3,000多例脑瘤资料,对自家DeepMets进行多次再训练(Retraining),来找出提高模型表现的参数。后来,他用改良过的DeepMets来判读不同来源的MR影像,发现经过越多次异质资料再训练的模型,对不同厂牌影像的判读能力越好。

突破集中式机器学习瓶颈,以共享模型取代共享资料

这个发现促使郭万祐思考,要打造高解读力的医疗影像模型,除了集中式机器学习训练外,是否有其他方法?因为,健保署拥有全国合约医院上传的医疗影像资料,科技部也有国家级巨量医疗影像数据库,供医疗院所申请AI研究,但“这都是独步全球的作法,”很难复制到其他重隐私的国家。

也因此,他看上近年国际上兴起的联合学习,想透过分散式机器学习训练方法,在共享模型、而非共享资料的情形下,达到集中式训练的效果。

利用国产超级电脑试验联合学习,迭代一次就达77%

于是,台北荣总决定测试联合学习在台湾的可行性。郭万祐找来擅长AI研究的瑞典查尔摩斯理工大学交换生Lukas Nyström,利用国网中心台湾杉二号的云端虚拟环境,建置了5个代表不同医院的节点(Node),来模拟、测试联合学习训练方法。

“这场试验,可分为三大部分,来比对联合学习与集中式机器学习的差异。”Lukas Nyström解释,首先,他建立一个脑部MR影像资料集,八成影像来自台北荣总、其余来自开源影像,总共3,686例。接着,他选定最常用作脑瘤辨识的3D ResNet U-NET模型,以集中式机器学习方法,先以资料集训练一套脑瘤辨识模型。

这套模型,可辨识7种脑瘤,对不同来源的影像辨识度也不错。而且,以评估模型表现的相似系数DICE值来说,该模型的DICE中位数为0.87,比人类医生的0.74至0.85还高。

接下来,在第二部分,Lukas Nyström在台湾杉二号云端虚拟环境中,设置了5个节点来代表不同的虚拟医院,并让训练资料以非常态分布(Non-IID)的形式,分布在各节点。然后,他在5个节点各自训练一套模型,用来判读不同来源的脑瘤影像,发现“这些模型的DICE值,只有0.59。”

最后,第三部分,他利用联合学习方法,来改善这5个模型表现。首先,他收集这5个模型的权重,来进行聚合(Aggregation),也就是以聚合算法(如FedAvg再加上Adaptive Momentum优化器)来整合这些权重,优化为最适合各模型的参数,再将这个参数回传至5个节点。

按理来说,联合学习会不断重复上述过程,让模型表现越来越好,直到收敛至理想值。不过,在这次试验中,Lukas Nyström只将迭代过一次的模型拿来测试,就得到0.77的DICE。该模型,同样也能辨识7种脑瘤,但“模型在辨识肿瘤边界和扩散情形时,表现不理想。”

然而他也发现,经联合学习训练的模型,与集中式机器学习方法相比,较不会受到不同厂牌、不同扫描参数的影响。甚至,在一些领域表现特别好,比如多肿瘤辨识、复杂的脑瘤形状和大小辨识,DICE值最高可达0.98。

多层隐私保护机制,让联合学习模型更安全

Lukas Nyström并未就此打住。他还针对这套联合学习模型,采用不同资料保护方法,并进行模型测试。这是因为,联合学习虽只分享权重而非原始资料,但攻击者还是有可能从权重中,回推出特定的个人资料。为此,他在联合学习模型中加入多层保护算法,比如同态加密、SHA-256加密、差分隐私(Differential Privacy)等。

测试结果发现,在一般加入隐私保护情况下,模型表现并不会受到太大影响(DICE值约0.7)。然而,隐私防护使用得越多、超过临界值,模型准确度就会大幅下降。

这个方法,证实了联合学习不只能突破个资保护的限制,还能在额外的隐私防护机制下,训练出可辨识异质性资料的模型。

验证联合学习可行性,未来要跨出台湾、链接国际

“这次试验,证明了联合学习的可行性。”郭万祐点出,联合学习透过交换权重,不仅打破医疗数据难以分享的瓶颈,更可借此得到集中式训练的好处,强化AI模型对异质资料的解读力。

他指出,未来,台北荣总也许能藉联合学习,以北部总院为首,与北区其他分院来进行特定模型训练,或更进一步,应用于荣总北、中、南部的体系医院,甚至与其他体系医院联手训练,来训练模型。

最后,郭万祐也期望,台北荣总扩大医疗联合学习应用,走出台湾来“打国际杯。”

 相关报导  AI隐私难题新解方:联合学习

2020-07-09 09:47:00

相关文章