你知道机器学习可以像放射科医生一样阅读胸部X光片吗?
点选上方关注,All in AI中国
探索:利用对抗性网络实现人类水平的胸部x线胸片器官影象分割 。

医疗保健需要人工智能来扩大规模
今天,世界上只有大约10%的人口能够获得良好的卫生保健服务,而世界上有一半人甚至无法获得基本的卫生服务。即使在发达国家,医疗体系也面临着压力,成本不断上升,等待时间也很长。在短时间内训练足够的医生和护理人员来满足日益增长的需求是不切实际的,如果可以的的话,解决方案必须包括技术突破。这就是机器学习(ML)和人工智能(AI)可以产生巨大影响的地方。
在这篇文章中,我将介绍一个简单但非常有效的深度学习方法,我开发它来分析胸部X射线影象。更多的细节可以在原文中找到。
这里有很多胸部x光片(CXRs)
CXRs是最常见的医学成像型别,通常比其他先进的成像方法(如MRI、CT扫描、PET扫描)高出2 -10倍:
在2000多万张x光片中,超过800万张是胸部x光,使胸部x光成为最常见的标准化医学成像。
CXRs受欢迎的原因包括:
辐射相对较小;低成本;只需要不到一分钟的时间就可以拍一张照片(相比之下,CT扫描需要一个小时或更长时间)。因此,CXRs被广泛用作筛选工具。如果你的肺部有问题,需要更多的证据来诊断,你的医生通常会先开一个CXR。CXR提供了一个低保真度的检视,为其他更为复杂的成像方法优先开拓了道路。
从与放射科医生的交谈中,我了解到,一家规模较大的医院每天可以产生数百甚至数千个CXR,所有这些都需要放射科医生或其他医生来阅读,当然,其他医生就不那么理想了。而且通常最重要的是要在数小时内完成阅读,以发现紧急情况(如住院病人出现的情况)。总之,对放射科医生和内科医生来说,阅读CXR是一项相当艰钜的任务。
CXR的读取涉及很多步骤,可能很费时间
受过良好训练的放射科医生阅读CXR的平均时间约为1-2分钟。因为CXR阅读是一个非常系统的过程,所以很难加快速度。CXR阅读的一个流行助记符是:ABCDEFGHI。A代表呼吸道,B代表骨骼,C代表心脏…… 它并不短,走捷径意味着有可能会忽视重要的资讯。通过研究CXR,我也意识到阅读CXR实际上是非常困难的。我把诊断为结核病的CXR带到了一位普通医生那里,他在很大程度上无法判断这个病人的结核病是属于阳性还是阴性。与我交谈的放射科住院医生告诉我,在住院医师的培训期间,他们将阅读大约10,000张CXR影象,以熟练掌握它。这让我想起MLB中大多数职业棒球击球手需要挥动10,000次才能击球。似乎真的需要这么多的训练资料,人类才能开始识别CXR中的模式。这种陡峭的学习曲线可能是因为CXR与我们一生中所训练的自然影象是如此不同。这也成为AI系统的一个障碍,我们稍后将对此进行讨论。
放射科医生处于短缺状态
我们只讨论CXR。随着CT扫描和其他成像技术的普及,放射科医生的工作量将大幅增加。发达国家长期缺乏放射科医生是有目共睹的。例如,英国发表了关于英国临床放射学的报告,几年来的主要发现是"劳动力短缺加剧和成本螺旋式上升",很多放射科工作人员正显示出压力和倦怠的迹象。在医疗基础设施落后的发展中国家,这种训练有素的放射科医生的短缺情况更为严重。CXR中的器官影象分割
理解CXR的一个基本任务是识别肺场和心脏区域:
左:日本放射学会CXR。右图:相同的CXR上覆盖着人类标记的左肺、右肺和心脏轮廓。
实际上,你可以从肺的轮廓得到很多资讯:异常大的心脏可能意味着心脏肥大(心脏的异常增大);肋膈角变钝(下图3)可能提示胸腔积液。这也有助于将诊断AI算法仅局限于肺场,最小化影象是其他部分的伪讯号。(这是一个众所周知的问题,因为神经网络分类器有时会利用CXR中的构件,比如曝光和文字。)
肺野周围重要轮廓标志:肺野不包括主动脉弓(1);健康患者应能看到肋膈角(3)和心膈角(2)。肺门和其
临床应用与CXR分割
除了协助计算机辅助诊断外,CXR分割直接导致自动计算心胸的比值。CTR就是心脏的宽度除以肺的宽度(见下图)。
CTR是一项重要的临床指标。CTR > 0.5提示心脏增大,或心脏增大,这通常是由于心脏病或以前心脏病发作。测量CTR是非常单调乏味的。它包括精确定位心脏和肺的左右大部分位置,并且实际进行测量。因此,大多数放射科医生干脆跳过这个测量,直接观察心脏是否太大。在中国这样的一些国家,CXR读者需要采取明确的CTR测量,这会显著增加放射科医生的工作量。
很容易看出,高质量的肺分割可以影响自动计算CTR:

这些是根据我们的方法生成的肺面罩计算的CTR测量线(将在第2部分中介绍)。 实际上,在我们的后续工作中,我们发现CTR计算要非常准确。
利用神经网络分割CXR的挑战
挑战1:隐性医学知识
因为CXR是一个三维人体的二维投影,影象中许多生理结构相互重叠,很多时候,它是对你在哪里画边界的判断。以下面的案例为例:
左:CXR,轻度畸形。右:人类标记的左肺和右肺区域。
影象显示在左下叶(影象的右侧)和左肺的顶部有一些瘢痕。它们使肺的轮廓变得模糊。因此,必须利用医学知识通过推断肺的形状来绘制红色的轮廓。分割模型必须获得轮廓形状的全域性概念,以解决模糊边界周围的区域性模糊,并生成与人工标注相似的正确轮廓。
挑战2:非自然影象
CXR影象看起来一点也不像我们在日常生活中看到的自然影象:

大多数现有的计算机视觉神经网络都是为丰富多彩的自然影象设计的,并利用其中丰富的纹理,这使得直接在CXR上应用现成的解决方案变得困难。
挑战#3:小的训练资料
由于隐私问题和管理障碍等原因,CXR的公共医学影象要比自然影象小得多。此外,与任何注释器都可以标记的自然影象不同,医学影象标记只能由医生和受过训练的专业人员来完成,从而导致标签获取成本较高。
据我所知,目前只有两套公开可用的CXR资料集,其中一套包含247张影象,另一套包含138张影象。这至少比ImageNet挑战小3000倍,后者有120万到1400万张带标签的图片。事实上,在ImageNet资料集上训练的神经网络是如此强大,以至于几乎所有现有的神经网络分割模型都是用在ImageNet challenge(如ResNet或VGG中学习的引数进行初始化的。目前还不清楚这样一个小资料集是否足以满足数百万到数亿引数的资料神经网络。
解决方案的峰值
在本系列文章的第2部分中,我们将设计模型来解决上述每个挑战。这里是一个快速预览:与自然影象不同,CXR是灰度的,并且是高度标准化的(挑战#2)。这一观察结果使我们设计的分割网络使用更少的卷积通道,相比于使用不同颜色和形状的ImageNet资料集的网络。不幸的是,这种改变使得从ImageNet训练的模型中进行迁移学习变得不切实际。然而,通过使用更少的过滤器,我们的模型只有很少的引数(小的模型容量),这些引数可以最小化在小的训练资料上发生过拟合的风险(挑战#3)。
最后,也许最具挑战性的是如何教授人类利用医学知识构建分割模型(挑战#1)。这里的关键是使用对抗性学习来指导分割模型生成更多的自然影象,我们将在第2部分中发现这是非常有效的。
解决所有挑战的最终解决方案的架构如下所示:

这是由两部分组成的系列文章的第1部分。有关模型设计和效能的详细资讯,请参阅第2部分。敬请期待!