用 AI 评估皮肤意味着什么

皮肤的严重程度,并没有唯一的正确答案。这是一位皮肤科专科医生在大学附属医院和医疗 AI 公司一路走来所面对的问题——“医生的判断有多可信”——以及他用 AI 来求解这个问题的故事。

用 AI 评估皮肤意味着什么

上一篇文章里,我谈到对皮肤的“测量”比想象中更不稳定。这样一来,自然会有人想:“既然设备靠不住,那让受过训练的医生亲自用眼睛看、做判断,不就行了吗?”很长一段时间里,我自己也是这么相信的。然而在做 AI 研究的过程中,我不得不面对一个事实:就连“医生的判断”,也无法归结为一个干脆利落的正确答案。

我的第一篇论文,是鉴别“唇部皮肤癌”

在大学附属医院时,我的第一个研究课题,是用 AI 鉴别发生在嘴唇上的一种罕见皮肤癌。当时,用 AI 来“诊断”疾病的研究才刚刚出现,这项研究因为连并不常见的皮肤癌类型也能区分出来而获得认可,得以发表在皮肤科领域的主要学术期刊(《英国皮肤病学杂志》,BJD)上。

诊断相对来说比较容易处理,因为像“是不是皮肤癌”这样的问题,被认为是有正确答案的。(严格说来,诊断其实也更接近于概率。)不过,这类诊断研究当时已经在迅速趋于饱和,于是我把目光转向了下一个问题——“严重程度评估”。

“严重程度”并没有唯一的正确答案

接下来,我开展了用 AI 评估痤疮和特应性皮炎严重程度的研究。两项研究都因其新颖性获得认可,发表在不错的学术期刊上,但真正在研究过程中撞上的那堵墙,却是另一回事。

要训练 AI,就需要“标注数据(ground truth)”。于是我们把同一张照片拿给多位皮肤科医生看,请他们评定严重程度,结果各人的答案出现了分歧。大多数情况下答案是相近、重叠的,完全南辕北辙的情况很少见(比如在 4 个等级中,有人评为 3 级,有人评为 2 级),但即便如此,“唯一的正确答案”依然不存在。

与“是不是皮肤癌”不同,严重程度是一个多位专家的判断会散开成一个分布的问题。因此它需要一种不同于诊断的方法,而我的研究正是要解决这一点。

这不只是皮肤科的问题

后来在医疗 AI 公司(Lunit)开发病理分析 AI 时,我又遇到了同样的墙。我们用病理科医生在组织图像上标注的答案来训练模型,可就连这些答案,也因医生而异。面对同一块组织,有人判断为癌前病变,有人判断为恶性病变。

那时我才明白:我在皮肤科遇到的问题并不是皮肤科独有的,而是贯穿整个医学的普遍问题。经历了皮肤科 AI 研究和病理 AI 研究之后,我从经验中学会了该如何用 AI 来处理这种“散开的正确答案”。

所以,“怎样评估”才是关键

关键不在于给 AI 钉死一个严格的正确答案,而在于让它学习真实医疗现场中存在的判断分布——也就是说,以“概率”的形式学习。不是把某个人的判断当作错误而删掉,而是把多位专家判断所构成的幅度,原封不动地作为学习的素材。我在首尔大学医院和 Lunit 都以这种方式开发过 AI 模型,并确认这种方法更适合严重程度评估。如今,我正把当时积累的经验运用在 INSKINVIEW 的 AI 模型开发中。

参考文献

以下是正文中提到的研究。

皮肤科 AI 研究

病理科 AI 研究