用 AI 評估肌膚這件事

皮膚的嚴重程度,並沒有唯一的正確答案。一位皮膚科專科醫師歷經大學附設醫院與醫療 AI 公司,所面對的「醫師的判斷有多可信」這個問題,以及他如何用 AI 來解決的故事。

用 AI 評估肌膚這件事

上一篇文章裡,我談到測量肌膚的「測量」本身,比想像中浮動得多。這時自然會有這樣的想法:「如果儀器不可靠,那讓受過訓練的醫師親眼看、直接判斷不就好了?」我自己也曾長期這麼相信。然而在做 AI 研究的過程中,我卻不得不面對一件事:就連「醫師的判斷」,也無法乾淨俐落地收斂成單一的正確答案。

我的第一篇論文,是鑑別「唇部的皮膚癌」

在大學附設醫院時,我的第一個研究主題,是用 AI 鑑別長在嘴唇上的罕見皮膚癌。當時用 AI「診斷」疾病的研究才剛開始出現,這項研究因為連不常見的皮膚癌類型都能分辨出來而獲得肯定,得以刊登在皮膚科領域的重要期刊(《英國皮膚科學期刊》,BJD)上。

診斷相對容易處理,因為像「是不是皮膚癌」這樣的問題,一般被認為有正確答案。(嚴格說來,診斷其實也更接近機率。)不過這類診斷研究當時已經迅速趨於飽和,於是我把目光轉向下一個問題:「嚴重程度評估」。

「嚴重程度」沒有唯一的正確答案

接著,我進行了用 AI 評估痤瘡與異位性皮膚炎嚴重程度的研究。兩項研究都因為創新而獲得肯定,刊登在不錯的期刊上,但在研究過程中真正撞上的牆,卻是另一回事。

要訓練 AI,就需要「標註資料(ground truth)」。於是我們讓多位皮膚科醫師看同一張照片並評定嚴重程度,結果答案彼此分歧。大多數情況下大家的答案相近,完全南轅北轍的情況很少見(例如 4 級當中,有人評 3 級、有人評 2 級),但即便如此,「唯一的正確答案」並不存在。

和「是不是皮膚癌」不同,嚴重程度是一個多位專家的判斷會散成一個分布的問題。因此需要和診斷不同的做法,而我的研究,正是在解決這個環節。

這不只是皮膚科的問題

後來我在醫療 AI 公司(Lunit)開發病理分析 AI 時,也遇到了一模一樣的牆。我們用病理科醫師在組織影像上標記的答案來訓練模型,但就連那些答案,也因醫師而異。同一塊組織,有人判斷為癌前病變,有人判斷為惡性病變。

那時我才明白,我在皮膚科遇到的問題,並非皮膚科獨有,而是整個醫學領域底下普遍存在的問題。歷經皮膚科 AI 研究與病理 AI 研究,我從經驗中學會了該如何用 AI 處理這種「發散的正確答案」。

所以,「怎麼評估」才是關鍵

關鍵不在於硬塞給 AI 一個嚴格的唯一正確答案,而是讓它學習實際醫療現場中存在的判斷分布,也就是所謂的「機率」。不是因為某一個人錯了就把他的意見刪掉,而是把多位專家判斷所構成的範圍,原封不動地當作訓練的素材。我在首爾大學醫院與 Lunit 都以這種方式開發 AI 模型,也確認了這種做法更適合嚴重程度評估。而當時累積的訣竅,如今正應用在 INSKINVIEW 的 AI 模型開發上。

參考文獻

以下是本文提到的研究。

皮膚科 AI 研究

病理科 AI 研究