精細的肌膚評估 AI 是怎麼做出來的
皮膚科專科醫師是用等級來評估肌膚的,但 INSKINVIEW 的分數卻是 0~100 分。這是一篇關於用等級訓練出來的 AI,如何學會理解精細分數的記錄。

INSKINVIEW 把肌膚分成六個面向,各自以 0 到 100 分之間的分數呈現。但這個分數是從哪裡來的?今天想談的就是這件事。其實在這個分數背後,有一個只要是做肌膚評估 AI 的人都會遇到的兩難。
專家是用「等級」評估肌膚的
肌膚評估的標註資料(ground truth)通常是以等級建立的,像是輕度、中度、重度這樣分成 4~5 級。
原因很簡單:人沒辦法用連續的分數來評估。問皮膚科專科醫師「這條皺紋滿分 100 分是幾分?」,他很難回答。要用肉眼分辨 63 分和 67 分,幾乎是不可能的。但如果問「4 級當中是第幾級?」,就答得出來。前面文章提到的 IGA 等評估工具全都採用等級的形式,也是這個緣故。
但用等級,看不見變化
問題是,用這種等級資料訓練 AI,AI 也就只認得等級。用 4 級學出來的模型,看世界就只有 4 級。
這樣會出現麻煩的情況。就算持續保養、肌膚一點一點在變好,只要還在第 2 級的範圍內移動,模型的答案就一直是「第 2 級」。前幾篇文章說要經常測量才看得出趨勢,但如果模型本身分辨不出細微的變化,經常測量就失去了意義。
話雖如此,硬把等級拉成分數也不是答案。把第 2 級機械式地稱作 50 分,並不代表模型就懂 48 分和 53 分的差別。
集合多人的評估就行了——除了成本以外
有一個已知的解法,也是我先前在異位性皮膚炎研究中用過的方式:讓多位專科醫師評估同一張照片。當時我蒐集了 5 位醫師的評估。
5 個人評的等級不會完全一致,但正是這種不一致成了資訊。5 個人都評第 2 級的照片,和意見分歧在第 2 級與第 3 級之間的照片,狀態是不同的。等級之間那些微妙的位置,透過多人的分布顯現了出來。這樣訓練,模型就能讀出等級與等級之間的差異。
只是這種方式有一個明確的限制:成本。每一張照片都要請多位專科醫師評估,資料量越大就越難負擔。
不靠多人評估,也能讀出等級之間的差異
所以我們找了另一條路:不用蒐集多人的評估,也能讓 AI 模型把以等級建立的標註資料,理解成 0~100 分的細分分數。具體方法屬於我們的技術訣竅,沒辦法在這裡全部寫出來,但方向是明確的。
這麼做可以同時守住兩件事:正確答案的基準仍然放在皮膚科專科醫師的評估上,而模型則連等級之間的細微變化也一併學會。
INSKINVIEW 的分數不是等級而是 0~100 分,原因就在這裡。要呈現今天 61 分和下個月 65 分的差別,模型就必須讀得出這中間的差異。雖然說要經常測量才看得出趨勢,但其實在那之前,得先有一個能盛裝趨勢的容器。