AIで肌を評価するということ
肌の重症度に、正解はひとつではありません。皮膚科専門医が大学病院と医療AI企業を経て向き合った「医師の判断はどこまで信じられるのか」という問い、そしてそれをAIで解いてきた話です。

前回の記事で私は、肌を測る「測定」が思った以上に揺らぐという話をしました。そうなると自然にこう思います。「機器が信頼できないなら、訓練を受けた医師が自分の目で見て判断すればいいのではないか」。私も長い間そう信じていました。ところがAI研究をするなかで、その「医師の判断」でさえ、ひとつの正解にきれいに収まらないという現実に向き合うことになりました。
私の最初の論文は「口唇の皮膚がん」を鑑別するものでした
大学病院にいた頃、私の最初の研究テーマは、口唇にできるまれな皮膚がんをAIで鑑別することでした。当時はAIで疾患を「診断」する研究が出始めたばかりの時期で、珍しい種類の皮膚がんまで見分けられる点が評価され、皮膚科分野の主要学術誌(英国皮膚科学会誌、BJD)に掲載されました。
診断は比較的扱いやすい方でした。「皮膚がんかどうか」のように、正解があると考えられているからです。(厳密に言えば、診断も確率に近いのですが。)しかし、こうした診断研究はすでに急速に飽和しつつあり、私は次の問いに目を向けました。それが「重症度評価」でした。
「重症度」に正解はひとつではありませんでした
続いて私は、ニキビとアトピー性皮膚炎の重症度をAIで評価する研究を進めました。どちらの研究も新規性が認められて良い学術誌に掲載されましたが、研究を進めるなかでぶつかった壁は別のところにありました。
AIを学習させるには「正解データ(ground truth)」が必要です。そこで複数の皮膚科医に同じ写真を見せて重症度をつけてもらったのですが、答えが分かれました。大半は似たところに重なり、完全にかけ離れるケースはまれでしたが(例えば4段階のうち、ある医師はグレード3、別の医師はグレード2というように)、それでも「ただひとつの正解」は存在しませんでした。
「皮膚がんかどうか」とは違い、重症度は複数の専門家の判断がひとつの分布として散らばる問題でした。そのため診断とは異なるアプローチが必要で、私の研究はまさにその地点を解く作業でした。
これは皮膚科だけの問題ではありませんでした
その後、医療AI企業のLunit(ルニット)で病理解析AIをつくったときにも、まったく同じ壁に出会いました。病理医が組織画像に付けた正解を学習に使ったのですが、その正解さえ医師ごとに違っていました。同じ組織を見て、ある医師は前がん病変と、別の医師は悪性病変と判断するといった具合です。
そのとき気づきました。私が皮膚科で向き合っていた問題は皮膚科だけのものではなく、医学全体の底に横たわる普遍的な問題だったのだと。私は皮膚科AI研究と病理AI研究を経て、この「散らばる正解」をAIでどう扱うべきかを経験として身につけました。
だからこそ「どう評価するか」が核心です
核心は、AIにひとつの厳密な正解を釘付けにして教え込むのではなく、実際の医療現場に存在する判断の分布、いわば「確率」として学習させることです。誰か一人が間違っていると消してしまう代わりに、複数の専門家の判断がなす幅をそのまま学習の材料にする方向です。私はソウル大学病院とLunitでこの方式でAIモデルを開発し、このアプローチが重症度評価にはより適していることを確認しました。そして、そのときのノウハウを今、INSKINVIEWのAIモデル開発に応用しています。
参考文献
本文で言及した研究です。
皮膚科AI研究
- 口唇皮膚がんの鑑別 — British Journal of Dermatology, 2020;182:1388-1394.
- ニキビの重症度評価 — American Journal of Clinical Dermatology, 2023;24:649-659.
- アトピー性皮膚炎の重症度評価 — IEEE Journal of Biomedical and Health Informatics, 2023;27:166-175.
病理AI研究
- 非小細胞肺がんの病理解析AI(PD-L1判定) — European Journal of Cancer, 2022;170:17-26.
- 乳がんの病理解析AI(腫瘍浸潤リンパ球の評価) — npj Breast Cancer, 2023;9:71.
- 乳がんの病理解析AI(HER2・ER・PR判定) — Breast Cancer Research, 2024;26:31.