精緻な肌評価AIはどうつくるのか
皮膚科専門医は肌をグレードで評価します。ところがINSKINVIEWのスコアは0〜100点です。グレードで学習したAIがどのようにして精緻なスコアを理解するようになるのかについての記録です。

INSKINVIEWは肌を6つの軸に分け、それぞれ0点から100点の間のスコアで示します。では、このスコアはどこから来たのでしょうか。今日はその話をしようと思います。実はこのスコアの裏には、肌評価AIをつくる人なら誰もがぶつかるジレンマがひとつあります。
専門家は肌を「グレード」で評価します
肌評価の正解データ(ground truth)は、通常グレードでつくられます。軽症、中等症、重症のように、4〜5段階に分ける方式です。
理由は単純です。人は連続したスコアで評価することができないからです。皮膚科専門医に「このしわは100点満点で何点ですか」と聞いても、答えるのは難しいでしょう。63点と67点を区別することは、人の目ではほぼ不可能です。しかし「4段階のうちどの段階ですか」と聞けば答えられます。前の記事で話したIGAのような評価ツールがすべてグレード方式なのも、そのためです。
ところがグレードでは変化が見えません
問題は、このグレードデータでAIを学習させると、AIもグレードしか知らないということです。4段階で学んだモデルは、世界を4段階で見ます。
こうなると困った状況が生じます。継続してケアをして肌が少しずつ良くなっていても、グレード2の中で動いている間、モデルの答えはずっと「グレード2」のままです。これまでの記事で、頻繁に測ってこそ流れが見えると言ってきましたが、肝心のモデルが微細な変化を区別できなければ、頻繁に測る意味がなくなってしまいます。
かといって、グレードを無理やりスコアに引き伸ばすのも答えではありません。グレード2を機械的に50点と呼んだところで、モデルが48点と53点の違いを知るわけではないからです。
複数人の評価を集めればいい、コストを除けば
ひとつ知られている解決策があります。先に紹介したアトピー性皮膚炎の研究で私が使った方式でもあります。同じ写真を複数の専門医に評価してもらうことです。私は当時、5人の評価を集めました。
5人がつけたグレードは、ひとつには一致しません。しかし、まさにその不一致が情報になります。5人全員がグレード2とした写真と、グレード2とグレード3に分かれた写真は、異なる状態です。グレードの間にある微妙な地点が、複数人の分布を通して現れてくるのです。このように学習すれば、モデルはグレードの間を読めるようになります。
ただし、この方式には明確な限界があります。コストです。すべての写真に複数の専門医の評価を受けることは、データが大きくなるほど負担しきれなくなります。
複数人なしでグレードの間を読めるようにしました
そこで私たちは別の道を探しました。複数人の評価を集めなくても、グレードでつくられた正解データを0〜100点の細分化されたスコアとして理解するAIモデルをつくることです。具体的な方法は私たちのノウハウなのでここにすべて書くことはできませんが、方向ははっきりしています。
こうすれば、2つを同時に守ることができます。正解の基準はあくまで皮膚科専門医の評価に置きながら、モデルはグレードの間の微細な変化まで学習するのです。
INSKINVIEWのスコアがグレードではなく0〜100点なのは、そのためです。今日の61点と来月の65点の違いを示すには、モデルがその間を読めなければならないからです。頻繁に測ってこそ流れが見えると言いましたが、実はその前に、流れを収められる器がまず必要だったというわけです。