精细的肌肤评估 AI 是怎样做出来的
皮肤科专科医生用等级来评估肌肤,而 INSKINVIEW 的分数却是 0~100 分。这是一篇关于用等级训练出来的 AI 如何学会理解精细分数的记录。

INSKINVIEW 把肌肤分成六个维度,每个维度都以 0 到 100 分之间的分数来呈现。那么,这些分数是从哪里来的呢?今天就来谈谈这件事。其实在这些分数的背后,有一个每个做肌肤评估 AI 的人都会遇到的两难。
专家用“等级”来评估皮肤
皮肤评估的标注数据(ground truth)通常是以等级的形式建立的,也就是像轻度、中度、重度这样,分成 4~5 个等级。
原因很简单:人无法用连续的分数来评估。如果问一位皮肤科专科医生“这条皱纹满分 100 分能打几分”,他很难回答。用人的眼睛区分 63 分和 67 分,几乎是不可能的。但如果问“在 4 个等级中属于第几级”,就能回答。前面文章里提到的 IGA 之类的评估工具全都采用等级方式,原因也在于此。
但是,等级看不出变化
问题在于,用这种等级数据训练 AI,AI 也就只认识等级。用 4 个等级学出来的模型,看世界也只有 4 个等级。
这就会出现尴尬的情况。即使坚持护理、肌肤正在一点点变好,只要还在 2 级的范围内变动,模型的答案就一直是“2 级”。前几篇文章说过,要经常测才能看出走势,可如果模型本身分辨不出细微的变化,经常测也就失去了意义。
但硬把等级拉伸成分数,也不是答案。把 2 级机械地叫作 50 分,并不意味着模型就知道 48 分和 53 分有什么区别。
汇集多人的评估就行了——如果不考虑成本的话
有一种已知的解法,也是我之前在特应性皮炎研究中用过的方法:让多位专科医生评估同一张照片。当时我收集了 5 位医生的评估。
5 个人给出的等级并不会完全一致,而恰恰是这种不一致成了信息。5 个人都评为 2 级的照片,和 2 级与 3 级各执一词的照片,是两种不同的状态。等级之间那些微妙的位置,正是通过多人的分布显现出来的。这样训练,模型就能读懂等级之间的地带。
不过,这种方式有一个明显的局限:成本。让每张照片都接受多位专科医生的评估,数据量越大就越难以承受。
不靠多人评估,也能读懂等级之间
于是我们找到了另一条路:不用汇集多人的评估,也能让 AI 模型把以等级形式建立的标注数据,理解为 0~100 分的细分分数。具体方法属于我们的技术诀窍,无法在这里全部写出,但方向是明确的。
这样就能同时守住两点:正确答案的基准依然是皮肤科专科医生的评估,而模型则能学到等级之间的细微变化。
INSKINVIEW 的分数不是等级而是 0~100 分,原因就在这里。要显示出今天 61 分和下个月 65 分之间的差别,模型就必须能读懂这中间的地带。我说过要经常测才能看出走势,但其实在那之前,首先需要的是一个能盛得下走势的容器。