一句话定义
Inception Score(IS,初始分数)是早期生成图像模型常用的一种自动评价指标:把一批生成图丢给一个预训练的图像分类器,看这些图“是否一眼能认出是什么”,以及“题材是否够多样”,最后合成一个分数,越高越好。
它到底在算什么
做法很朴素。拿一个在 ImageNet 上预训练好的分类器(常用的就是 Inception 网络),对每张生成图输出一个类别概率分布,比如“70% 狗、20% 狼、10% 猫”。
- 清晰度:单张图的分布要“尖”。分类器极其确信这是狗,说明图里确实有个成形的狗;如果它给出的分布是“30% 狗、25% 猫、25% 车”,通常意味着这张图糊了、扭曲了,或者四不像。分布越尖(熵越低)越好。
- 多样性:把成千上万张图的预测汇总成一个总体分布,这个分布要“平”。各种类别都出现过,说明模型没有只会画狗。总体分布越平(熵越高)越好。
- 综合:对每张图衡量“单张分布”和“总体分布”的差异,取平均后再指数化,得到一个标量。
打个比方
像画室招人面试。考官翻一叠画,要做两件事:第一,每幅画他能不能立刻说出画的是什么;第二,这叠画里题材有没有重复。一千张全是猫,哪怕每张都极其清晰,也不算多样性合格;一百张题材各异但每张都看不出画的是什么,清晰度那项就垮了。IS 就是在同时给这两件事打分。
和相邻概念的区别
IS 最常被拿来和 FID(Fréchet Inception Distance,弗雷歇初始距离)比较。关键差别是:IS 从头到尾没看过真实图片,它只判断“生成图本身好不好认、够不够杂”;FID 则把生成分布和真实数据分布放在一起比距离,回答的是“像不像真图”。
| 指标 | 衡量什么 | 方向 | 主要短板 |
|---|---|---|---|
| Inception Score | 单图可辨识度 + 类别多样性 | 越高越好 | 不比对真实数据;只看分类器的类别体系 |
| FID | 生成分布与真实分布的距离 | 越低越好 | 对样本量、特征提取方式敏感 |
| 人工评价 | 真实感、美感、语义合理性 | 主观打分 | 贵、慢、难复现 |
对从业者与普通人的意义
对做生成模型的人,IS 适合当训练过程中的快速自检:两条曲线一起看,清晰度掉了往往是训练不稳,多样性掉了要警惕模式坍塌(mode collapse)。但它有明显的坑:它只认分类器认识的那一千来个类别,对纹理、抽象构图、人脸细节、整体真实感几乎无感;模型若学会“骗过分类器”,分数也会虚高。所以现在论文里通常以 FID 为主、IS 为辅,具体用哪个版本、怎么调参,以官方页面和原始论文为准。
对不搞技术的职场人,最实用的提醒是:看到“IS 提升多少”这类宣传,别直接等同于“画质提升多少”。它衡量的是分类器视角下的可辨度和题材覆盖面,离人眼感受到的好看、真实,还隔着一段距离。
