一句话定义:PSNR(Peak Signal-to-Noise Ratio,峰值信噪比)和 SSIM(Structural Similarity Index Measure,结构相似性指标)都是“全参考”图像质量指标——必须拿一张原图和一张处理后的图逐处比对,输出一个分数,衡量重建得有多好。
PSNR 怎么算:先把两张图每个像素的差平方、求平均,得到 MSE(Mean Squared Error,均方误差);再把这个误差换算成“信号比噪声强多少倍”的分贝值。误差越小,分数越高,单位是 dB。它像什么?像给两张照片做逐格对照:每一格颜色差多少都算数,最后给个平均分,格子错得越离谱扣得越狠。
SSIM 换了个思路:它不看单个像素的绝对差,而是滑一个小窗口,在局部比较三件事——亮度(平均值)、对比度(方差)、结构(协方差),再把各窗口结果平均起来。取值一般在 0 到 1 之间,1 表示两张图完全一致。它更像阅卷老师:不数错别字,而是看这段话还像不像原文,明暗、层次、轮廓有没有散架。
两者的脾气差别:把整张图整体平移一个像素,人眼几乎看不出来,PSNR 却会明显下跌;反过来,一片草地被磨成光滑色块,PSNR 可能还过得去,人眼却一眼看出“糊了”。SSIM 对后一种结构破坏更敏感,但它同样不是人眼。
和相邻概念的区别:
| 指标 | 看什么 | 单位/方向 | 常见用途 | 局限 |
|---|---|---|---|---|
| PSNR | 逐像素误差 | dB,越高越好 | 压缩、超分基准 | 与人眼判断常不一致 |
| SSIM | 局部亮度/对比度/结构 | 通常 0~1,越高越像 | 超分、重建、修复 | 仍是近似,不等于主观感受 |
| LPIPS(Learned Perceptual Image Patch Similarity) | 深度网络特征差异 | 越低越好 | 感知质量评估 | 依赖预训练模型,可解释性弱 |
| FID(Fréchet Inception Distance) | 两组图的整体分布差异 | 越低越好 | 生成模型批量评估 | 不针对单张图的一一对应 |
MSE 是 PSNR 的原料;SSIM 有 MS-SSIM(多尺度版本),缩放后再算一遍;LPIPS 属于“感知指标”,更贴近人的判断;FID 比较的是两组图的分布,不需要成对原图。
对从业者的意义:超分、去噪、压缩、老照片修复这些任务,论文和评测里普遍同时报 PSNR 和 SSIM,因为一个看像素误差、一个看结构保留。但要警惕:只盯着 PSNR 优化,模型容易输出“过度平滑”的结果——分数好看,细节没了。现在常见的做法是像素指标、感知指标加人工抽检三件套一起用。
对普通人的意义:你手机相册里的“高清修复”、视频网站的“画质增强”、图片压缩后还能不能看,背后都靠这类指标做自动化把关。但指标只是筛子,最终好不好看,还得人眼说了算。另外,不同颜色空间、窗口大小、边缘裁剪方式会算出不同数值,跨论文直接比数字要谨慎,具体定义以原始论文和官方实现页面为准。
