MOS(Mean Opinion Score,平均意见得分)是让真人听音频、按 1~5 分打分再取平均的主观评测方法。它来自电话时代,原本只回答"声音听着清不清楚",如今被大量借来评价语音合成和音色克隆。
打分表通常是五档,从 5 很好到 1 很差;一批听测者各自独立打分,最后取平均。它直观、不依赖模型,长期是语音质量评测的通用货币。
可以把 MOS 想成餐厅的五星好评:总分能说明"这家大概不错",却看不出菜好不好吃、服务怎么样、环境吵不吵。两家店同样 4.5 分,一家可能菜好服务差,另一家菜一般但环境舒服。想改进,需要的不是总分,而是分项。
到了生成式语音时代,这把老尺子有三处力不从心。
第一,分数容易顶到天花板。MOS 原本是用来区分"有没有编码损伤、听不听得清"的,当年的音频多在中间分数段,区分度很好;现在神经语音合成在清晰度上普遍接近真人,大家都挤在高分区,差异被压进噪声里,测了约等于没测。
第二,一个分数装不下太多维度。用户关心的早就不只是"好不好听":音色像不像目标说话人、情感语气对不对、韵律有没有机械感、数字和多音字念得对不对。这些混成一个平均值后,A 模型的"像"和 B 模型的"自然"变成同一个数字,没法指路。
第三,平均会掩盖分布。一百句话九十九句好,一句把关键数字念错,平均分可能照样漂亮,但用户只记得那一句。客服、导航、有声书这类场景,尾部错误的杀伤力远大于平均分的小幅提升。
方法上的区别大致如下:
| 方法 | 怎么测 | 适合回答什么 |
|---|---|---|
| MOS | 每人绝对打分,再取平均 | 整体"好不好" |
| CMOS | 听两段,选更好的一段 | 两个系统谁更好 |
| SMOS | 只对"音色相似度"打分 | 克隆得像不像 |
| 客观/预测指标 | 用算法预测一个 MOS 值 | 快速回归,但只是 MOS 的影子 |
后三类其实都是给 MOS 打补丁:CMOS 解决绝对标尺不稳,SMOS 解决维度混杂,客观指标解决速度慢;但它们的学习目标仍是 MOS,也就继承了对老任务的假设。
对从业者,别把单个 MOS 当结论:拆开维度、多用成对比较、单独统计长尾错误,并写清测试文本、听测人群和场景。对普通人,看到宣传里的一个高分,可以多问一句"谁听的、听的是什么"。口径不清的分数,参考价值有限;具体做法以官方评测说明为准。
