跳到主内容
快讯直播
AI智模界
AI 词典

MOS(平均意见得分):语音评测的老尺子不够用了

MOS(Mean Opinion Score,平均意见得分)是让真人听音频、按 1~5 分打分再取平均的主观评测方法。它来自电话时代,原本只回答"声音听着清不清楚",如今被大量借来评价语音合成和音色克隆。

打分表通常是五档,从 5 很好到 1 很差;一批听测者各自独立打分,最后取平均。它直观、不依赖模型,长期是语音质量评测的通用货币。

可以把 MOS 想成餐厅的五星好评:总分能说明"这家大概不错",却看不出菜好不好吃、服务怎么样、环境吵不吵。两家店同样 4.5 分,一家可能菜好服务差,另一家菜一般但环境舒服。想改进,需要的不是总分,而是分项。

到了生成式语音时代,这把老尺子有三处力不从心。

第一,分数容易顶到天花板。MOS 原本是用来区分"有没有编码损伤、听不听得清"的,当年的音频多在中间分数段,区分度很好;现在神经语音合成在清晰度上普遍接近真人,大家都挤在高分区,差异被压进噪声里,测了约等于没测。

第二,一个分数装不下太多维度。用户关心的早就不只是"好不好听":音色像不像目标说话人、情感语气对不对、韵律有没有机械感、数字和多音字念得对不对。这些混成一个平均值后,A 模型的"像"和 B 模型的"自然"变成同一个数字,没法指路。

第三,平均会掩盖分布。一百句话九十九句好,一句把关键数字念错,平均分可能照样漂亮,但用户只记得那一句。客服、导航、有声书这类场景,尾部错误的杀伤力远大于平均分的小幅提升。

方法上的区别大致如下:

方法怎么测适合回答什么
MOS每人绝对打分,再取平均整体"好不好"
CMOS听两段,选更好的一段两个系统谁更好
SMOS只对"音色相似度"打分克隆得像不像
客观/预测指标用算法预测一个 MOS 值快速回归,但只是 MOS 的影子

后三类其实都是给 MOS 打补丁:CMOS 解决绝对标尺不稳,SMOS 解决维度混杂,客观指标解决速度慢;但它们的学习目标仍是 MOS,也就继承了对老任务的假设。

对从业者,别把单个 MOS 当结论:拆开维度、多用成对比较、单独统计长尾错误,并写清测试文本、听测人群和场景。对普通人,看到宣传里的一个高分,可以多问一句"谁听的、听的是什么"。口径不清的分数,参考价值有限;具体做法以官方评测说明为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。