一句话定义:声码器(Vocoder)是把声学特征(acoustic features)还原成最终音频波形(waveform)的模块。TTS(Text-to-Speech,语音合成)流程通常是:文本 → 前端 → 声学模型 → 声学特征 → 声码器 → 波形。
展开:可以把它想成“乐谱到演奏”。声学模型产出的梅尔频谱(mel spectrogram)、基频(F0)、时长等信息,像乐谱:告诉系统大概唱什么音、多长、什么调。但它不是声音本身。人耳听到的波形,是每秒几万次采样点的空气压力变化,里面还有相位(phase)、谐波、气声、噪声等细节。声码器要做的,就是根据乐谱“补全”这些细节,让声音从符号变成振动。难点在于:特征里很多信息被压缩掉了,尤其是相位,而相位一乱,声音就会发闷、带金属感或断续。
和相邻概念的区别:
| 模块 | 主要输入 | 主要输出 | 决定什么 |
|---|---|---|---|
| 前端 | 文本 | 音素、韵律标注 | 读得对不对 |
| 声学模型 | 音素等 | 声学特征 | 说什么、怎么停顿、音高走向 |
| 声码器 | 声学特征 | 波形 | 音质、音色、自然度、噪声 |
所以,声学模型决定“像不像会说人话”,声码器决定“像不像真人嗓子”。传统方法有源-滤波器、Griffin-Lim、WORLD 等;神经声码器常见有自回归、AI 词典:生成对抗网络">生成对抗网络(GAN)、扩散模型(diffusion)等路线。具体哪家工具更强、延迟多低,以官方页面和实测为准。
实际意义:对从业者,TTS 音质瓶颈常不在文本前端,而在声码器。如果声码器差,换更大的声学模型也可能只是“更清楚地难听”。实时语音场景中,声码器的计算量和延迟也直接决定能否流式合成。对普通人,AI 配音里的电流音、齿音发毛、尾音发虚、呼吸感不自然,往往就是声码器没还原好细节。一句话:声学特征负责“画骨架”,声码器负责“长出血肉”。
