跳到主内容
快讯直播
AI智模界
AI 词典

声码器:TTS 音质的最后一公里

一句话定义:声码器(Vocoder)是把声学特征(acoustic features)还原成最终音频波形(waveform)的模块。TTS(Text-to-Speech,语音合成)流程通常是:文本 → 前端 → 声学模型 → 声学特征 → 声码器 → 波形。

展开:可以把它想成“乐谱到演奏”。声学模型产出的梅尔频谱(mel spectrogram)、基频(F0)、时长等信息,像乐谱:告诉系统大概唱什么音、多长、什么调。但它不是声音本身。人耳听到的波形,是每秒几万次采样点的空气压力变化,里面还有相位(phase)、谐波、气声、噪声等细节。声码器要做的,就是根据乐谱“补全”这些细节,让声音从符号变成振动。难点在于:特征里很多信息被压缩掉了,尤其是相位,而相位一乱,声音就会发闷、带金属感或断续。

和相邻概念的区别

模块主要输入主要输出决定什么
前端文本音素、韵律标注读得对不对
声学模型音素等声学特征说什么、怎么停顿、音高走向
声码器声学特征波形音质、音色、自然度、噪声

所以,声学模型决定“像不像会说人话”,声码器决定“像不像真人嗓子”。传统方法有源-滤波器、Griffin-Lim、WORLD 等;神经声码器常见有自回归、AI 词典:生成对抗网络">生成对抗网络(GAN)、扩散模型(diffusion)等路线。具体哪家工具更强、延迟多低,以官方页面和实测为准。

实际意义:对从业者,TTS 音质瓶颈常不在文本前端,而在声码器。如果声码器差,换更大的声学模型也可能只是“更清楚地难听”。实时语音场景中,声码器的计算量和延迟也直接决定能否流式合成。对普通人,AI 配音里的电流音、齿音发毛、尾音发虚、呼吸感不自然,往往就是声码器没还原好细节。一句话:声学特征负责“画骨架”,声码器负责“长出血肉”。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。