一句话定义:文本规范化(Text Normalization,TN)负责把书面符号变成该念的那个词,韵律(Prosody)负责决定这些词念出来时怎么停、哪里重、语调往哪走。
它管什么
文本转语音(TTS)的前端大致是:原文 → TN → 分词与注音 → 声学模型 → 波形。TN 在最前面,回答的是"这个符号念什么":
- "3:30" 念"三点半"还是"三点三十分"
- "2023 年"念"二零二三年","2023 人"念"两千零二十三人"
- "5kg""3.5%""No.1""Dr. Smith""iPhone 15 Pro"
- 中英混排:"这个 bug 已经 fix 了"
同一串字符在不同上下文里读法不同,所以 TN 不是简单替换,而是一次带歧义的判断。
打个比方
TN 像给稿子做翻译的编辑,把满纸缩写、数字、单位改成人能直接念出口的句子;韵律则是播音员拿起稿子后的功夫——在哪儿换气,哪个词咬重,句尾是扬还是落。稿子没翻译好,念出来是"点三五百分号";翻译好了但韵律平,听起来就是机器人念经。
和相邻概念的区别
| 文本规范化 TN | 韵律 Prosody | |
|---|---|---|
| 解决 | 符号 → 词 | 词 → 怎么念 |
| 典型问题 | "3.5%" 读什么 | 在哪停、谁重读 |
| 出错的感觉 | 念错,信息失真 | 念对了,但不像人 |
| 所属环节 | 前端文本处理 | 前端预测 + 声学建模 |
还要和两个概念分清。一是注音(Grapheme-to-Phoneme,G2P),它管"这个词怎么发音",比如 "read" 读 /riːd/ 还是 /rɛd/,而 TN 先管"到底读哪个词"。二是音色(timbre),音色决定像不像某个人,韵律决定像不像在说话。音色克隆现在很容易做像,但韵律一塌,立刻出戏。
韵律本身包含几块:短语停顿(断句)、重音与凸显、语调曲线、语速与时长、节奏。中文还要额外处理轻声、儿化、多音字和标点带来的语气。
对从业者和普通人意味着什么
对做语音的人:字准率只是及格线。长文本、金额数字、单位缩写、中英混读、多音字是最容易翻车的场景,评测要加主观听测,不能只盯字错率。训练数据里的标点、大小写、空格往往是有用信号,别顺手洗掉。各家实现差异不小,具体能力以官方页面为准。
对普通用户:挑 TTS 时别只听一句"你好"。试三句就够——一串数字、一句中英混排、一句带问号的话。念得对是底线,停顿和重音自然,才值得放进客服播报、有声书或导航里长期用。
