跳到主内容
快讯直播
AI智模界
AI 词典

韵律与文本规范化:TTS 像不像人的分水岭

一句话定义:文本规范化(Text Normalization,TN)负责把书面符号变成该念的那个词,韵律(Prosody)负责决定这些词念出来时怎么停、哪里重、语调往哪走。

它管什么

文本转语音(TTS)的前端大致是:原文 → TN → 分词与注音 → 声学模型 → 波形。TN 在最前面,回答的是"这个符号念什么":

  • "3:30" 念"三点半"还是"三点三十分"
  • "2023 年"念"二零二三年","2023 人"念"两千零二十三人"
  • "5kg""3.5%""No.1""Dr. Smith""iPhone 15 Pro"
  • 中英混排:"这个 bug 已经 fix 了"

同一串字符在不同上下文里读法不同,所以 TN 不是简单替换,而是一次带歧义的判断。

打个比方

TN 像给稿子做翻译的编辑,把满纸缩写、数字、单位改成人能直接念出口的句子;韵律则是播音员拿起稿子后的功夫——在哪儿换气,哪个词咬重,句尾是扬还是落。稿子没翻译好,念出来是"点三五百分号";翻译好了但韵律平,听起来就是机器人念经。

和相邻概念的区别

文本规范化 TN韵律 Prosody
解决符号 → 词词 → 怎么念
典型问题"3.5%" 读什么在哪停、谁重读
出错的感觉念错,信息失真念对了,但不像人
所属环节前端文本处理前端预测 + 声学建模

还要和两个概念分清。一是注音(Grapheme-to-Phoneme,G2P),它管"这个词怎么发音",比如 "read" 读 /riːd/ 还是 /rɛd/,而 TN 先管"到底读哪个词"。二是音色(timbre),音色决定像不像某个人,韵律决定像不像在说话。音色克隆现在很容易做像,但韵律一塌,立刻出戏。

韵律本身包含几块:短语停顿(断句)、重音与凸显、语调曲线、语速与时长、节奏。中文还要额外处理轻声、儿化、多音字和标点带来的语气。

对从业者和普通人意味着什么

对做语音的人:字准率只是及格线。长文本、金额数字、单位缩写、中英混读、多音字是最容易翻车的场景,评测要加主观听测,不能只盯字错率。训练数据里的标点、大小写、空格往往是有用信号,别顺手洗掉。各家实现差异不小,具体能力以官方页面为准。

对普通用户:挑 TTS 时别只听一句"你好"。试三句就够——一串数字、一句中英混排、一句带问号的话。念得对是底线,停顿和重音自然,才值得放进客服播报、有声书或导航里长期用。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。