跳到主内容
快讯直播
AI智模界
AI 词典

Audio Tags:给 TTS 文本加舞台提示

一句话定义:Audio Tags(音频标签,也叫表达控制标签)是直接写进 TTS(Text-to-Speech,文本转语音)输入文本里的方括号标记,用来告诉模型这句话该怎么"演"——低声、大笑、叹气、不耐烦,而不只是把字念对。

它解决了什么问题

早期的语音合成更像朗读机:你给一段字,它还你一段音,情绪全靠标点和运气。想让声音有表情,通常得走两条路——调一个全局的情感参数,或者丢一段参考音频过去。ElevenLabs 在较新的语音模型里加入了表达控制标签,把"演"这件事拉回到了文本里(具体支持哪些标签、哪些版本可用,以官方页面为准)。

打个比方:老式 TTS 像播音员拿到一张只有台词的纸,只能靠标点猜语气;Audio Tags 相当于给这张纸补上了剧本的舞台提示——(小声)(冷笑)(深吸一口气)。模型在训练中见过大量"文本 + 括号提示 + 对应声音"的配对,于是学会把方括号里的词当作指令处理,而不是当作要念的内容。它改变的不只是音高,还包括气声比例、语速、停顿位置,甚至直接插进一段笑声或吸气声。

怎么写

[whispers] 我只告诉你一个人。

标签一般放在要生效的位置之前,且通常只认英文——写 [低语] 大概率无效。大致分两类:

  • 状态型:[excited] [sad] [nervous],影响往后一段的说话方式
  • 事件型:[laughs] [sighs] [clears throat],是一个瞬间发出的非语言声音

和相邻概念的区别

控制手段控制什么作用粒度
Audio Tags语气、情绪、非语言声音句内、逐句切换
SSML 标签停顿、语速、音量、发音结构化位置
参考音频 / 声音克隆音色、整体说话习惯全局
情感参数滑块整体情绪倾向整段
AI 词典:系统提示词">系统提示词整段表演基调整段

一句话:克隆管"谁在说",提示词管"整场什么调",Audio Tags 管"这一句怎么说"。

常见踩坑

1. 标签被念出来。模型不支持或格式写错时,"左括号 whispers 右括号"会被老老实实读出来,交付前必须试听。

2. 堆太多。一句话塞三四个标签,模型顾此失彼,效果反而飘。一句一个,最多两个。

3. 和标点打架。!!! 本身就会拉高音调,再叠一个 [excited] 容易破音。

4. 作用范围不精确。标签通常持续到下一个标签或句末,想只影响其中一个词,往往做不到,只能靠断句绕。

5. 跨平台不通用。A 平台的标签粘到 B 平台就是一段奇怪的正文,迁移时要清洗。

6. 别指望稳定复现。同一个标签跑两次结果可能不同,批量生产要留人工抽检环节。

对从业者和普通人的意义

对做产品的人,这意味着语音的"表演层"第一次可以被当成文本来版本管理——同一个脚本模板,批量产出平静版、激动版、耳语版,做有声书、播客、游戏 NPC、课程配音时省掉大量手工调参。对普通人,它提示的是一件更大的事:和生成模型打交道,越来越像写剧本、写批注,而不是拧旋钮。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。