语音合成(TTS)这两年变化很大。以前的 TTS 是"能听懂就行",现在很多场景里,听众第一反应是"这是真人还是合成的"。但真正上手选型时会发现,评价一个 TTS 不是只看"像不像人":有声书要的是长文本不崩、情绪连贯;客服 IVR 要的是低延迟、SSML 精细可控;短视频配音要的是音色有梗、出稿快;企业内部把文档转语音,最在意的其实是单价和稳定性。同一份需求单,落到不同工具上结论可能完全相反。
先把选手分成四类
第一类:云厂商通用 API。 微软 Azure 语音、Google Cloud TTS、Amazon Polly,以及国内的阿里云、腾讯云、火山引擎语音。特点是语音库规模大、语种覆盖广、稳定性好,支持 SSML 之类的标记语言做精细控制,按字符计费,有免费试用额度。缺点是"默认音色"往往偏播音腔,想要特别有辨识度的声音,得自己调或做定制。
第二类:音质专精型。 ElevenLabs、MiniMax 语音、Cartesia、PlayAI、Resemble 等。它们把力气全花在自然度、情感表现和声音克隆上,产品形态多是订阅制 + 字符额度。适合播客、游戏配音、品牌 IP 声音这类"音色即产品"的场景。
第三类:中文与行业老牌。 科大讯飞、百度语音等,在中文多音字、方言、行业术语上积累深,常年服务客服、教育、车载、无障碍等场景。定价偏企业授权,个人开发者体验路径没有前两类那么顺。
第四类:开源自部署。 CosyVoice、GPT-SoVITS、ChatTTS、Fish Speech、F5-TTS 这类项目,软件本身免费,音色克隆门槛低,但算力、部署、并发、运维都得自己扛,商用前要逐条确认模型许可证。
公开信息对比一览
下表只做定性对比,具体参数与计费口径各家都在变,请以官网页面为准。
| 工具/类型 | 定位 | 价格模式 | 核心能力(公开口径) | 适合谁 |
|---|---|---|---|---|
| Azure / Google / AWS 语音 | 通用云 API | 按字符阶梯计费,含免费额度,克隆等能力单独计价 | 语种多、SSML 控制细、流式合成、企业级 SLA | 需要全球多语言、要嵌进现有云架构的团队 |
| 阿里云 / 腾讯云 / 火山引擎语音 | 国内通用云 API | 按量 + 资源包 + 预付费,常有新用户免费额度 | 中文音色丰富、方言与行业音色、支持声音复刻 | 国内产品、客服外呼、短视频配音 |
| 科大讯飞等老牌 | 中文与行业方案 | 按量 + 行业授权,企业报价制 | 中文韵律、多音字、行业术语处理、离线方案 | 教育、车载、无障碍、政企项目 |
| ElevenLabs | 音质优先 | 订阅分档,按字符额度,克隆与商用授权分档 | 情感表现力强、声音克隆、多语言配音 | 播客、有声内容、出海内容团队 |
| MiniMax 语音 / 火山语音 | 音质 + 中文 | 按量或套餐 | 中文自然度高、音色风格化、克隆 | 短视频、直播、互动内容 |
| OpenAI TTS 等模型内置语音 | 与大模型生态绑定 | 随 API 用量计费 | 接入简单、对话场景顺滑、音色偏克制 | 做 AI 对话、口语陪练、快速原型 |
| Cartesia / PlayAI 等 | 实时低延迟 | 订阅 + 按量 | 流式响应快、适合实时交互 | 语音助手、实时客服、Agent 产品 |
| CosyVoice / GPT-SoVITS / Fish Speech | 开源自部署 | 软件免费,自付算力与运维 | 本地克隆、可微调、数据不出内网 | 有 GPU、有隐私要求的技术团队 |
| Edge 朗读 / 系统内置语音 | 免费捷径 | 免费 | 即装即用,音色有限 | 个人试听、非商用演示;正式商用请走正规授权渠道 |
音色:库大不等于合适
第一次选型最容易踩的坑,是把"音色数量"当成核心指标。几百上千个音色里,真正能用的可能就那么几个。更该问的是三个问题:有没有你需要的语域(新闻播报、客服、童声、纪录片旁白、带货口播),情绪是预设还是可控(同一音色能否切换"平静/兴奋/遗憾"),克隆的音色像不像、稳不稳(同一段文本连读十遍,音色会不会飘)。
举个具体例子:做儿童故事,需要的是偏夸张、语速有起伏的音色,云厂商默认的新闻腔一读就出戏;反过来做银行外呼,"太有感情"反而是事故。所以正确做法是先拿自己最典型的三五段稿子去各家试听,而不是看宣传页。
停顿自然度:差距最大的地方
音色可以靠克隆追平,停顿和韵律才是真正拉开差距的部分。判断方法很朴素,拿这几类句子去跑:
- 长句与并列结构:"本次更新包括语音识别、合成、降噪三项能力。"——逗号停顿是否均匀。
- 数字与时间:"3月15日下午2点30分,会议改到B栋12层。"——会不会读成奇怪的断句。
- 多音字与专有名词:"重"庆 vs "重"复,"行"业 vs 银"行",品牌名会不会被拆错。
- 长文本呼吸感:连续念五分钟,句尾会不会越来越平、越读越快。
工程上,云厂商一般提供 SSML 或类似标记做停顿、语速、音高的显式控制,这比"等模型自己发挥"稳得多。做正式项目时,建议把标点规范、数字写法、缩写展开这一层预处理做好,收益往往比换供应商更大。
价格梯度:大致三条线
零成本线:开源模型自部署、系统朗读。软件不花钱,但算力和人力是隐性成本,商用授权要单独确认。
按量线:云厂商按合成字符计费。量小的时候几乎无感,量大了单价和阶梯就很关键,通常还有资源包、预付费折扣可谈。这类模式最适合"调用量波动大、不想养机器"的团队。
订阅线:音质专精型产品为主,按月或按年给字符额度,克隆、商用授权、高并发往往分档解锁。适合内容团队,因为产出本身就是内容。
企业线:私有化部署、定制音色、专属并发,走报价制。金融、政务、医疗这类对数据出域敏感的行业多半走这条。
具体单价请以各家官网计费页为准,梯度变化很快,本文不给任何数字。
结论:按场景对号入座
- 要嵌进已有云架构、多语言 + 高稳定:选通用云 API,优先选和你现有云同一家的,省跨云流量和运维。
- 音色就是产品卖点(播客、有声书、品牌 IP):选音质专精型,先小额度试听再上量,重点验证长文本稳定性和克隆一致性。
- 国内产品、中文为主、要方言或行业音色:国内云厂商或老牌语音厂商,中文韵律和多音字通常更省心。
- 实时对话、Agent、语音助手:优先看流式响应和打断能力,延迟比音色更影响体验。
- 数据不能出内网、有 GPU:开源自部署,但要提前算清运维和并发成本。
- 只是个人偶尔用:先用免费方案试听,确定需求再付费,别一上来就买年付。
实操建议只有一条:给自己准备一份 10 句话的测试稿,覆盖数字、多音字、中英混读、长句和情绪句,把候选工具全跑一遍再决策。 参数与价格以官网为准,建议试用后再决策。
*本文框架由 AI 生成,实际体验因人而异,欢迎读者补充实测。*
