Google DeepMind 在官方博客发布文章《Say hello to Gemini 3.8 text-to-speech》,宣布推出 Gemini 3.8 的文本转语音(text-to-speech,TTS)能力。这是 Gemini 3.8 系列在语音方向的最新动作;标题中的“say hello”既是向用户打招呼,也点明了这项能力的用途——让模型把文字“说”出来。
目前公开的发布信息较为简洁,未包含模型规模、支持语种、延迟指标或音色数量等具体参数。对关注者来说,后续值得跟踪的是官方文档与 API 侧是否同步开放,以及定价与调用限制。
为什么重要:文本转语音是语音交互闭环的输出端。大模型产品在语音方向的竞争,已经从语音识别(把话听清)延伸到语音合成(把话说好),评价维度通常包括自然度、韵律与情感表现、多语种与口音覆盖、首包延迟,以及能否在长对话中保持音色与风格的一致性。对开发者而言,TTS 质量直接决定语音助手、实时翻译、有声内容生成、无障碍阅读与语音 Agent 等场景的可用性,而延迟与成本则决定这些场景能否真正落地为实时产品。
此次发布意味着 Google 继续把语音能力纳入 Gemini 主线模型的迭代节奏,也为正在做技术选型的团队提供了一个新的候选方案。是否适配具体业务,仍需以官方文档和实测结果为准。
原文链接:https://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/
