跳到主内容
快讯直播
AI智模界
模型

谷歌更新 Gemini 3.8 文本转语音能力

Google 官方博客的 Gemini 模型板块新增了一篇以“Gemini 3.8 text-to-speech”为题的内容,收录在 models-and-research/gemini-models 路径下。截至本条快讯整理时,该页面未附带可供引用的摘要信息,因此这项文本转语音能力的具体参数——支持语种、音色与情感控制方式、延迟表现、开放接口与计费方式、覆盖区域等——仍需以官方页面公布的内容为准。

从标题命名看,这是 Gemini 3.8 模型线在语音输出方向上的更新,而非一个独立命名的全新产品。

为什么值得关注:文本转语音长期是语音交互链路中最容易被低估的一环。当大模型的推理与理解能力持续提升后,语音 agent 的体验瓶颈往往转移到“说”的环节——韵律是否自然、能否应对多轮打断、长文本与专有名词的发音是否稳定、端到端延迟能否压到接近真人对话的水平。对正在做实时语音助手、客服自动化、无障碍阅读与音频内容生产的团队来说,模型侧的 TTS 更新会直接进入选型清单,也会影响既有的语音合成方案是否需要重新评估。

建议关注者直接查看官方博客原文,先确认能力范围、开放条件与可用性,再判断迁移或接入的成本。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。