跳到主内容
快讯直播
AI智模界
AI 词典

端到端语音对话(Speech-to-Speech / Realtime API)

一句话定义:端到端语音对话,是让模型直接「听音频、出音频」,省掉「先转写文字、再生成回复、最后朗读」的接力管线;Realtime API 则把这种能力封装成一条长连接、可打断、可调用工具的实时会话接口。

三段式为什么慢

传统语音助手是流水线:ASR(Automatic Speech Recognition,自动语音识别)把声音转文字,LLM(大语言模型)生成回复文字,TTS(Text-to-Speech,语音合成)再念出来。这像翻译接力赛——记录员先抄稿,翻译再译稿,播音员最后念稿。三人排队,第二个人必须等第一个人收工,延迟天然是三段之和;而你叹气、发笑、犹豫的那半秒,在「抄成稿」的一刻就被抹平了。

端到端更像同声传译:一个人边听边开口,中间没有稿件交接。模型把音频切成离散的「音频 token」,当作和文字 token 类似的东西,自回归地直接预测下一段声音。听到一声上扬的「嗯?」,它回一句同样上扬的「啊?」——这种语气连续性不需要任何显式标注。

那条长连接在忙什么

Realtime API 一般跑在 WebRTC(Web Real-Time Communication,网页实时通信)这类双向流式通道上。WebRTC 本就为音视频通话而生,自带 Opus 编码、抖动缓冲、丢包补偿、回声消除,正好把麦克风的声音一小片一小片推给服务器。同一条连接上,几件事并行发生:

  • 边说边听:音频分帧上传、增量解码,不必等一整句话说完。
  • 可打断:服务端用 VAD(Voice Activity Detection,语音活动检测)判断你开始说话,就取消正在生成的回复并清空本地播放缓冲。难点不在静音,而在回滚「已生成但还没播完」的那一段。
  • 轮次检测:什么算「说完了」?靠静音时长加语义判断。太灵敏会被你的换气打断,太迟钝就变成对讲机。
  • 工具调用:模型中途可以决定「这个得查一下」,先播一句过渡话,结果回来接着说,连接始终不断。

和级联式的区别

维度级联式 ASR→LLM→TTS端到端语音对话
中间表示文本音频 token(部分实现保留文本辅助)
延迟三段串行累加单次流式生成
语气情绪转写时丢失保留
可审计性文本日志清晰较难排查,需音频留痕
错误定位分段可测端到端糅在一起

端到端不等于完全不要文本:有的实现仍让模型内部先吐一小段文字再出声,兼顾稳定与可读,但对外是单次调用。

实际意义

做产品的人要重新设计交互:以前是「说完—转圈—回答」,现在可以插话、可以听到对方在思考。打断后的状态恢复、静音阈值、没有文本日志时怎么做质检,都得重想。普通人这边,终于像打电话而不是对着对讲机念稿子。但语音模型同样会听错、会编造,涉及金额、地址、医嘱这类关键信息,最好让它复述或落到文字确认。具体能力与资费以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。