一句话定义:Live Avatar(实时数字人)指的是一张能边听、边说、边做表情的合成面孔——它不是提前渲染好的视频,而是随对话被实时驱动的虚拟形象。近两年 Google 的 Gemini Live 这类实时多模态接口开始把“语音对话 + 虚拟人画面”打包在一起,让这件事从演示走向可用。具体支持的语言、延迟和接入方式,以官方页面为准。
把它想成一次视频通话:对面那个人在听你说话、会点头、会插嘴,只不过那张脸是算出来的。要做到“像通话”,难点不在画得像,而在三件事。
第一,先有声音,再有脸。 语音合成(TTS)输出音频流的同时,会附带时间戳信息:哪个音素(phoneme)在什么时刻出现、持续多久。口型不是靠“听”音频去猜的,而是直接拿到“此刻该发哪个音”的指令,再映射到对应的口型单元(viseme)。这是嘴型能对上的根本原因——对齐是沿时间轴做的,不是逐帧比对画面。
第二,表情和头部动作走另一条轨道。 眨眼、挑眉、轻微点头这些通常由独立模块驱动,按语义和停顿触发,比如说到疑问句时眉毛上抬、句尾稍作停顿。分轨的好处是:口型偶尔出问题,不会连带整张脸一起崩掉。
第三,延迟和音画同步。 真人对话的舒适区在几百毫秒内。做法一般不是等一整句话说完再生成,而是把语音切成很短的片段流式输出,渲染端收到一块就画一块,同时用统一时钟防止声音和画面越走越偏。还要支持打断(barge-in):你中途插话,它得停下来、换个表情、重新开口——这要求对话模型和渲染层都能被随时打断和重入。
和容易混淆的几个概念对比:
| 类型 | 驱动方式 | 响应速度 | 能否被打断 | 典型用途 |
|---|---|---|---|---|
| Live Avatar | 实时流式驱动 | 亚秒级到秒级 | 能 | 客服、陪练、直播 |
| 预渲染数字人 | 提前生成视频 | 只是播放 | 不能 | 宣传片、课件 |
| 视频生成模型 | 一次性生成片段 | 分钟级 | 不能 | 短片创作 |
区别的核心是“闭环”:预渲染数字人和视频生成模型都是一次性产出内容,观众只能看;Live Avatar 处在一个持续的输入—输出闭环里,所以它必须回答“被打断了怎么办”。
对从业者来说,这条链路的工程重点通常是三处:TTS 与口型时间戳的对齐精度、端到端延迟预算怎么分(网络、模型、渲染各占多少)、以及降级策略(网络抖动时先保音频还是先保画面)。对普通职场人来说,它现实的用途是客服、销售陪练、多语言培训这类高频重复的面对面场景——同一个人设可以换语言、换话术,不用重拍。
同时别忘了它的另一面:一张实时生成的脸,天然适合被滥用。肖像授权、内容标识、留存与审计,这些要在一开始就设计进去,而不是上线后再补。
