时序一致性(Temporal Consistency)指的是:在一段视频里,相邻帧对同一个物体、同一块纹理、同一张脸的描述保持连贯——说人话就是"别闪、别抖、别变脸"。
为什么它这么难
视频拆开就是"一叠排好队的图片"。绝大部分生成模型的本职工作是画好一帧,它对前后帧没有天然的责任感。更要命的是,扩散类模型每一帧都从各自的随机噪声出发,随机数不同,细节就微微不同:这帧眼角多一道褶,下帧少一道;这块墙砖上一帧偏灰,下一帧偏蓝。单看每一张都挺好看,连起来播放,人眼对"跳变"极其敏感,立刻就成了闪烁和抖动。
打个比方:你请一百个画师,一人画一帧动画,但彼此不许交流、不许看别人画了什么。结果就是猫的胡子每帧长度不一样,衣服颜色逐帧漂移,主角的脸从第三帧开始慢慢变成另一个人。问题不在画技,在于没人负责"连贯"这件事。
长视频更糟。误差会滚雪球:第 10 帧偏一点,第 50 帧偏很多,到第 200 帧已经面目全非,这就是常说的身份漂移(identity drift)。镜头一转、物体被遮挡再出现,模型往往"忘了"它原来长什么样。
业界一般怎么压住它
| 手段 | 做了什么 | 直觉 |
|---|---|---|
| 跨帧注意力 / 共享隐变量 | 生成当前帧时能"看到"相邻帧 | 画师们拉个群,边画边瞟前一帧 |
| 光流与运动约束 | 显式规定像素该往哪儿移动 | 给每个点画好轨迹线 |
| 关键帧 + 传播插值 | 先定几个锚点帧,再往中间补 | 先定构图,再填过渡 |
| 相邻帧共享噪声或初始化 | 让连续帧从相近的随机起点出发 | 起点接近,终点不容易跑偏 |
| 后处理时序滤波、区域重绘 | 生成完再磨平闪烁,脸部单独修 | 剪辑阶段统一调色 |
| 记忆机制 / 更长的时间建模 | 给模型一个"记住前面"的口袋 | 记不住,就会忘脸 |
别和相邻概念搞混
- 帧间平滑:偏观感层面的后处理,把跳变压小;时序一致性是生成过程中就该有的属性。
- 身份一致性:只保证"脸是同一个人";时序一致性还管衣服褶皱、背景纹理、光照不跳。
- 运动一致性 / 物理合理性:管的是"球抛出去该走抛物线",轨迹合理不代表画面不闪。
对从业者的实际意义
评估一个视频生成能力,别只看抽出来的单帧截图有多惊艳,一定要完整播放看稳定性——闪烁是最常见的"不可用"原因,影视、广告、电商素材里,一条抖动的片子基本等于废片,而逐帧修脸的时间成本常常高于重新生成。
对普通人来说,这也是识别 AI 视频的小技巧:盯住耳朵、手指、背景文字和纹理,跳变往往先出现在这些地方。同时也就能理解,为什么"多生成几秒"比"生成一秒"难得多——难的不是画得好,而是画得住。
各家模型的具体支持时长与效果,以官方页面为准。
