帧插值(Frame Interpolation)是在两帧已知画面之间,合成出中间时刻的画面。它提高的是时间分辨率,不是单帧清晰度。
24fps 每帧间隔约 41.7 毫秒,60fps 约 16.7 毫秒。要让 24fps 变 60fps,复制帧(Frame Duplication)会一顿一顿,前后帧半透明混合(Cross-dissolve)会出重影。可行做法是:先估计前后帧里物体和像素的移动,也就是光流(Optical Flow)或运动估计(Motion Estimation);再沿运动轨迹把物体“挪”到中间位置,这叫运动补偿(Motion Compensation);最后补上被遮挡又露出的背景。好比手翻书只有第 1 页和第 2 页,画的是人从左边走到右边;帧插值就是根据两页差异,推测他走到中间时在哪,画出“第 1.5 页”。难点是遮挡、快速运动、重复纹理和光线突变会让运动估计出错,产生鬼影、撕裂、手脚多出来。深度学习方法用神经网络预测双向光流并合成中间帧,更稳,但插出来的帧不一定物理真实。
它和超分辨率(Super-Resolution)不同:后者提高单帧清晰度,帧插值提高时间流畅度。和生成视频(Video Generation)也不同:生成视频从文本、图片或噪声出发,创造整段不存在的内容;帧插值以真实前后帧为条件,目标是补出中间时刻,内容受输入约束。两者正在融合:生成式视频模型可以做帧插值,帧插值也常接在视频生成模型后提升输出帧率。
| 维度 | 帧插值 | 生成视频 |
|---|---|---|
| 输入 | 相邻两帧或更多 | 文本、图像、噪声等 |
| 目标 | 补出中间时刻 | 生成完整视频 |
| 内容 | 大体保持原内容 | 可创造新内容 |
| 典型失败 | 鬼影、撕裂 | 动作不连贯、物理不合理 |
对从业者,帧插值用于视频增强、慢动作、直播和游戏补帧、VR 显示等。它不增加真实信息,只是时间维度的合成;快速运动、遮挡、字幕、logo 和胶片颗粒都是难点。对普通人,电视的 MEMC、手机慢动作、视频平台的“流畅播放”背后常有帧插值。看球赛更顺滑,但看电影可能产生“肥皂剧效应”(Soap Opera Effect),因为 24fps 的节奏感被改写了,很多设备允许关闭。新闻或证据类视频要谨慎:插出来的帧不是真实拍到的。具体工具和参数以官方页面为准。
