一句话定义:帧采样(Frame Sampling)是从一段视频里挑选出若干帧,作为视频模型实际输入的过程。
视频本质是连续图像序列。一段 10 分钟、30fps 的视频有 18000 帧。如果全部送进模型,计算和显存都吃不消,而且相邻帧高度相似,信息冗余。所以模型通常不会“看完”整段视频,而是像抽查作业:从时间轴上挑几帧看。挑哪几帧、挑多少帧,就是帧采样策略。
打个比方:老师检查一学期课堂纪律,不可能看完整监控,只能抽几段录像。如果每天固定上午 10 点看 1 分钟,可能正好看到大家认真听讲;如果只抽开学第一周和最后一周,就错过期中那场全班打闹。帧采样也一样:均匀抽帧可能漏掉一闪而过的关键动作;抽得太密又浪费算力。
常见策略对比:
| 策略 | 做法 | 优点 | 风险 |
|---|---|---|---|
| 均匀采样 | 按固定间隔取帧 | 简单,覆盖时间轴均匀 | 可能错过短暂关键事件 |
| 随机采样 | 随机挑若干帧 | 训练时增加多样性 | 推理结果不稳定,可能漏看 |
| 关键帧/自适应采样 | 根据画面变化、运动幅度选帧 | 把算力花在“有变化”处 | 实现复杂,可能被噪声干扰 |
和相邻概念的区别:
- 帧率(Frame Rate)是视频拍摄或编码时每秒包含多少帧,是视频本身的属性;帧采样是模型从这些帧里取多少、取哪些,是输入处理策略。
- 关键帧(Keyframe)在视频编码里指可独立解码的帧,不等于模型采样选中的帧。模型可以采样到非关键帧。
- 时间下采样(Temporal Downsampling)通常指降低时间分辨率,和帧采样有重叠,但帧采样更强调“选哪些”,而非仅仅“隔几个取一个”。
对从业者:视频理解、视频生成、多模态大模型都绕不开采样。采样太少,模型看不到快速动作和短事件;采样太多,算力成本上升,还可能引入冗余。设计时要在覆盖度、成本和任务需求之间权衡。对普通人:如果你上传一段长视频问 AI“球是怎么进的”,它可能因为只看了几帧而答错或答得笼统。这不是它“笨”,而是它没被给到关键画面。想让它看得更准,可以裁剪出关键片段,或明确让它关注某段时间。具体产品支持的上传时长和采样方式,以官方页面为准。
