跳到主内容
快讯直播
AI智模界
AI 词典

帧采样:视频模型看哪几帧,决定它看到什么

一句话定义:帧采样(Frame Sampling)是从一段视频里挑选出若干帧,作为视频模型实际输入的过程。

视频本质是连续图像序列。一段 10 分钟、30fps 的视频有 18000 帧。如果全部送进模型,计算和显存都吃不消,而且相邻帧高度相似,信息冗余。所以模型通常不会“看完”整段视频,而是像抽查作业:从时间轴上挑几帧看。挑哪几帧、挑多少帧,就是帧采样策略。

打个比方:老师检查一学期课堂纪律,不可能看完整监控,只能抽几段录像。如果每天固定上午 10 点看 1 分钟,可能正好看到大家认真听讲;如果只抽开学第一周和最后一周,就错过期中那场全班打闹。帧采样也一样:均匀抽帧可能漏掉一闪而过的关键动作;抽得太密又浪费算力。

常见策略对比:

策略做法优点风险
均匀采样按固定间隔取帧简单,覆盖时间轴均匀可能错过短暂关键事件
随机采样随机挑若干帧训练时增加多样性推理结果不稳定,可能漏看
关键帧/自适应采样根据画面变化、运动幅度选帧把算力花在“有变化”处实现复杂,可能被噪声干扰

和相邻概念的区别:

  • 帧率(Frame Rate)是视频拍摄或编码时每秒包含多少帧,是视频本身的属性;帧采样是模型从这些帧里取多少、取哪些,是输入处理策略。
  • 关键帧(Keyframe)在视频编码里指可独立解码的帧,不等于模型采样选中的帧。模型可以采样到非关键帧。
  • 时间下采样(Temporal Downsampling)通常指降低时间分辨率,和帧采样有重叠,但帧采样更强调“选哪些”,而非仅仅“隔几个取一个”。

对从业者:视频理解、视频生成、多模态大模型都绕不开采样。采样太少,模型看不到快速动作和短事件;采样太多,算力成本上升,还可能引入冗余。设计时要在覆盖度、成本和任务需求之间权衡。对普通人:如果你上传一段长视频问 AI“球是怎么进的”,它可能因为只看了几帧而答错或答得笼统。这不是它“笨”,而是它没被给到关键画面。想让它看得更准,可以裁剪出关键片段,或明确让它关注某段时间。具体产品支持的上传时长和采样方式,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。