跳到主内容
快讯直播
AI智模界
AI 词典

特征金字塔 FPN:为什么小目标检测离不开浅层特征

特征金字塔网络(Feature Pyramid Network,FPN)是一种在卷积神经网络内部构造多尺度特征的结构,让检测器在同一个骨干网络里,既能用上"看得清细节"的浅层特征,也能用上"认得准物体"的深层特征。

问题的根源:深层和浅层各有短板

卷积网络逐层下采样,特征图越来越小。以总步幅为 32 的那一层为例:一张 640×640 的输入图,到这里只剩 20×20。这时麻烦来了——一个 16×16 像素的小目标,在步幅 32 的特征图上连一个像素都占不满,几乎等于消失了。反过来,浅层特征图分辨率高,边缘、纹理、位置这些细节都还在,但感受野小、语义弱,"这块纹理到底是车还是路牌"它答不上来。

打个比方:从万米高空看地面,能判断"这是城区、那是农田",但看不见有人在过马路;把镜头拉到几十米,人看得很清楚,却不知道这整片地方是什么。检测器需要同时拥有这两双眼睛。

FPN 是怎么做的

1. 自底向上:骨干网络(backbone,如 ResNet)正常前向传播,得到 C2、C3、C4、C5 等不同尺度的特征图。

2. 自顶向下 + 横向连接:把最深的 C5 上采样放大一倍,与经过 1×1 卷积调整通道数的 C4 逐元素相加,得到 P4;P4 再上采样与 C3 融合得到 P3,如此逐级传递下去。

3. 分层预测:每个 P 层各接一个 3×3 卷积(用来缓解上采样带来的混叠)和预测头,不同大小的目标被分配到不同层级去检测。

结果就是:浅层获得了来自深层的语义,深层获得了来自浅层的精确定位,而计算开销只增加一点点。

和相邻概念的区别

做法思路代价
图像金字塔把输入图缩成多个尺寸,每个尺寸跑一遍完整网络计算量成倍增长
只用最后一层特征只在高语义、低分辨率的深层上预测小目标基本丢失
FPN在同一骨干网络内部跨层融合,得到多尺度特征额外开销很小

一句话区分:图像金字塔是"多跑几遍网络",FPN 是"一次前向、内部共享"。

对从业者的实际意义

  • 只要任务里有小目标——遥感影像、远距离行人、工业缺陷、医学影像——FPN 及其后续变体(如 PANet、BiFPN)几乎是默认配置。
  • 设计锚框(anchor)或做目标分配时,"大目标交给深层、小目标交给浅层"是基本直觉。
  • 实例分割、关键点检测等任务也复用了这套多尺度结构,它早已不只是检测的专属组件。

理解 FPN 的关键,是记住一条:语义强度和空间分辨率在卷积网络里天然是跷跷板,FPN 用跨层连接把两头都拿了回来。

具体实现细节与最新变体,以各框架和原论文的官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。