跳到主内容
快讯直播
AI智模界
AI 词典

Focal Loss:让模型专心啃硬骨头

一句话定义

Focal Loss(焦点损失)是一种改进的交叉熵损失函数:它给那些模型已经分对、且很有把握的样本降权,把训练注意力集中到难分的样本上,以此缓解类别极度不平衡的问题。

为什么需要它

标准交叉熵(Cross Entropy)对每个样本一视同仁。类别均衡时这没问题;但在极端不平衡的场景下就麻烦了。比如目标检测里,一张图可能只有几个真正的前景目标,却有成千上万个背景候选框。模型很快就能把绝大多数背景框判对,于是损失几乎全由这些"简单样本"贡献,真正需要学的那几个目标和少数易混淆的背景,信号被淹没了。

打个比方:老师批改一个 100 人的班,其中 97 人几乎全对,3 人错得离谱。如果每道题等量计分,老师的精力全耗在批改那 97 份满分卷上,最该讲评的错题反而排在最后。Focal Loss 相当于给"答对的题"打折——越有把握的答案打折越狠,剩下的损失分值自然主要来自错题。

它是怎么做到的

公式大致是:FL = −α(1−p)^γ · log(p)。

p 是模型对正确答案给出的预测概率。p 越接近 1(越有把握),调制因子 (1−p)^γ 越接近 0,这个样本的损失被压得几乎归零;p 越小(越没把握),调制因子越接近 1,损失基本保持原样。γ 是聚焦参数,越大压制越狠,论文里常用 2 左右;α 是类别权重,用来再平衡正负样本。这两个超参数都可以调,具体取值以实际任务和官方实现为准。

和相邻概念的区别

方法对简单样本的处理特点
交叉熵原样保留简单通用,不平衡时被多数类淹没
加权交叉熵按类别整体加权权重按类固定,不区分同一类内部难易
难例挖掘(Hard Example Mining)直接丢弃非此即彼的选择,不可微,需额外流程
Focal Loss按难度连续降权保留全部样本,可端到端训练,软过渡

核心差异在于"动态且连续":权重不是人为按类指定的常数,而是跟着模型当前的预测能力自动变化。

对你意味着什么

做分类、检测、分割这类明显不平衡的任务时,可以把 Focal Loss 当作交叉熵的替换项先试一版。类别越不平衡、简单样本占比越高,通常收益越明显。反过来,在本身就均衡的数据上,它未必更好,甚至可能因为过度关注噪声样本而变差。它也不是只能用在视觉任务上,NLP、推荐等场景里同样有人把它当调参选项,是否启用,最终还是看实际验证结果。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。