跳到主内容
快讯直播
AI智模界
AI 词典

语义分割:给每个像素贴一张类别标签

语义分割(Semantic Segmentation)只做一件事:把一张图里的每个像素都归进一个类别——这块是"路",那块是"车",上面那片是"天"。它不回答"图里有几辆车",只回答"哪些像素属于车"。

你可以把它想成给小区平面图上色:规定道路必须涂灰、草地必须涂绿、楼房必须涂红。上完色之后,整张图每个点都有颜色,没有留白。但注意,如果小区里有三栋楼,它们会被涂成同一片红色,连成一块——语义分割"认类不认个"。

技术上怎么实现?模型先把图像逐步下采样,抽出"这是边缘""这是纹理""这是车灯"这类特征,再逐层上采样回原图尺寸,最后输出一张和原图等大的"类别图":每个像素位置上,模型给出它属于各个类别的概率,取最大的那个作为结果。编码器—解码器结构加跳跃连接(把浅层的高分辨率细节直接接到深层)是这类网络的常见做法。

和相邻概念的分界

  • 目标检测(Object Detection):输出的是矩形框加类别,粒度到"框"为止。想知道车在哪,够了;想知道车压线压了多少厘米,不够。
  • 语义分割:粒度到像素,但同类不分家。三辆车涂成一片,数不出数量。
  • 实例分割(Instance Segmentation):像素级 + 区分个体,车 1、车 2、车 3 各有各的轮廓。常见做法是先检测出每个目标,再在框内做分割。
  • 全景分割(Panoptic Segmentation):把"可数的东西"(车、人)和"不可数的背景"(天空、道路)统一到一张像素级结果里,相当于实例分割 + 语义分割合体。
  • 可提示分割(Promptable Segmentation):不靠固定类别表,而是你给一个点、一个框或一句话,它把对应的目标抠出来。它的强项是"任意目标、零样本",但它本身不负责把全图每个像素都贴上类别标签。
概念输出粒度同类个体是否区分类别表
目标检测框区分固定
语义分割像素不区分固定
实例分割像素区分固定
可提示分割掩码由提示决定不固定

对实际工作意味着什么

需要"面积、边界、形状"的场景,才轮到语义分割上场:自动驾驶里的可行驶区域、医学影像里的病灶范围、遥感影像里的地表覆盖分类、工业质检里的缺陷面积、文档版面分析里的表格与正文区域。如果只需要知道"有没有、大概在哪",检测就够了,不必付像素级的成本。

代价主要在标注:逐像素涂抹很贵,一张图可能要几十分钟。因此实践中常见弱监督、半监督,或者先用可提示分割生成候选掩码、人工只做修正。评估上通常看交并比(Intersection over Union, IoU),再对各类取平均得到 mIoU——具体口径与工具实现,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。