跳到主内容
快讯直播
AI智模界
AI 词典

可提示分割:给个点,就把物体抠出来

可提示分割(Promptable Segmentation)是一类分割范式:你给模型一个提示(prompt)——一个点、一个框、一条涂鸦、一块粗掩码,甚至一句话——它就把图里对应的物体按像素级轮廓抠出来。最有代表性的实现是 Meta 的 Segment Anything Model(SAM)。

它是怎么工作的

把它想成“先测绘、再指认”的流程。

1. 图像编码器(image encoder)先把整张图看一遍,压成一组特征。这步最重,但同一张图只做一次。

2. 提示编码器(prompt encoder)把你的点、框、涂鸦变成向量。

3. 掩码解码器(mask decoder)把两者合起来,输出掩码。

类比:图像编码器像提前把一张大地图测绘好,你的提示就是拿手指在图上戳一下说“我要这块”,解码器是那个立刻把地块边界画出来的助手。因为重活只干一次,同一张图你可以连着试十几个提示,几乎无感。

提示往往有歧义:一个点落在人身上,你指的是脸、衣服还是整个人?所以模型通常一次给出多个候选掩码和各自的置信度,让用户挑。

和相邻概念的区别

概念输入输出类别范围
语义分割图像每像素类别标签训练时定死的闭集
实例分割图像每个个体的掩码训练时定死的闭集
传统交互式分割图像 + 用户点/框掩码通常要针对任务训练
可提示分割图像 + 任意提示掩码(可多候选)开放,现场指定

关键差别在“闭集”和“开放”。以前要分什么就得训什么;现在类别由你在提示里当场说,模型负责把边界画准。

对实际工作的意义

  • 数据标注:医疗影像勾病灶、遥感划地块、质检标缺陷,以前靠人一笔一笔描,现在点几下出轮廓,人主要做校对。这是它最直接的产业价值。
  • 产品功能:修图换背景、电商抠商品图、视频里第一帧点一下随后自动跟踪。
  • 机器人:把“那杯水”变成一个可抓取的掩码。
  • 思路转变:分割从“一个任务”变成“一个可被提示调用的接口”,这正是视觉基础模型(vision foundation model)的典型特征。

也要知道它的边界:不给提示,它不会主动告诉你图里有什么;细长物体、密集小目标、遮挡处容易断;输出的只是轮廓,不是语义标签,要分类还得再接一个模型。具体能力范围以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。