探索/视觉

新篇视觉arXiv:2304.02643

SAM:把分割变成提示接口

Segment Anything

Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C. Berg, Wan-Yen Lo, Piotr Dollár, Ross Girshick

ICCV · 2023

12k 引用 · 1.5k 阅读 · 0 收藏

摘要

提出可提示的分割模型与十亿级掩码数据,使点、框等提示都能零样本得到掩码。

Introduces a promptable segmentation model and a 1B-mask dataset, enabling zero-shot masks from points, boxes, or text-like prompts.

提要

SAM 把分割从依赖预定义类别的任务,改写成可接受点、框等输入的通用提示接口。配合数据引擎与大规模掩码数据,模型能在零样本条件下为提示生成可用掩码。

01背景与动机

传统分割多绑定固定类别与专用标注,开放场景中物体形态多变,类别表难以穷尽,导致模型难迁移、标注成本高,分割能力也难以作为通用模块被下游系统反复调用。

为此,工作转向可提示分割:用数据引擎循环产生掩码并训练基础模型,使分割成为可迁移的几何技能,目标是对任意对象在提示下给出合理掩码,而非先背诵类别名单。

02核心方法

架构由图像编码器、提示编码器与掩码解码器组成。图像先编码为嵌入;点、框等提示经提示编码器注入;解码器融合二者并输出掩码,从而把分割写成统一的提示—掩码接口。

提示可为前景或背景点、边界框等;面对歧义时模型支持多掩码输出,以覆盖多种合理分割假设。整体强调提示灵活与一次前向出掩码,便于交互与系统集成。

Segment Anything 模型根据点、框或掩码等提示生成物体分割,面向可提示的通用分割任务。
1. Segment Anything 模型根据点、框或掩码等提示生成物体分割,面向可提示的通用分割任务。

03结果与证据

评价侧重提示驱动的零样本掩码:在未见分布与多样提示下检查能否得到可用分割,并观察其作为中间模块接入编辑、标注等流程时的表现,而不是只报单一封闭类别表上的名次。

数据方面,借助数据引擎迭代标注,构建约十亿掩码规模的数据集,用以支撑可提示训练与迁移。证据主线是接口通用性、数据规模与零样本可用性,而非堆叠未经核实的单项分数。

数据引擎采集的 SA-1B 数据集掩码示例。
2. 数据引擎采集的 SA-1B 数据集掩码示例。

04影响与意义

发布后,SAM 迅速进入图像编辑、交互式标注和视觉智能体流水线,成为获取对象掩码的常用组件,降低了为下游任务临时训练分割器的成本。

更重要的是接口形态:把分割收成可提示技能后,其他系统可按需调用几何分割能力,使基础模型以模块方式复用,而不是每个应用从零定义类别与损失。

SA-1B 的更多示例:日常照片上密集、相互重叠的掩码。
3. SA-1B 的更多示例:日常照片上密集、相互重叠的掩码。

05局限

视频时序一致性、严重遮挡以及需要细粒度语义区分的场景仍力有不逮,通常要靠后续专用模型、跟踪器或语义系统补齐,不能假设单次静态提示已解决全部结构难题。

名称中的 anything 指更广的可分割对象与提示形式,并不等于理解物体是什么,也不自动完成开放词汇识别或复杂属性推理;掩码可用与概念正确仍是不同层面的问题。

用于训练可提示分割模型的更多 SA-1B 标注示例。
4. 用于训练可提示分割模型的更多 SA-1B 标注示例。

06要点

  1. 01基础模型也可以表现为可复用的几何技能,而不只是类别识别器。
  2. 02数据引擎的循环标注往往比单次静态标注更能支撑可迁移分割。
  3. 03提示化是把视觉分割能力接入编辑、标注与智能体系统的合适接口。

标签

segmentationfoundation

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。