核心思想:用示例图像和示例 Mask 定义当前要执行的分割任务,让一个模型通过视觉上下文完成不同类型、不同粒度的图像与视频分割。
SegGPT 将语义分割、实例分割、部件分割、全景分割、视频目标分割等任务统一为一种视觉上下文学习问题。模型不依赖文本指令,而是从示例图像及其 Mask 中理解“这一次需要分割什么”。
传统分割模型通常针对某个固定任务进行训练:
这种范式存在两个问题: