核心思想:用示例图像和示例 Mask 定义当前要执行的分割任务,让一个模型通过视觉上下文完成不同类型、不同粒度的图像与视频分割。

📌 基本信息

SegGPT 将语义分割、实例分割、部件分割、全景分割、视频目标分割等任务统一为一种视觉上下文学习问题。模型不依赖文本指令,而是从示例图像及其 Mask 中理解“这一次需要分割什么”。


1. 🎯 研究动机

传统分割模型通常针对某个固定任务进行训练:

这种范式存在两个问题:

  1. 不同任务需要不同的模型、输出头和数据处理方式;