大语言模型(LLM)拥有强大的知识表征能力,但天生缺乏像素级感知理解能力——它们只能输出文本,无法直接完成分割、检测等需要像素级输出的视觉任务。
SAM(Segment Anything Model)虽然在视觉提示驱动的分割上取得了突破,但存在三个根本性限制:
| 方法 | 问题 |
|---|---|
| LISA | 只支持 Referring + Reasoning Seg,任务覆盖窄 |
| GLaMM | 支持 Referring + GCG,但缺少 Interactive/VGD |
| PSALM | 覆盖较广但缺少 VGD,且 OV 性能弱 |
| OMG-LLaVA | 覆盖 Generic + Referring + GCG,无 VGD |
| 没有任何已有方法同时支持全部 7 类分割任务 | — |
X-SAM 提出三件事:
X-SAM 将所有分割任务的输入归纳为两大类: