一、背景与问题

LLM 的视觉盲区

大语言模型(LLM)拥有强大的知识表征能力,但天生缺乏像素级感知理解能力——它们只能输出文本,无法直接完成分割、检测等需要像素级输出的视觉任务。

SAM 的局限性

SAM(Segment Anything Model)虽然在视觉提示驱动的分割上取得了突破,但存在三个根本性限制:

  1. 单次只能输出单个 mask,无法一次预测图中所有目标的分割
  2. 不支持类别感知分割,无法区分"狗"和"猫",只知道"有个物体"
  3. 无法统一所有分割任务——generic/referring/reasoning/interactive 等任务各自孤立,无法在一个模型中处理

现有方法的不足

方法 问题
LISA 只支持 Referring + Reasoning Seg,任务覆盖窄
GLaMM 支持 Referring + GCG,但缺少 Interactive/VGD
PSALM 覆盖较广但缺少 VGD,且 OV 性能弱
OMG-LLaVA 覆盖 Generic + Referring + GCG,无 VGD
没有任何已有方法同时支持全部 7 类分割任务 —

二、核心贡献

X-SAM 提出三件事:

  1. 统一 MLLM 架构:把 SAM 升级为可处理所有分割任务的通用分割模型
  2. 新任务 VGD Segmentation:提出"视觉引导分割",用图像中的视觉区域作为提示,分割同类或跨图的所有实例
  3. 多阶段统一训练策略:支持在 20+ 数据集上端到端联合训练

三、方法详解

3.1 统一输入格式

X-SAM 将所有分割任务的输入归纳为两大类: