Paper:Images Speak in Images: A Generalist Painter for In-Context Visual Learning

Venue:CVPR 2023

核心关键词:Visual In-Context Learning、Masked Image Modeling、Visual Prompt、Unified Vision Tasks


💡 核心思想

Painter 将不同视觉任务统一为:

$\text{Input Image} \rightarrow \text{Output Image}$

模型不使用文本指令,而是通过一个视觉示例:

$P_x \rightarrow P_y$

理解当前需要执行的任务,再将相同映射作用到新的 Query 图像:

$x_q \rightarrow \hat y_q$

例如:


🧩 任务统一方式

Painter 将不同任务的标注统一编码成三通道图像。

任务 输出表示
深度估计 灰度深度图复制到三个通道
语义分割 类别 ID 编码为 RGB 颜色
实例分割 不同实例使用不同颜色
人体关键点 关键点位置与类别编码为热力图
图像去噪 干净 RGB 图像
去雨、增强 恢复后的 RGB 图像

因此,所有任务都可以使用相同的网络结构和图像重建损失。