Paper:Images Speak in Images: A Generalist Painter for In-Context Visual Learning
Venue:CVPR 2023
核心关键词:Visual In-Context Learning、Masked Image Modeling、Visual Prompt、Unified Vision Tasks
Painter 将不同视觉任务统一为:
$\text{Input Image} \rightarrow \text{Output Image}$
模型不使用文本指令,而是通过一个视觉示例:
$P_x \rightarrow P_y$
理解当前需要执行的任务,再将相同映射作用到新的 Query 图像:
$x_q \rightarrow \hat y_q$
例如:
Painter 将不同任务的标注统一编码成三通道图像。
| 任务 | 输出表示 |
|---|---|
| 深度估计 | 灰度深度图复制到三个通道 |
| 语义分割 | 类别 ID 编码为 RGB 颜色 |
| 实例分割 | 不同实例使用不同颜色 |
| 人体关键点 | 关键点位置与类别编码为热力图 |
| 图像去噪 | 干净 RGB 图像 |
| 去雨、增强 | 恢复后的 RGB 图像 |
因此,所有任务都可以使用相同的网络结构和图像重建损失。