Analogist: Out-of-the-box Visual In-Context Learning with Image Diffusion Model
I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models
Painter:Images Speak in Images
SegGPT: Towards Segmenting Everything in Context
VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning
Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing
[Insert Anything: Image Insertion via In-Context Editing in DiT
VIRAL: Visual In-Context Reasoning via Analogy in Diffusion Transformers
RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers
Delta-Adapter: Scalable Exemplar-Based Image Editing with Single-Pair Supervision
LoRWeb: Spanning the Visual Analogy Space with a Weight Basis of LoRAs
SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens