🧠 概述

这篇文章做的是 基于示例的图像编辑:给定三张图 {a, a', b},模型需要生成 b',使得:

a : a' :: b : b'

也就是:从 a 到 a' 的变化,应该被类比地迁移到 b 上。

核心贡献是 LoRWeB:不是用一个固定 LoRA 去学习所有视觉类比变换,而是学习一组 LoRA basis,再用一个轻量 encoder 根据输入的类比图像对动态组合这些 LoRA,从而为每个测试样例构造一个专属的 mixed LoRA。论文认为这能更好覆盖多样化的 visual analogy space。


❓ 这篇论文想解决什么问题?

现有 image editing 很多依赖文本 prompt,但很多视觉变化很难用语言准确描述,比如:

Visual analogy learning 的优势是:用户不需要说清楚“怎么改”,只需要给一个 before/after 示例,模型自己理解变化关系。论文定义的任务就是根据 {a, a', b} 生成 b',让 a → a' 的变换迁移到 b → b'。


⚠️ 现有方法的问题

之前一些方法会在 text-to-image / image-editing backbone 上训练一个单独 LoRA,让模型学会 visual analogy。但是论文认为这个设计有一个核心瓶颈:

一个固定 LoRA 很难同时覆盖非常多样的视觉变换空间。

这些变换可能包括 style transfer、object insertion、layout modification、pose transfer、background replacement 等。单 LoRA 在训练分布内可能还可以,但面对 unseen transformation 时泛化会受限。


🧩 方法核心:LoRWeB