论文信息


1. 核心目标

Lens 主要研究如何提高基础文生图模型的训练效率。

作者认为,训练效率不仅与模型大小有关,还受到以下因素影响:

$\text{Training Efficiency} \propto \frac{ \text{Data Information Density} \times \text{Convergence Speed} }{ \text{Compute per Step} }$

即Lens 的优化思路是:

  1. 控制生成模型的单步计算量;
  2. 通过高信息密度数据和更好的表征减少所需训练步数

因此,Lens 主要从三个方面优化:

  1. 提高图文数据的信息密度;
  2. 使用更容易被生成模型学习的视觉 latent;
  3. 使用更强的文本编码器加快文本—图像对齐。

2. 整体框架