论文信息
- 机构:Microsoft
- 时间:2026 年 5 月
- 任务:Text-to-Image Generation
- 生成主干规模:3.8B
- 主要组件:
- Lens-800M 图文数据
- FLUX.2 Semantic VAE
- GPT-OSS-20B 文本编码器
- 48 层 MMDiT
- Flow Matching
- Lens-RL-8K
- Prompt Reasoner
- Lens-Turbo
1. 核心目标
Lens 主要研究如何提高基础文生图模型的训练效率。
作者认为,训练效率不仅与模型大小有关,还受到以下因素影响:
$\text{Training Efficiency} \propto \frac{ \text{Data Information Density} \times \text{Convergence Speed} }{ \text{Compute per Step} }$
即Lens 的优化思路是:
- 控制生成模型的单步计算量;
- 通过高信息密度数据和更好的表征减少所需训练步数
因此,Lens 主要从三个方面优化:
- 提高图文数据的信息密度;
- 使用更容易被生成模型学习的视觉 latent;
- 使用更强的文本编码器加快文本—图像对齐。
2. 整体框架