核心问题

现有方法用预训练 T2I 生成模型(如 Stable Diffusion)的先验做 dense prediction,但 T2I 是 text→image,而 dense prediction 本质是 image→image。图像编辑模型(image editor)才是更对口的 backbone,为什么没人用?


核心发现

对 editor 和 generator 在 dense prediction 上的 fine-tuning 行为做系统分析,发现:


前置知识(Step1XEdit 介绍及生成模型对比):

<aside>

生成模型:T2I 生成模型(比如原始 FLUX)只有 target,没有 source:

纯生成:噪声 + 文本描述 → 图像 没有 source,从零生成

所以 FLUX 的 DiT 输入序列里只有一份 latent(target 的 noisy latent)。

而 Step1X-Edit 在 FLUX 基础上做了改造,把 source 图的 latent 也塞进输入序列,让模型在生成 target 的同时能"参考"原图,这样才能做到编辑而不是随机生成。

</aside>

方法:FE2E 框架

<aside>

image.png

**FE2E 适配流程。**灰色背景展示了原始编辑模型的工作流程,其余部分则详细说明了 FE2E:

① 预训练的 VAE 将经过对数量化的深度𝐝、输入图像𝐱和法线𝐧编码到潜空间中。

② DiT $f_θ$从固定原点$𝐳_0^y$(而不是随机噪声)到目标潜向量$𝐳_1^y$学习一个恒定速度𝐯,该过程独立于t或指令。

③ 通过重新利用被舍弃的输出区域,FE2E 在无需额外计算的情况下联合预测深度和法线。 训练损失是在潜空间中计算的,最终预测仅在推理时由 VAE 解码

</aside>

Backbone 选用当前 SoTA 编辑器 Step1X-Edit(基于 FLUX 微调的 DiT 架构)。

直接适配有两个核心障碍,分别提出了对应解决方案:

1. Consistent Velocity Flow Matching(确定性训练目标)

问题:编辑任务是不确定性任务(同一输入可以有多种合理输出),其训练目标是预测"瞬时速度";而 dense geometry prediction 只有唯一 GT,天然确定性,直接用编辑目标会引入误差。

解决:将训练目标改写为"consistent velocity",并设置固定起始点,让模型学习从固定出发点到 target latent 的恒定速度,适配确定性任务。

2. Logarithmic Annotation Quantization(对数量化)

问题:Step1X-Edit 用 BF16 精度训练,对 RGB 输出够用;但 depth estimation 需要远高于此的数值精度,直接用会产生精度伪影。

解决:对 GT depth 做对数量化(logarithmic quantization),压缩深度值的动态范围,使其与 BF16 的精度分布更匹配,同时避免误差放大。