LLM WIKI · PAPER 001

ICML 2024 · 中文精校译本 · arXiv:2403.03206

缩放 Rectified Flow Transformer:高分辨率图像合成

Scaling Rectified Flow Transformers for High-Resolution Image Synthesis

Patrick Esser、Sumith Kulal、Andreas Blattmann、Rahim Entezari、Jonas Müller、Harry Saini、Yam Levi、Dominik Lorenz、Axel Sauer、Frederic Boesel、Dustin Podell、Tim Dockhorn、Zion English、Kyle Lacey、Alex Goodwin、Yannik Marek、Robin Rombach · Stability AI

SD3 Minimal Zine 风格封面:从噪声沿直线路径走向数据

MINIMAL ZINE COVER / FLOW MATCHING AS A STRAIGHTENED PATH / 2026

翻译约定本页以本地 28 页论文 PDF 为底稿。Flow MatchingRectified FlowTransformerMM-DiTattentiontokentimesteplog-SNR 等术语保留英文;首次出现时给出中文解释。图像均直接裁自原论文,表格数据逐项转录。

摘要

PDF PAGE 1

Diffusion model 通过逆转“数据逐渐走向噪声”的前向路径,从噪声中生成数据,并已成为处理图像、视频等高维感知数据的强大生成建模方法。Rectified Flow 是一种较新的生成模型形式,它用直线连接数据与噪声。尽管这一形式在理论性质和概念简洁性上更有优势,却尚未决定性地成为标准实践。

本文改进了训练 Rectified Flow 时既有的噪声采样技术,使训练更偏向具有感知意义的噪声尺度。作者通过大规模研究证明,与成熟的 diffusion formulation 相比,这一做法在高分辨率文生图任务上表现更好。论文同时提出一种新的 Transformer 文生图架构:文本与图像两种模态使用彼此独立的权重,并允许信息在 image token 与 text token 之间双向流动,从而改善文本理解、文字生成和人类偏好评分。

实验表明,该架构呈现可预测的 scaling trend;更低的 validation loss 与多种自动指标及人类评测中更好的文生图性能相关。最大模型达到约 8B 参数并超过当时的 state-of-the-art 模型。作者承诺公开实验数据、代码与模型权重。

Figure 18B Rectified Flow 模型的高分辨率样本

样本展示了 typography、精确 prompt following、空间关系、细节表现与多样画风。图像为原论文 Figure 1 的直接裁切。

原论文第 1 页 ↗

01 引言

PDF PAGES 2–3

Diffusion model 学习逆转数据走向随机噪声的前向路径;结合神经网络的逼近与泛化能力,它能够生成训练集中不存在、但服从训练数据分布的新样本。近年它已成为从自然语言生成高分辨率图像和视频的事实标准。与此同时,迭代式推理带来的计算成本和漫长采样时间,也推动了更高效训练与更少步采样形式的研究。

一旦指定了从数据到噪声的前向路径,训练可以很高效,但“选哪条路径”会直接影响采样。如果前向过程没有彻底消除数据中的信号,训练分布和推理分布就会错位,产生灰图等伪影。更重要的是,前向路径决定了模型要学习的反向路径:弯曲轨迹需要许多数值积分步,直线轨迹理论上可用更少步模拟,误差也不易逐步累积。每一步都意味着一次 neural network evaluation,因此轨迹形状会直接影响推理速度。

Rectified Flow 用直线连接数据与标准高斯噪声。此前它的优势主要在中小规模或 class-conditional 实验中得到验证。本文把 Rectified Flow 推向工业级文生图训练,并借鉴 noise-prediction diffusion model 的做法,对不同噪声尺度重新加权。

论文还指出,传统文生图模型把固定文本表示通过 cross-attention 单向送入图像网络,这并不理想。作者因此设计了分别可学习的 image stream 与 text stream,让两种 token 在网络内部双向交换信息;再把这套 MM-DiT 架构与改进的 Rectified Flow formulation 结合,系统研究它的 scaling behavior。

  1. 对 diffusion model 与 Rectified Flow 的不同 formulation 做大规模系统比较,并提出更好的 timestep sampler。
  2. 提出可扩展的 MM-DiT,使 text token 与 image token 在网络内部双向混合,并优于 UViT、DiT 等既有 backbone。
  3. 完成模型 scaling study,证明 validation loss 存在可预测趋势,并与 GenEval、T2I-CompBench 及人类偏好强相关。

02 Simulation-Free Flow 训练

PDF PAGES 2–3

作者考虑一类生成模型:用 ordinary differential equation(ODE)定义从噪声分布 p₁ 的样本 x₁ 到数据分布 p₀ 的样本 x₀ 的映射。速度场 vΘ 由神经网络参数 Θ 表示。

d yt = vΘ(yt, t) d t (1)

直接通过可微 ODE solver 求解式 (1) 对大型网络代价很高。更高效的办法,是直接回归一个能够生成 p₀p₁ 概率路径的 vector field ut。前向过程写作:

zt = atx0 + btε,   ε ∼ N(0, I) (2)

当边界满足 a₀=1, b₀=0, a₁=0, b₁=1 时,路径两端分别与数据分布和噪声分布一致。条件 vector field ut(z|ε) 可以生成条件概率路径;进一步对条件场按后验权重求期望,可得到生成边缘概率路径的 marginal vector field。

ut(z) = Eε∼N(0,I)[ut(z|ε) · pt(z|ε) / pt(z)] (6)

直接优化 Flow Matching objective 需要处理式 (6) 的 marginalization,实践中不可直接计算;Conditional Flow Matching(CFM)改为回归条件 vector field,目标可计算且具有相同最优解:

LCFM = Et,pₜ(z|ε),p(ε) ‖vΘ(z,t) − ut(z|ε)‖² (8)

通过代入前向映射及其逆映射,作者把 CFM 写成 noise-prediction objective。引入 log signal-to-noise ratio λt = log(a²t/b²t) 后,不同 diffusion / flow formulation 可以统一为一个带 timestep-dependent weight 的噪声回归目标。时间相关加权不改变理论最优解,但会改变 optimization trajectory,这正是后续系统比较各种 sampler 的基础。

精读提示:这里的“Simulation-Free”

不是推理时不用 ODE solver,而是训练时不需要先数值模拟完整 ODE 轨迹;随机采样 t、x₀、ε 就能直接构造监督目标。

03 Flow Trajectories

PDF PAGES 3–4

在统一形式下,论文比较 Rectified Flow、EDM、Cosine 与 LDM-Linear 四类路径或 loss weighting。它们的差异不只体现在“加多少噪声”,还体现在 network parameterization、log-SNR 分布与不同 timestep 获得的训练权重。

Rectified Flow
直接在数据与标准高斯噪声之间采用直线路径,网络输出速度
EDM
以 log-normal 噪声尺度构造前向过程,并使用 F-prediction 与相应 loss weighting。
Cosine
使用 cosine forward schedule,可与 ε-prediction 或 v-prediction 组合。
LDM-Linear
采用 DDPM schedule 的变体,是 Latent Diffusion / Stable Diffusion 常用基线。
zt = (1 − t)x0 + tε (13)

3.1 · 为 Rectified Flow 定制 SNR Sampler

经典 Rectified Flow 在 [0,1] 上均匀采样 timestep,并对所有位置均匀训练速度 vΘ。作者指出,中间 timestep 的目标 ε−x₀ 更难预测:在两个端点,最优预测分别接近噪声或数据分布的均值;中间区域却同时混合了两者。因此,训练预算不应机械地平均分配,而应更多覆盖中间区域。

Logit-Normal Sampling

第一种方案让 t 服从 logit-normal distribution。位置参数 m 控制训练偏向数据端(负值)还是噪声端(正值),尺度参数 s 控制分布宽度。实践中先采样 u∼N(m,s),再通过 logistic function 映射到 (0,1)

πln(t;m,s) = [s√(2π)t(1−t)]−1 exp(−(logit(t)−m)² / 2s²) (19)

Mode Sampling with Heavy Tails

Logit-normal 在端点 0 和 1 的密度必为零。为检验端点缺失是否有害,作者又构造了在整个区间上严格为正的 mode sampler;正 s 偏向中部,负 s 偏向两端,s=0 退化为 uniform sampling。

CosMap

第三种方案把 cosine schedule 的 log-SNR 映射到 Rectified Flow timestep,得到 πCosMap(t)=2/(π−2πt+2πt²)。后续 61 组实验将系统比较这些 sampler。

Figure 11Mode 与 Logit-Normal timestep 分布

左图为不同 scale 的 mode sampler,右图为不同 m、s 的 logit-normal sampler。论文最终发现 rf/lognorm(0,1) 的整体表现最好。

原论文第 22 页 ↗

04 文生图架构与 MM-DiT

PDF PAGES 4–5

模型沿用 LDM 的基本框架,在预训练 autoencoder 的 latent space 中训练文生图模型;图像先编码为 latent,文本条件则由冻结的 text encoder 提供。与 DiT 相同,timestep embedding 和 pooled text representation cvec 进入 modulation path;但 pooled representation 只保留粗粒度语义,因此网络还必须接收序列形式的 cctxt

图像 latent 被切成 2×2 patch,加入 2D positional encoding 后展平为 image token sequence;文本序列与图像序列被投影到同一 hidden dimension。关键变化是:作者不再用同一套 Transformer 参数处理全部 token,也不再只用 cross-attention 单向注入文本。

Figure 2SD3 / MM-DiT 完整模型架构

左侧展示 CLIP-L、CLIP-G、T5-XXL、timestep 与 noised latent 的输入路径;右侧展示一个 MM-DiT block。文本和图像拥有独立 LayerNorm、Q/K/V projection 与 MLP,只在 joint attention 中拼接序列。

原论文第 5 页 ↗

MM-DiT 为 text token 和 image token 使用两套独立权重。这可理解为两个并行 Transformer:两种表示分别在自己的 feature space 中完成 normalization、Q/K/V projection、output projection 与 MLP;只有 attention operation 把两种序列的 Q、K、V 连接起来计算,使任一模态都能关注另一模态。attention 结束后,输出重新拆回两条 stream。

Attention([Qx;Qc], [Kx;Kc], [Vx;Vc])

作者还比较了三套权重的变体:CLIP text、T5 text 与 image 各用一套权重。三套权重仅带来小幅增益,却增加参数量和 VRAM,因此余下实验使用两套权重的 MM-DiT。模型规模以 depth d 参数化:hidden size 为 64d,MLP 扩展到 4·64d,attention head 数也设为 d

避免一个常见误解

推理时的 image stream 不是“输入目标图片”,而是正在被去噪的 latent canvas:它从纯噪声开始,每一步由 MM-DiT 预测速度并更新。

05 实验

PDF PAGES 5–12

5.1 · 改进 Rectified Flow

为比较不同 simulation-free formulation,作者严格控制 optimizer、model architecture、dataset 与 sampler。由于不同方法的 loss 不可直接横向比较,评测使用 validation loss、CLIP score 与 FID,并同时评估训练权重和 EMA 权重。模型在 ImageNet 与 CC12M 上训练,指标统一在 COCO-2014 validation split 上计算。

论文共训练 61 种 formulation,覆盖 ε / v prediction 的 linear 与 cosine schedule、7 个 mode sampler、30 个 logit-normal sampler、CosMap、15 个 EDM 配置,以及匹配不同 log-SNR weighting 的 EDM 变体。每次运行再跨 6 套采样设置、EMA / 非 EMA 与两个 dataset 汇总,最终形成 24 个控制条件下的 Pareto non-dominated ranking。

Table 1不同 formulation 的全局排名

对 24 个控制条件进行 non-dominated sorting 后取平均;数值越低越好。rf/lognorm(0,1) 总排名 1.54。

原论文第 6 页 ↗
Variant全部设置5 steps50 steps
rf/lognorm(0.00, 1.00)1.541.251.50
rf/lognorm(1.00, 0.60)2.083.502.00
rf/lognorm(0.50, 0.60)2.718.501.00
rf/mode(1.29)2.753.253.00
rf/lognorm(0.50, 1.00)2.831.502.50
eps/linear2.884.252.75
rf/mode(1.75)3.332.752.75
rf/cosmap4.133.754.00
edm(0.00, 0.60)5.6313.253.25
rf5.676.505.75
v/linear6.835.757.75
edm(0.60, 1.20)9.0013.009.00
v/cos9.1712.258.75
edm/cos11.0414.2511.25
edm/rf13.0415.2513.25
edm(-1.20, 1.20)15.5820.2515.00
Table 2代表性 variant 的 CLIP 与 FID

25 sampling steps。粗体、下划线与斜体在原论文中分别标记前三名;这里以蓝色突出最佳值。

原论文第 6 页 ↗
VariantImageNetCC12M
CLIP ↑FID ↓CLIP ↑FID ↓
rf0.24749.700.21794.90
edm(-1.20, 1.20)0.23663.120.200116.60
eps/linear0.24548.420.22290.34
v/cos0.24450.740.20997.87
v/linear0.24651.680.217100.76
rf/lognorm(0.50, 0.60)0.25680.410.233120.84
rf/mode(1.75)0.25344.390.21894.06
rf/lognorm(1.00, 0.60)0.254114.260.234147.69
rf/lognorm(-0.50, 1.00)0.24845.640.21989.70
rf/lognorm(0.00, 1.00)0.25045.780.22489.91
Figure 3Rectified Flow 具有更高采样效率

当 sampling steps 较少时,Rectified Flow 整体优于其他 formulation;25 steps 以上,只有 rf/lognorm(0,1) 仍与 eps/linear 保持竞争力。

原论文第 7 页 ↗

结论不是“某个 sampler 在单一指标上偶然赢了一次”,而是 rf/lognorm(0,1) 在 dataset、指标、step 数与 EMA 设置变化时都保持稳定。所有比 LDM-Linear 更好的配置,都是改变了 timestep sampling 的 Rectified Flow。

5.2 · 改进模态专用表示

更强的 Autoencoder

Latent Diffusion 的最终图像质量受 autoencoder 重建上限约束。作者把 latent channel 从 4 提高到 8、16,重建指标显著改善;虽然更高维 latent 也要求更大的 diffusion backbone,但 scaling experiment 表明,当模型 depth 足够大时,16-channel 的优势能够兑现。

Table 3不同 latent channel 的重建性能

所有 autoencoder 的空间下采样倍数均为 8;16 channel 在四项指标上最好。

原论文第 7 页 ↗
Metric4 chn8 chn16 chn
FID ↓2.411.561.06
Perceptual Similarity ↓0.850.680.45
SSIM ↑0.750.790.86
PSNR ↑25.1226.4028.62
Figure 10不同 autoencoder latent 维度下的 scaling

16-channel latent 需要更高 model capacity;到 depth 22 时,它与 8-channel 的差距已很小,因此大模型最终选用 16-channel VAE。

原论文第 21 页 ↗

合成 Caption 与真实 Caption 50/50 混合

大规模图片数据自带的人类 caption 往往只描述主体,忽略背景、构图和画面文字。作者使用 CogVLM 生成细致 caption,并以 50% 原始、50% 合成的比例训练,以避免 VLM 不知道的概念被完全遗忘。

Table 4改进 Caption 后的 GenEval

50/50 caption mix 把 overall score 从 43.27 提高到 49.78,position、color attribution 与 counting 提升尤其明显。

原论文第 7 页 ↗
GenEval 子项原始 Caption50/50 Mix
Color Attribution11.7524.75
Colors71.5468.09
Position6.5018.00
Counting33.4441.56
Single Object95.0093.75
Two Objects41.4152.53
Overall43.2749.78

比较 DiT、CrossDiT、UViT 与 MM-DiT

Vanilla DiT 不如 UViT;加入 cross-attention 的 CrossDiT 优于两者;两套权重的 MM-DiT 又显著优于 cross-attention 和共享权重的 DiT。三套权重只带来很小增益,因此作者选择参数与显存更经济的两套权重版本。

Figure 4不同架构的训练动态

在 CC12M 上比较 validation loss、CLIP score 与 FID;两套和三套权重的 MM-DiT 整体最好。

原论文第 9 页 ↗

5.3 · 规模化训练

规模化前,训练数据经过 NSFW、低美学分和重复内容过滤;冻结的 VAE 与 text encoder 输出预先编码,避免每个训练 step 重复运行这些大型网络。最终模型从 depth 15 扩展到 depth 38(约 8B 参数),主 scaling study 在 256² 上训练 500k steps,global batch size 4096,最高训练计算量约 5×10²² FLOPs

QK-Normalization

从 256² 预训练切换到更高分辨率与 mixed precision 后,attention logit 可能失控增长,attention entropy 随之坍缩并导致 NaN。作者在两条 MM-DiT stream 的 Q、K 上加入带可学习 scale 的 RMSNorm,并把 AdamW ε 设为 10⁻¹⁵;这样无需把整个训练切回 full precision,就能稳定 bf16 训练。

Figure 5QK-Normalization 稳定高分辨率训练

未做 QK-Norm 时,最大 attention logit 不断增大、entropy 坍缩并出现 NaN;加入 QK-Norm 后两者保持稳定。

原论文第 9 页 ↗

可变宽高比与分辨率相关 Timestep Shift

模型按 H·W≈S² 建立 aspect-ratio bucket。2D positional grid 先按训练可能遇到的最大高宽延展,再针对当前 bucket 居中裁剪。更高分辨率包含更多像素,必须加入更多噪声才能达到与低分辨率相同的不确定度。由样本均值的标准误差可推得 timestep mapping:

tm = [√(m/n) · tn] / [1 + (√(m/n) − 1)tn] (23)

它等价于把 log-SNR 平移 log(n/m)。人类偏好实验显示 shift factor 大于 1.5 明显更好;后续 1024² 训练与采样统一采用 α=√(m/n)=3.0

Figure 6高分辨率下的 Timestep Shift

左上给出不同 shift factor 的映射;右上为人类 ELO 偏好;下方对比 α=1 与 α=3 的 512² 样本。

原论文第 10 页 ↗

Scaling 的定量结果

图像模型和视频模型都显示:model size 越大、training steps 越多,validation loss 越平滑地下降,且在研究范围内没有出现饱和。更关键的是,validation loss 与 GenEval、T2I-CompBench、人类图像偏好以及视频人类偏好都呈强负相关。

Figure 8Scaling 的定量影响

上排显示 image / video validation loss 随模型与算力下降;下排相关系数依次为 −0.920、−0.982、−0.898、−0.908,说明 validation loss 是整体质量的强预测信号。

原论文第 12 页 ↗
Figure 12Scaling 的定性影响

从左到右训练 50k、200k、350k、500k steps;从上到下 depth 15、30、38。训练更久与模型更大同时改善 prompt composition 和细节。

原论文第 22 页 ↗
Table 5GenEval 对比

最大 1024² depth-38 + DPO 模型 overall 0.74,高于 DALL-E 3 的 0.67;表中完整保留原论文各子项。

原论文第 11 页 ↗
ModelOverallSingleTwoCountingColorsPositionColor Attribution
minDALL-E0.230.730.110.120.370.020.01
SD v1.50.430.970.380.350.760.040.06
PixArt-α0.480.980.500.440.800.080.07
SD v2.10.500.980.510.440.850.070.17
DALL-E 20.520.940.660.490.770.100.19
SDXL0.550.980.740.390.850.150.23
SDXL Turbo0.551.000.720.490.800.100.18
IF-XL0.610.970.740.660.810.130.35
DALL-E 30.670.960.870.470.830.430.45
Ours d18 · 512²0.580.970.720.520.780.160.34
Ours d24 · 512²0.620.980.740.630.670.340.36
Ours d30 · 512²0.640.960.800.650.730.330.37
Ours d38 · 512²0.680.980.840.660.740.400.43
Ours d38 · 512² + DPO0.710.980.890.730.830.340.47
Ours d38 · 1024² + DPO0.740.990.940.720.890.330.60
Figure 7与当时 SOTA 文生图模型的人类偏好比较

8B 模型在 visual aesthetics、prompt following 与 typography 三个维度对比 PixArt-α、SDXL、SDXL-Turbo、Stable Cascade、Playground-v2.5、Ideogram-v1.0 与 DALL-E 3。

原论文第 10 页 ↗
Table 6模型规模对采样效率的影响

相对固定 seed 的 50-step CLIP score。更大模型在少步采样时性能下降更小,Rectified Flow path length 也更短。

原论文第 11 页 ↗
Model5 / 50 steps ↓10 / 50 steps ↓20 / 50 steps ↓Path length ↓
depth=154.30%0.86%0.21%191.13
depth=303.59%0.70%0.24%187.96
depth=382.71%0.14%0.08%185.96

可移除 T5

三个 text encoder 在训练中分别以 46.3% 概率独立 dropout,因此推理时可以只使用其中任意子集。去掉 4.7B 参数的 T5-XXL 能显著节省 VRAM,对多数普通 prompt 影响有限;但对长描述、复杂组合关系和需要正确拼写的文字生成,T5 仍然重要。

Figure 9T5 对复杂 Prompt 与文字生成的影响

普通 prompt 下移除 T5 仍有竞争力;包含大量细节或长文本拼写时,三种 text encoder 全部启用明显更可靠。

原论文第 12 页 ↗

06 结论

PDF PAGE 12

本文对文生图 Rectified Flow model 做了系统 scaling analysis,提出一种新的 timestep sampling 方案;它在 Latent Diffusion 上优于既有 diffusion training formulation,同时保留 Rectified Flow 在少步采样中的有利性质。

作者进一步证明,针对文本与图像多模态特性设计的 MM-DiT 优于传统 Transformer backbone。把改进后的 Rectified Flow、16-channel autoencoder、50/50 caption mix、MM-DiT、QK-Normalization 与 high-resolution timestep shift 组合后,模型被扩展到约 8B 参数和 5×10²² training FLOPs。

validation loss 的改善与自动 benchmark 和人类偏好均相关;整体系统达到可与当时 proprietary model 竞争的性能。研究范围内的 scaling trend 尚未显示饱和,作者据此判断继续扩大模型与训练计算仍可能进一步提升质量。

批判性结论

论文最扎实的贡献不是单独发明了一个花哨 block,而是把 sampler、architecture、data representation、high-resolution training 与 scaling signal 放在同一套可复现实验里验证。MM-DiT 是关键组件,但“61 组 formulation 对照 + validation loss 可预测下游质量”更具方法论价值。

Supplementary / 附录

PDF PAGES 17–28

原论文第 13–16 页为 References;Supplementary 从第 17 页开始。下面按 A–E 保留技术推导、额外样本、DPO、图像编辑与数据预处理实验。

A · 背景

Diffusion model 可以从 negative log-likelihood 的 variational lower bound 或 score matching 两条路线推导,由此产生大量 forward / reverse process、parameterization、loss weighting 与 ODE solver。尽管 EDM 等工作给出了更统一的理解,常见 probability-flow ODE 的轨迹仍可能显著弯曲,需要更多 solver steps。

Rectified Flow 与 continuous normalizing flow、diffusion model 关系紧密。相比 CNF,它训练时不需要模拟 ODE;相比标准 diffusion probability-flow ODE,它有机会学习更容易数值模拟的直线轨迹。但 Rectified Flow 并不自动得到 optimal transport,仍有多项工作尝试进一步降低曲率。本文关心的是:它能否成为少步文生图的可靠基础。

Transformer 在 NLP 与视觉任务中已展现 scaling property,但当时 diffusion model 主流仍是 U-Net;文生图 diffusion Transformer 的 scaling law 尚缺少系统研究。论文第 18–19 页给出更多 8B 模型样本,覆盖文字、空间组合与强风格化 prompt。

B · On Flow Matching

附录首先用 continuity equation 证明式 (6) 的 marginal vector field 会生成目标概率路径,并证明 LFMLCFM 仅相差一个与参数 Θ 无关的常数,因此二者对模型参数具有相同最优解。

∂pt(x)/∂t + ∇·[pt(x)vt(x)] = 0 (26)

图像表示方面,RGB 图像由预训练 autoencoder 以 8 倍空间下采样编码到 latent;所有前向加噪与 Flow Matching 都在 latent space 中完成,采样结束后再由 decoder 回到 pixel space。文本表示使用 CLIP-L/14、OpenCLIP bigG/14 与 T5-v1.1-XXL:两个 CLIP pooled output 拼成 2048 维 cvec;CLIP sequence 与 T5 sequence 对齐到 4096 维后,在 sequence axis 拼成 cctxt∈R154×4096

5.1 的实验统一用 global batch 1024、AdamW、learning rate 10⁻⁴、1000 warmup steps、mixed precision 与 decay 0.99 的 EMA。三个 text encoder 以 46.4% 概率独立清零,使约 10% step 成为 unconditional training。每个 sampler 生成 1000 张图,使用 Euler discretization,在 5/10/25/50 steps 与不同 classifier-free guidance scale 下评测。

C · Direct Preference Optimization

作者把文生图 DPO 应用于 2B 与 8B base model,没有全量 finetune,而是给所有 linear layer 加入 rank 128 的 LoRA。2B 与 8B 分别训练 4k 与 2k iterations,再用 PartiPrompts 的 128 条 caption 做人类偏好研究,每个 prompt / comparison 约 3 名评价者。

Figure 13Base model 与 DPO model 的样本对比

DPO 通常带来更美观的图像和更准确的拼写;图中同时比较 2B 与 8B。

原论文第 23 页 ↗
Figure 14DPO 的人类偏好结果

对 depth 24(2B)与 depth 38(8B),DPO 在 prompt following 与总体 quality 上都明显被偏好。

原论文第 24 页 ↗

D · 基于指令的图像编辑 Finetuning

常见 image-to-image diffusion model 会把输入图像 latent 与目标图像的 noised latent 沿 channel dimension 拼接,再送入 U-Net。作者在 patching 前同样拼接 input / target latent,并把 2B base model finetune 到类似 InstructPix2Pix 的编辑任务,以及 inpainting、segmentation、colorization、deblurring 和 ControlNet 类任务。

尽管训练数据没有专门包含“文字编辑”任务,得到的 2B Edit model 仍能对图片中的文字做 zero-shot 操作;作者在同一数据上训练 SDXL-based editing model 时未复现同等结果。

Figure 152B Edit model 的 Zero-shot 文字修改与插入

示例包括重写鸟牌、黑板文字、UNET→UNOT,以及在猫牌上加入“MMDIT RULES”。

原论文第 25 页 ↗

E · 大规模文生图的数据预处理

E.1 · 预计算 Image / Text Embedding

冻结的 autoencoder latent 与 text encoder representation 对每个样本都是常量,因此可以在训练前一次性预计算。优点是 encoder 无需驻留训练 GPU,且每个 step 省去 forward encoding;缺点是每个 epoch 无法重新做随机 augmentation,dense text embedding 还会带来显著存储与加载成本。语言模型 embedding 以 half precision 保存,实践中未观察到性能下降。

Table 7预计算冻结输入网络的关键开销

Mem 是 GPU 加载内存;FP 是 per-device batch 32 时每样本 forward 时间;Storage 是每样本存储量;Delta 是加入 2B MM-DiT 训练循环后 step 变慢比例。

原论文第 24 页 ↗
ModelMem [GB]FP [ms]Storage [kB]Delta [%]
VAE (Enc)0.142.4565.513.8
CLIP-L0.490.45121.32.6
CLIP-G2.782.77202.215.6
T519.0517.46630.798.3

E.2 · 防止 Image Memorization

训练集中的重复图片会显著提高逐字记忆与复现风险。作者以 SSCD embedding 做近重复检测,把数据聚成 16,000 个 cluster,并在 cluster 内用 FAISS range search 找到超过 similarity threshold 的重复项。不同阈值会移除约 25%–48% 数据,论文最终选择四个 threshold 运行完整过滤。

Figure 16不同 SSCD 阈值下的数据去重结果

左图是完整 dataset 的四种阈值移除比例,右图是在 1000 个随机 cluster 上的 threshold sweep。

原论文第 27 页 ↗

E.3 · 去重是否真的减少 Memorization

评估沿用两阶段 extraction attack:对已知 prompt 用不同随机 seed 大量生成,再通过 membership inference 找出可能记忆的样本。每张图片被切成 16 个互不重叠的 128×128 tile;distance 使用任意 tile pair 中最大的 L2 distance,以避免“相同灰背景”造成伪相似。作者对 350,000 个最高重复 prompt 各生成 500 个候选图。

当 clique size 取 10 时,baseline 检出 540 个可能记忆样本,SSCD=0.5 的数据训练后只剩 95 个,约降低 5 倍;其他 clique threshold 下也一致减少。

Figure 17SSCD 去重显著减少 Memorization

横轴是生成样本相似图中的 clique size,纵轴是 clique 数量;SSCD50 曲线在所有阈值上均显著低于 baseline。

原论文第 28 页 ↗

参考文献

PDF PAGES 13–16

学术参考文献的作者、标题、会议与 URL 保持原文,不做中文化改写,以便检索与引用。本页正文中的作者-年份标记与原论文一致;完整 bibliography 请查看 原论文第 13–16 页 ↗

中文译文与图表转录:LLM Wiki · 原始依据:Esser et al., ICML 2024, arXiv:2403.03206

原论文 Figure 1–17 均直接裁自本地 PDF;生成式 zine 图仅用于封面,不承担学术解释。