ICML 2024 · 中文精校译本 · arXiv:2403.03206
缩放 Rectified Flow Transformer:高分辨率图像合成
Scaling Rectified Flow Transformers for High-Resolution Image Synthesis

MINIMAL ZINE COVER / FLOW MATCHING AS A STRAIGHTENED PATH / 2026
Flow Matching、Rectified Flow、Transformer、MM-DiT、attention、token、timestep、log-SNR 等术语保留英文;首次出现时给出中文解释。图像均直接裁自原论文,表格数据逐项转录。摘要
PDF PAGE 1Diffusion model 通过逆转“数据逐渐走向噪声”的前向路径,从噪声中生成数据,并已成为处理图像、视频等高维感知数据的强大生成建模方法。Rectified Flow 是一种较新的生成模型形式,它用直线连接数据与噪声。尽管这一形式在理论性质和概念简洁性上更有优势,却尚未决定性地成为标准实践。
本文改进了训练 Rectified Flow 时既有的噪声采样技术,使训练更偏向具有感知意义的噪声尺度。作者通过大规模研究证明,与成熟的 diffusion formulation 相比,这一做法在高分辨率文生图任务上表现更好。论文同时提出一种新的 Transformer 文生图架构:文本与图像两种模态使用彼此独立的权重,并允许信息在 image token 与 text token 之间双向流动,从而改善文本理解、文字生成和人类偏好评分。
实验表明,该架构呈现可预测的 scaling trend;更低的 validation loss 与多种自动指标及人类评测中更好的文生图性能相关。最大模型达到约 8B 参数并超过当时的 state-of-the-art 模型。作者承诺公开实验数据、代码与模型权重。
样本展示了 typography、精确 prompt following、空间关系、细节表现与多样画风。图像为原论文 Figure 1 的直接裁切。
原论文第 1 页 ↗01 引言
PDF PAGES 2–3Diffusion model 学习逆转数据走向随机噪声的前向路径;结合神经网络的逼近与泛化能力,它能够生成训练集中不存在、但服从训练数据分布的新样本。近年它已成为从自然语言生成高分辨率图像和视频的事实标准。与此同时,迭代式推理带来的计算成本和漫长采样时间,也推动了更高效训练与更少步采样形式的研究。
一旦指定了从数据到噪声的前向路径,训练可以很高效,但“选哪条路径”会直接影响采样。如果前向过程没有彻底消除数据中的信号,训练分布和推理分布就会错位,产生灰图等伪影。更重要的是,前向路径决定了模型要学习的反向路径:弯曲轨迹需要许多数值积分步,直线轨迹理论上可用更少步模拟,误差也不易逐步累积。每一步都意味着一次 neural network evaluation,因此轨迹形状会直接影响推理速度。
Rectified Flow 用直线连接数据与标准高斯噪声。此前它的优势主要在中小规模或 class-conditional 实验中得到验证。本文把 Rectified Flow 推向工业级文生图训练,并借鉴 noise-prediction diffusion model 的做法,对不同噪声尺度重新加权。
论文还指出,传统文生图模型把固定文本表示通过 cross-attention 单向送入图像网络,这并不理想。作者因此设计了分别可学习的 image stream 与 text stream,让两种 token 在网络内部双向交换信息;再把这套 MM-DiT 架构与改进的 Rectified Flow formulation 结合,系统研究它的 scaling behavior。
- 对 diffusion model 与 Rectified Flow 的不同 formulation 做大规模系统比较,并提出更好的 timestep sampler。
- 提出可扩展的 MM-DiT,使 text token 与 image token 在网络内部双向混合,并优于 UViT、DiT 等既有 backbone。
- 完成模型 scaling study,证明 validation loss 存在可预测趋势,并与 GenEval、T2I-CompBench 及人类偏好强相关。
02 Simulation-Free Flow 训练
PDF PAGES 2–3作者考虑一类生成模型:用 ordinary differential equation(ODE)定义从噪声分布 p₁ 的样本 x₁ 到数据分布 p₀ 的样本 x₀ 的映射。速度场 vΘ 由神经网络参数 Θ 表示。
直接通过可微 ODE solver 求解式 (1) 对大型网络代价很高。更高效的办法,是直接回归一个能够生成 p₀ 到 p₁ 概率路径的 vector field ut。前向过程写作:
当边界满足 a₀=1, b₀=0, a₁=0, b₁=1 时,路径两端分别与数据分布和噪声分布一致。条件 vector field ut(z|ε) 可以生成条件概率路径;进一步对条件场按后验权重求期望,可得到生成边缘概率路径的 marginal vector field。
直接优化 Flow Matching objective 需要处理式 (6) 的 marginalization,实践中不可直接计算;Conditional Flow Matching(CFM)改为回归条件 vector field,目标可计算且具有相同最优解:
通过代入前向映射及其逆映射,作者把 CFM 写成 noise-prediction objective。引入 log signal-to-noise ratio λt = log(a²t/b²t) 后,不同 diffusion / flow formulation 可以统一为一个带 timestep-dependent weight 的噪声回归目标。时间相关加权不改变理论最优解,但会改变 optimization trajectory,这正是后续系统比较各种 sampler 的基础。
不是推理时不用 ODE solver,而是训练时不需要先数值模拟完整 ODE 轨迹;随机采样 t、x₀、ε 就能直接构造监督目标。
03 Flow Trajectories
PDF PAGES 3–4在统一形式下,论文比较 Rectified Flow、EDM、Cosine 与 LDM-Linear 四类路径或 loss weighting。它们的差异不只体现在“加多少噪声”,还体现在 network parameterization、log-SNR 分布与不同 timestep 获得的训练权重。
- Rectified Flow
- 直接在数据与标准高斯噪声之间采用直线路径,网络输出速度
vΘ。 - EDM
- 以 log-normal 噪声尺度构造前向过程,并使用 F-prediction 与相应 loss weighting。
- Cosine
- 使用 cosine forward schedule,可与 ε-prediction 或 v-prediction 组合。
- LDM-Linear
- 采用 DDPM schedule 的变体,是 Latent Diffusion / Stable Diffusion 常用基线。
3.1 · 为 Rectified Flow 定制 SNR Sampler
经典 Rectified Flow 在 [0,1] 上均匀采样 timestep,并对所有位置均匀训练速度 vΘ。作者指出,中间 timestep 的目标 ε−x₀ 更难预测:在两个端点,最优预测分别接近噪声或数据分布的均值;中间区域却同时混合了两者。因此,训练预算不应机械地平均分配,而应更多覆盖中间区域。
Logit-Normal Sampling
第一种方案让 t 服从 logit-normal distribution。位置参数 m 控制训练偏向数据端(负值)还是噪声端(正值),尺度参数 s 控制分布宽度。实践中先采样 u∼N(m,s),再通过 logistic function 映射到 (0,1)。
Mode Sampling with Heavy Tails
Logit-normal 在端点 0 和 1 的密度必为零。为检验端点缺失是否有害,作者又构造了在整个区间上严格为正的 mode sampler;正 s 偏向中部,负 s 偏向两端,s=0 退化为 uniform sampling。
CosMap
第三种方案把 cosine schedule 的 log-SNR 映射到 Rectified Flow timestep,得到 πCosMap(t)=2/(π−2πt+2πt²)。后续 61 组实验将系统比较这些 sampler。
左图为不同 scale 的 mode sampler,右图为不同 m、s 的 logit-normal sampler。论文最终发现 rf/lognorm(0,1) 的整体表现最好。
原论文第 22 页 ↗04 文生图架构与 MM-DiT
PDF PAGES 4–5模型沿用 LDM 的基本框架,在预训练 autoencoder 的 latent space 中训练文生图模型;图像先编码为 latent,文本条件则由冻结的 text encoder 提供。与 DiT 相同,timestep embedding 和 pooled text representation cvec 进入 modulation path;但 pooled representation 只保留粗粒度语义,因此网络还必须接收序列形式的 cctxt。
图像 latent 被切成 2×2 patch,加入 2D positional encoding 后展平为 image token sequence;文本序列与图像序列被投影到同一 hidden dimension。关键变化是:作者不再用同一套 Transformer 参数处理全部 token,也不再只用 cross-attention 单向注入文本。
左侧展示 CLIP-L、CLIP-G、T5-XXL、timestep 与 noised latent 的输入路径;右侧展示一个 MM-DiT block。文本和图像拥有独立 LayerNorm、Q/K/V projection 与 MLP,只在 joint attention 中拼接序列。
原论文第 5 页 ↗MM-DiT 为 text token 和 image token 使用两套独立权重。这可理解为两个并行 Transformer:两种表示分别在自己的 feature space 中完成 normalization、Q/K/V projection、output projection 与 MLP;只有 attention operation 把两种序列的 Q、K、V 连接起来计算,使任一模态都能关注另一模态。attention 结束后,输出重新拆回两条 stream。
作者还比较了三套权重的变体:CLIP text、T5 text 与 image 各用一套权重。三套权重仅带来小幅增益,却增加参数量和 VRAM,因此余下实验使用两套权重的 MM-DiT。模型规模以 depth d 参数化:hidden size 为 64d,MLP 扩展到 4·64d,attention head 数也设为 d。
推理时的 image stream 不是“输入目标图片”,而是正在被去噪的 latent canvas:它从纯噪声开始,每一步由 MM-DiT 预测速度并更新。
05 实验
PDF PAGES 5–125.1 · 改进 Rectified Flow
为比较不同 simulation-free formulation,作者严格控制 optimizer、model architecture、dataset 与 sampler。由于不同方法的 loss 不可直接横向比较,评测使用 validation loss、CLIP score 与 FID,并同时评估训练权重和 EMA 权重。模型在 ImageNet 与 CC12M 上训练,指标统一在 COCO-2014 validation split 上计算。
论文共训练 61 种 formulation,覆盖 ε / v prediction 的 linear 与 cosine schedule、7 个 mode sampler、30 个 logit-normal sampler、CosMap、15 个 EDM 配置,以及匹配不同 log-SNR weighting 的 EDM 变体。每次运行再跨 6 套采样设置、EMA / 非 EMA 与两个 dataset 汇总,最终形成 24 个控制条件下的 Pareto non-dominated ranking。
对 24 个控制条件进行 non-dominated sorting 后取平均;数值越低越好。rf/lognorm(0,1) 总排名 1.54。
原论文第 6 页 ↗| Variant | 全部设置 | 5 steps | 50 steps |
|---|---|---|---|
| rf/lognorm(0.00, 1.00) | 1.54 | 1.25 | 1.50 |
| rf/lognorm(1.00, 0.60) | 2.08 | 3.50 | 2.00 |
| rf/lognorm(0.50, 0.60) | 2.71 | 8.50 | 1.00 |
| rf/mode(1.29) | 2.75 | 3.25 | 3.00 |
| rf/lognorm(0.50, 1.00) | 2.83 | 1.50 | 2.50 |
| eps/linear | 2.88 | 4.25 | 2.75 |
| rf/mode(1.75) | 3.33 | 2.75 | 2.75 |
| rf/cosmap | 4.13 | 3.75 | 4.00 |
| edm(0.00, 0.60) | 5.63 | 13.25 | 3.25 |
| rf | 5.67 | 6.50 | 5.75 |
| v/linear | 6.83 | 5.75 | 7.75 |
| edm(0.60, 1.20) | 9.00 | 13.00 | 9.00 |
| v/cos | 9.17 | 12.25 | 8.75 |
| edm/cos | 11.04 | 14.25 | 11.25 |
| edm/rf | 13.04 | 15.25 | 13.25 |
| edm(-1.20, 1.20) | 15.58 | 20.25 | 15.00 |
25 sampling steps。粗体、下划线与斜体在原论文中分别标记前三名;这里以蓝色突出最佳值。
原论文第 6 页 ↗| Variant | ImageNet | CC12M | ||
|---|---|---|---|---|
| CLIP ↑ | FID ↓ | CLIP ↑ | FID ↓ | |
| rf | 0.247 | 49.70 | 0.217 | 94.90 |
| edm(-1.20, 1.20) | 0.236 | 63.12 | 0.200 | 116.60 |
| eps/linear | 0.245 | 48.42 | 0.222 | 90.34 |
| v/cos | 0.244 | 50.74 | 0.209 | 97.87 |
| v/linear | 0.246 | 51.68 | 0.217 | 100.76 |
| rf/lognorm(0.50, 0.60) | 0.256 | 80.41 | 0.233 | 120.84 |
| rf/mode(1.75) | 0.253 | 44.39 | 0.218 | 94.06 |
| rf/lognorm(1.00, 0.60) | 0.254 | 114.26 | 0.234 | 147.69 |
| rf/lognorm(-0.50, 1.00) | 0.248 | 45.64 | 0.219 | 89.70 |
| rf/lognorm(0.00, 1.00) | 0.250 | 45.78 | 0.224 | 89.91 |
当 sampling steps 较少时,Rectified Flow 整体优于其他 formulation;25 steps 以上,只有 rf/lognorm(0,1) 仍与 eps/linear 保持竞争力。
原论文第 7 页 ↗结论不是“某个 sampler 在单一指标上偶然赢了一次”,而是 rf/lognorm(0,1) 在 dataset、指标、step 数与 EMA 设置变化时都保持稳定。所有比 LDM-Linear 更好的配置,都是改变了 timestep sampling 的 Rectified Flow。
5.2 · 改进模态专用表示
更强的 Autoencoder
Latent Diffusion 的最终图像质量受 autoencoder 重建上限约束。作者把 latent channel 从 4 提高到 8、16,重建指标显著改善;虽然更高维 latent 也要求更大的 diffusion backbone,但 scaling experiment 表明,当模型 depth 足够大时,16-channel 的优势能够兑现。
所有 autoencoder 的空间下采样倍数均为 8;16 channel 在四项指标上最好。
原论文第 7 页 ↗| Metric | 4 chn | 8 chn | 16 chn |
|---|---|---|---|
| FID ↓ | 2.41 | 1.56 | 1.06 |
| Perceptual Similarity ↓ | 0.85 | 0.68 | 0.45 |
| SSIM ↑ | 0.75 | 0.79 | 0.86 |
| PSNR ↑ | 25.12 | 26.40 | 28.62 |
16-channel latent 需要更高 model capacity;到 depth 22 时,它与 8-channel 的差距已很小,因此大模型最终选用 16-channel VAE。
原论文第 21 页 ↗合成 Caption 与真实 Caption 50/50 混合
大规模图片数据自带的人类 caption 往往只描述主体,忽略背景、构图和画面文字。作者使用 CogVLM 生成细致 caption,并以 50% 原始、50% 合成的比例训练,以避免 VLM 不知道的概念被完全遗忘。
50/50 caption mix 把 overall score 从 43.27 提高到 49.78,position、color attribution 与 counting 提升尤其明显。
原论文第 7 页 ↗| GenEval 子项 | 原始 Caption | 50/50 Mix |
|---|---|---|
| Color Attribution | 11.75 | 24.75 |
| Colors | 71.54 | 68.09 |
| Position | 6.50 | 18.00 |
| Counting | 33.44 | 41.56 |
| Single Object | 95.00 | 93.75 |
| Two Objects | 41.41 | 52.53 |
| Overall | 43.27 | 49.78 |
比较 DiT、CrossDiT、UViT 与 MM-DiT
Vanilla DiT 不如 UViT;加入 cross-attention 的 CrossDiT 优于两者;两套权重的 MM-DiT 又显著优于 cross-attention 和共享权重的 DiT。三套权重只带来很小增益,因此作者选择参数与显存更经济的两套权重版本。
在 CC12M 上比较 validation loss、CLIP score 与 FID;两套和三套权重的 MM-DiT 整体最好。
原论文第 9 页 ↗5.3 · 规模化训练
规模化前,训练数据经过 NSFW、低美学分和重复内容过滤;冻结的 VAE 与 text encoder 输出预先编码,避免每个训练 step 重复运行这些大型网络。最终模型从 depth 15 扩展到 depth 38(约 8B 参数),主 scaling study 在 256² 上训练 500k steps,global batch size 4096,最高训练计算量约 5×10²² FLOPs。
QK-Normalization
从 256² 预训练切换到更高分辨率与 mixed precision 后,attention logit 可能失控增长,attention entropy 随之坍缩并导致 NaN。作者在两条 MM-DiT stream 的 Q、K 上加入带可学习 scale 的 RMSNorm,并把 AdamW ε 设为 10⁻¹⁵;这样无需把整个训练切回 full precision,就能稳定 bf16 训练。
未做 QK-Norm 时,最大 attention logit 不断增大、entropy 坍缩并出现 NaN;加入 QK-Norm 后两者保持稳定。
原论文第 9 页 ↗可变宽高比与分辨率相关 Timestep Shift
模型按 H·W≈S² 建立 aspect-ratio bucket。2D positional grid 先按训练可能遇到的最大高宽延展,再针对当前 bucket 居中裁剪。更高分辨率包含更多像素,必须加入更多噪声才能达到与低分辨率相同的不确定度。由样本均值的标准误差可推得 timestep mapping:
它等价于把 log-SNR 平移 log(n/m)。人类偏好实验显示 shift factor 大于 1.5 明显更好;后续 1024² 训练与采样统一采用 α=√(m/n)=3.0。
左上给出不同 shift factor 的映射;右上为人类 ELO 偏好;下方对比 α=1 与 α=3 的 512² 样本。
原论文第 10 页 ↗Scaling 的定量结果
图像模型和视频模型都显示:model size 越大、training steps 越多,validation loss 越平滑地下降,且在研究范围内没有出现饱和。更关键的是,validation loss 与 GenEval、T2I-CompBench、人类图像偏好以及视频人类偏好都呈强负相关。
上排显示 image / video validation loss 随模型与算力下降;下排相关系数依次为 −0.920、−0.982、−0.898、−0.908,说明 validation loss 是整体质量的强预测信号。
原论文第 12 页 ↗从左到右训练 50k、200k、350k、500k steps;从上到下 depth 15、30、38。训练更久与模型更大同时改善 prompt composition 和细节。
原论文第 22 页 ↗最大 1024² depth-38 + DPO 模型 overall 0.74,高于 DALL-E 3 的 0.67;表中完整保留原论文各子项。
原论文第 11 页 ↗| Model | Overall | Single | Two | Counting | Colors | Position | Color Attribution |
|---|---|---|---|---|---|---|---|
| minDALL-E | 0.23 | 0.73 | 0.11 | 0.12 | 0.37 | 0.02 | 0.01 |
| SD v1.5 | 0.43 | 0.97 | 0.38 | 0.35 | 0.76 | 0.04 | 0.06 |
| PixArt-α | 0.48 | 0.98 | 0.50 | 0.44 | 0.80 | 0.08 | 0.07 |
| SD v2.1 | 0.50 | 0.98 | 0.51 | 0.44 | 0.85 | 0.07 | 0.17 |
| DALL-E 2 | 0.52 | 0.94 | 0.66 | 0.49 | 0.77 | 0.10 | 0.19 |
| SDXL | 0.55 | 0.98 | 0.74 | 0.39 | 0.85 | 0.15 | 0.23 |
| SDXL Turbo | 0.55 | 1.00 | 0.72 | 0.49 | 0.80 | 0.10 | 0.18 |
| IF-XL | 0.61 | 0.97 | 0.74 | 0.66 | 0.81 | 0.13 | 0.35 |
| DALL-E 3 | 0.67 | 0.96 | 0.87 | 0.47 | 0.83 | 0.43 | 0.45 |
| Ours d18 · 512² | 0.58 | 0.97 | 0.72 | 0.52 | 0.78 | 0.16 | 0.34 |
| Ours d24 · 512² | 0.62 | 0.98 | 0.74 | 0.63 | 0.67 | 0.34 | 0.36 |
| Ours d30 · 512² | 0.64 | 0.96 | 0.80 | 0.65 | 0.73 | 0.33 | 0.37 |
| Ours d38 · 512² | 0.68 | 0.98 | 0.84 | 0.66 | 0.74 | 0.40 | 0.43 |
| Ours d38 · 512² + DPO | 0.71 | 0.98 | 0.89 | 0.73 | 0.83 | 0.34 | 0.47 |
| Ours d38 · 1024² + DPO | 0.74 | 0.99 | 0.94 | 0.72 | 0.89 | 0.33 | 0.60 |
8B 模型在 visual aesthetics、prompt following 与 typography 三个维度对比 PixArt-α、SDXL、SDXL-Turbo、Stable Cascade、Playground-v2.5、Ideogram-v1.0 与 DALL-E 3。
原论文第 10 页 ↗相对固定 seed 的 50-step CLIP score。更大模型在少步采样时性能下降更小,Rectified Flow path length 也更短。
原论文第 11 页 ↗| Model | 5 / 50 steps ↓ | 10 / 50 steps ↓ | 20 / 50 steps ↓ | Path length ↓ |
|---|---|---|---|---|
| depth=15 | 4.30% | 0.86% | 0.21% | 191.13 |
| depth=30 | 3.59% | 0.70% | 0.24% | 187.96 |
| depth=38 | 2.71% | 0.14% | 0.08% | 185.96 |
可移除 T5
三个 text encoder 在训练中分别以 46.3% 概率独立 dropout,因此推理时可以只使用其中任意子集。去掉 4.7B 参数的 T5-XXL 能显著节省 VRAM,对多数普通 prompt 影响有限;但对长描述、复杂组合关系和需要正确拼写的文字生成,T5 仍然重要。
普通 prompt 下移除 T5 仍有竞争力;包含大量细节或长文本拼写时,三种 text encoder 全部启用明显更可靠。
原论文第 12 页 ↗06 结论
PDF PAGE 12本文对文生图 Rectified Flow model 做了系统 scaling analysis,提出一种新的 timestep sampling 方案;它在 Latent Diffusion 上优于既有 diffusion training formulation,同时保留 Rectified Flow 在少步采样中的有利性质。
作者进一步证明,针对文本与图像多模态特性设计的 MM-DiT 优于传统 Transformer backbone。把改进后的 Rectified Flow、16-channel autoencoder、50/50 caption mix、MM-DiT、QK-Normalization 与 high-resolution timestep shift 组合后,模型被扩展到约 8B 参数和 5×10²² training FLOPs。
validation loss 的改善与自动 benchmark 和人类偏好均相关;整体系统达到可与当时 proprietary model 竞争的性能。研究范围内的 scaling trend 尚未显示饱和,作者据此判断继续扩大模型与训练计算仍可能进一步提升质量。
论文最扎实的贡献不是单独发明了一个花哨 block,而是把 sampler、architecture、data representation、high-resolution training 与 scaling signal 放在同一套可复现实验里验证。MM-DiT 是关键组件,但“61 组 formulation 对照 + validation loss 可预测下游质量”更具方法论价值。
Supplementary / 附录
PDF PAGES 17–28原论文第 13–16 页为 References;Supplementary 从第 17 页开始。下面按 A–E 保留技术推导、额外样本、DPO、图像编辑与数据预处理实验。
A · 背景
Diffusion model 可以从 negative log-likelihood 的 variational lower bound 或 score matching 两条路线推导,由此产生大量 forward / reverse process、parameterization、loss weighting 与 ODE solver。尽管 EDM 等工作给出了更统一的理解,常见 probability-flow ODE 的轨迹仍可能显著弯曲,需要更多 solver steps。
Rectified Flow 与 continuous normalizing flow、diffusion model 关系紧密。相比 CNF,它训练时不需要模拟 ODE;相比标准 diffusion probability-flow ODE,它有机会学习更容易数值模拟的直线轨迹。但 Rectified Flow 并不自动得到 optimal transport,仍有多项工作尝试进一步降低曲率。本文关心的是:它能否成为少步文生图的可靠基础。
Transformer 在 NLP 与视觉任务中已展现 scaling property,但当时 diffusion model 主流仍是 U-Net;文生图 diffusion Transformer 的 scaling law 尚缺少系统研究。论文第 18–19 页给出更多 8B 模型样本,覆盖文字、空间组合与强风格化 prompt。
B · On Flow Matching
附录首先用 continuity equation 证明式 (6) 的 marginal vector field 会生成目标概率路径,并证明 LFM 与 LCFM 仅相差一个与参数 Θ 无关的常数,因此二者对模型参数具有相同最优解。
图像表示方面,RGB 图像由预训练 autoencoder 以 8 倍空间下采样编码到 latent;所有前向加噪与 Flow Matching 都在 latent space 中完成,采样结束后再由 decoder 回到 pixel space。文本表示使用 CLIP-L/14、OpenCLIP bigG/14 与 T5-v1.1-XXL:两个 CLIP pooled output 拼成 2048 维 cvec;CLIP sequence 与 T5 sequence 对齐到 4096 维后,在 sequence axis 拼成 cctxt∈R154×4096。
5.1 的实验统一用 global batch 1024、AdamW、learning rate 10⁻⁴、1000 warmup steps、mixed precision 与 decay 0.99 的 EMA。三个 text encoder 以 46.4% 概率独立清零,使约 10% step 成为 unconditional training。每个 sampler 生成 1000 张图,使用 Euler discretization,在 5/10/25/50 steps 与不同 classifier-free guidance scale 下评测。
C · Direct Preference Optimization
作者把文生图 DPO 应用于 2B 与 8B base model,没有全量 finetune,而是给所有 linear layer 加入 rank 128 的 LoRA。2B 与 8B 分别训练 4k 与 2k iterations,再用 PartiPrompts 的 128 条 caption 做人类偏好研究,每个 prompt / comparison 约 3 名评价者。
DPO 通常带来更美观的图像和更准确的拼写;图中同时比较 2B 与 8B。
原论文第 23 页 ↗对 depth 24(2B)与 depth 38(8B),DPO 在 prompt following 与总体 quality 上都明显被偏好。
原论文第 24 页 ↗D · 基于指令的图像编辑 Finetuning
常见 image-to-image diffusion model 会把输入图像 latent 与目标图像的 noised latent 沿 channel dimension 拼接,再送入 U-Net。作者在 patching 前同样拼接 input / target latent,并把 2B base model finetune 到类似 InstructPix2Pix 的编辑任务,以及 inpainting、segmentation、colorization、deblurring 和 ControlNet 类任务。
尽管训练数据没有专门包含“文字编辑”任务,得到的 2B Edit model 仍能对图片中的文字做 zero-shot 操作;作者在同一数据上训练 SDXL-based editing model 时未复现同等结果。
示例包括重写鸟牌、黑板文字、UNET→UNOT,以及在猫牌上加入“MMDIT RULES”。
原论文第 25 页 ↗E · 大规模文生图的数据预处理
E.1 · 预计算 Image / Text Embedding
冻结的 autoencoder latent 与 text encoder representation 对每个样本都是常量,因此可以在训练前一次性预计算。优点是 encoder 无需驻留训练 GPU,且每个 step 省去 forward encoding;缺点是每个 epoch 无法重新做随机 augmentation,dense text embedding 还会带来显著存储与加载成本。语言模型 embedding 以 half precision 保存,实践中未观察到性能下降。
Mem 是 GPU 加载内存;FP 是 per-device batch 32 时每样本 forward 时间;Storage 是每样本存储量;Delta 是加入 2B MM-DiT 训练循环后 step 变慢比例。
原论文第 24 页 ↗| Model | Mem [GB] | FP [ms] | Storage [kB] | Delta [%] |
|---|---|---|---|---|
| VAE (Enc) | 0.14 | 2.45 | 65.5 | 13.8 |
| CLIP-L | 0.49 | 0.45 | 121.3 | 2.6 |
| CLIP-G | 2.78 | 2.77 | 202.2 | 15.6 |
| T5 | 19.05 | 17.46 | 630.7 | 98.3 |
E.2 · 防止 Image Memorization
训练集中的重复图片会显著提高逐字记忆与复现风险。作者以 SSCD embedding 做近重复检测,把数据聚成 16,000 个 cluster,并在 cluster 内用 FAISS range search 找到超过 similarity threshold 的重复项。不同阈值会移除约 25%–48% 数据,论文最终选择四个 threshold 运行完整过滤。
左图是完整 dataset 的四种阈值移除比例,右图是在 1000 个随机 cluster 上的 threshold sweep。
原论文第 27 页 ↗E.3 · 去重是否真的减少 Memorization
评估沿用两阶段 extraction attack:对已知 prompt 用不同随机 seed 大量生成,再通过 membership inference 找出可能记忆的样本。每张图片被切成 16 个互不重叠的 128×128 tile;distance 使用任意 tile pair 中最大的 L2 distance,以避免“相同灰背景”造成伪相似。作者对 350,000 个最高重复 prompt 各生成 500 个候选图。
当 clique size 取 10 时,baseline 检出 540 个可能记忆样本,SSCD=0.5 的数据训练后只剩 95 个,约降低 5 倍;其他 clique threshold 下也一致减少。
横轴是生成样本相似图中的 clique size,纵轴是 clique 数量;SSCD50 曲线在所有阈值上均显著低于 baseline。
原论文第 28 页 ↗参考文献
PDF PAGES 13–16学术参考文献的作者、标题、会议与 URL 保持原文,不做中文化改写,以便检索与引用。本页正文中的作者-年份标记与原论文一致;完整 bibliography 请查看 原论文第 13–16 页 ↗。