
只做一次生成器前向,就能得到一张图,这是一步生成追求的效率。但想把采样步数降到 1,难题其实在训练端:怎样用足够稳定、简单的监督信号,让生成分布靠近真实分布?
现有路线各有结构性取舍:
自回归、扩散和流匹配(Flow Matching)模型扩展性强,但前者需按顺序或尺度解码,后两者沿噪声 — 数据路径反复调用网络,都会增加推理时间。
生成对抗网络(GAN)天然支持单次前向推理,但学习信号来自同步训练的判别器,极小极大优化较敏感。
一致性模型(Consistency Models)和分布匹配蒸馏(Distribution Matching Distillation,DMD)可以压缩采样步数,但通常需要噪声 — 时间监督、一致性约束、教师或辅助估计器;DMD 同时依赖固定扩散教师与在线生成分布的 score(对数密度梯度),扩展到较大模型时还需要更多稳定化技巧。
Drifting Models 等分布动力学方法绕开传统蒸馏,但监督常来自批级分布场或统计量;若一个批次包含 个样本,批内全配对需要 次交互,同时还要求同一条件下提供多张真实样本,因而不天然适配“一条描述配一张图”的文生图数据。
这些路线各有优势,TBSM 并不是要简单否定它们。它把问题改写成了一句更直接的话:能不能训练一个小模型,直接告诉每个生成样本 “该往哪里走”?

论文标题:THREE-BODY SCATTERING FOR GENERATIVE MODELING
论文链接:https://arxiv.org/abs/2607.18198
项目主页与代码:https://github.com/sp12138/TBSM
具体来说,TBSM 在线训练一个轻量级 Tracker,学习从当前生成分布到真实分布(Fake-to-Real)的转移场。对每个生成样本,Tracker 都会独立地给出一个移动方向,生成器只需回归样本沿该方向移动后的位置。
面对约 800M 的像素扩散 Transformer 模型 PixelDiT-XL/16,单个 Tracker 仅有 30M 参数不到,且只在训练时使用。ImageNet-256 上,TBSM 的潜空间和像素空间模型在推理时前向次数(number of function evaluations,NFE)为 1 时,分别达到 Fréchet Inception Distance(FID,越低越好)1.63 和 2.23。
TBSM 方法介绍视频:三样本散射事件产生 Fake-to-Real 局部方向,Tracker 学习这些方向的期望,引导生成器最终实现 NFE=1。

TBSM 一步生成样例
从左到右依次为 MNIST、Fashion-MNIST、CIFAR-10、像素空间 ImageNet-1K,以及 20B 文生图模型的生成结果。
Fake-to-Real 转移场
(即 Tracker 的学习目标)从哪里来?
先说结论:Tracker 的学习目标不是教师给出的,而是由一个真实样本 和两个生成样本 、 当场算出来的(即一个三体散射事件)。 真实样本指出数据分布所在的方向,另一个生成样本补上生成分布内部的自交互,Tracker 再从大量即时观测中学习平均规律。
在给定某个生成条件 (例如一条提示词 Prompt)时,从噪声分布 独立抽取 和 。一次事件包含三个角色:由参数为 的生成器 产生、并保留梯度的生成投射体 ;从数据集中抽取一个与 配对的真实源 ;以及由另一份噪声产生并停止梯度的生成源 ,本文用 表示停止梯度。把瞬时散射方向记为 :
其中, 表示欧氏范数。第一项是朝真实源的单位方向,第二项带负号,因此会让投射体远离另一生成样本。两项分别对应能量距离中的真实 — 生成吸引与生成 — 生成自交互。
在有限一阶矩下,能量距离非负,且只在两分布一致时为零。在独立采样等条件下,瞬时散射方向的条件期望 ,就是总体转移场在 处给出的方向。含 个投射体的批次只需 次源交互,而非批内全配对的 (例如 Drifting Models);方向范数也不超过 2,且上界不随图像维度增长。这种接口天然适合 “一条描述配一张图” 的数据。
训练时把投射体 移动后的位置冻结为回归目标:

算法 1:基础三体散射回归
算法 1:三样本事件现场给出移动方向,即瞬时三体散射方向,生成器回归冻结后的目标位置。
不使用 Tracker 时,这就是瞬时散射(Instant Scattering)。严格来说,冻结回归在当前参数处的期望梯度与能量距离梯度一致,但单个即时方向只是该条件期望的一个带噪估计。使用 Tracker 的跟踪散射(Tracked Scattering)则把瞬时散射方向作为在线标签,学习更稳定的方向场。
Tracker 如何学习稳定的 Fake-to-Real 转移场?
单个三样本事件很便宜,但方差较大;换一组真实源和生成源,同一投射体可能收到不同方向。Tracker 学习的正是这些随机观测在给定位置和条件下的平均方向,而不是像 GAN 判别器那样判断真假。
完整 TBSM 使用两个取值在 0 到 1 之间的权重 。 混合即时方向与 Tracker 输出; 同时控制生成源自交互的权重和 Tracker 的查询区间。生成器与 Tracker 都用普通回归更新,不进行极小极大对抗训练。
算法 2:完整 TBSM 训练循环
算法 2:完整 TBSM 训练循环。图中, 是加权即时方向; 是从相应区间均匀抽取的连线位置比例, 表示均匀分布; 是 Tracker 查询点;参数为 的 Tracker 输出 ;最终方向为 。同一批事件分别更新生成器参数 和 Tracker 参数 。
在 时,Tracker 在投射体位置查询;在论文假设下,这对应精确能量距离场。若 ,查询点进入生成 — 真实样本之间的连线,学到的是实践中的代理场。ImageNet 最好的结果是采用 ,因此不能把这些指标视为 理论的直接验证。
两个参数组成的方法设计图
下图横轴为 Tracker 权重,纵轴为生成源自交互权重。四个角点把(1)瞬时能量距离散射、(2)完整跟踪的散射、(3)仅真实吸引和(4)Tracker仅学习 Fake-to-Real 插值放进同一张图中。

TBSM 的 rho-lambda 设计图
像素空间图像 Transformer JiT(Just image Transformers)的 B 规模配置 JiT-B 短程实验。Drift 是 Drifting Models 的图中简称;图中 Inception Score(IS)越高越好。四个角点依次对应类 Drift、Tracked Scattering、扩散相关和类 GAN 的结构联系。扩散式训练还需要配对噪声输入、时间条件和相应目标。
两个端点的 FID 为 4.71 和 5.05, 两个端点为 10.31 和 38.65,这说明 Tracker 汇总方向可能有帮助。另一个有趣现象是 (即完全没有生成—生成自交互项)时也得到很好的性能,下面展开分析这个 GAN-like 点。
算法 3:一个直观的视角去看 TBSM 能学到什么

算法 3:TBSM 的 “类 GAN” 位移类比
算法 3 是 状态下的简化展示:它同样用 在生成—真实连线上确定查询点,但让 Tracker 学习完整位移,而非算法 2 使用的单位方向。它揭示了 Tracker 最直观的作用:大量生成—真实样本对提供局部位移,Tracker 将这些观测汇总成一个从当前生成分布通向真实分布的 Flow Matching 转移场;生成器沿这个场更新后,新的生成分布又会产生下一轮转移场。算法 3 用于解释这一直觉,论文报告的实验仍使用算法 2。
从算法 3 和传统风格迁移的视角看,也可以把 Fake 和 Real 理解成两种不同的 “风格”:Tracker 学习二者之间的转移,再指导生成器产生新的 Fake;新的 Fake 又定义下一轮转移场,形成迭代循环。这提供了一种直观、与 GAN-like learned field 相近的理解视角。
从理论落到高维图像
像素欧氏距离未必对应图像语义距离,因此 TBSM 将散射搬到冻结的图像表征空间:真实图像、生成投射体和生成源经过冻结编码器后计算方向与损失,梯度只沿投射体分支回到生成器,源特征保持停止梯度。多个表征空间分别形成损失后再聚合。
像素生成器的输出可直接进入表征网络;潜空间生成器则先通过冻结解码器还原图像。训练结束后,Tracker 和额外表征分支都可移除,只保留生成器及潜空间模型原有的解码器。
单步的 ImageNet 与文生图结果
下表中的 FID 越低越好,Inception Score(IS)越高越好。所有 ImageNet 指标均由 50,000 张生成图像计算,并使用训练集参考统计量;TBSM 的训练和推理均不使用 CFG(Classifier-Free Guidance)。扩散 Transformer(DiT)先生成潜空间表示再解码,PixelDiT 和 JiT 则直接输出图像。

将原本为多步采样训练的 DiT-XL/4 直接限制为 NFE=1 时,FID 为 398.20;这只反映不适配的单步运行方式,不代表正常多步采样的质量。经过 TBSM 训练后,同一架构达到 1.92。
![]() | ![]() |
文生图实验从预训练的 20B 参数 Qwen-Image 初始化,随后只用 TBSM 更新生成器和 Tracker。

TBSM 后训练的20B参数文生图模型上的一步生成样例
20B参数模型在 、无 CFG、NFE=1 下生成 定性样例图像。
讨论与展望
TBSM 提供了一种无需在线教师的样本级分布匹配接口,可把成熟生成模型后训练为一步生成器。ImageNet 主实验使用且仅使用扩散或 Flow Matching 权重初始化,但进入 TBSM 阶段后不再查询教师;论文尚未验证 ImageNet 规模的随机初始化,而复用成熟的扩散生态本身也是一条实用、轻量的路线。另外,后续可探索从训练 逐步过渡到 ,或根据瞬时方向的噪声动态调节 。
结语
TBSM 的核心是从能量距离得到 “真实吸引 — 生成自交互” 的局部方向,再让 Tracker 学习其条件均值。训练完成后,辅助网络退出,生成器只需一次前向;它展示了把分布距离转化为高维生成器可直接学习的样本级运动监督的一条路径。
项目状态:目前已开放 MNIST 最小实现 和 ImageNet-1K 训练、评测代码;后续还计划发布 Qwen-Image-20B 文生图模型的权重和训练代码。
作者介绍:本文第一作者是西湖大学与浙江大学联合培养的三年级博士生孙鹏,研究兴趣是简单有效的生成式AI的训练与推理加速框架。未来希望能在世界模型和视频生成上继续找到合适的 合作者/Mentor 并做出更多有影响力的工作。

© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com

