扩散Transformer(Diffusion Transformer,DiT)是把扩散模型中的去噪骨干网络从传统的卷积网络(UNet)替换为Transformer的一种生成架构。它于2023年前后被研究者提出,2024年起成为图像与视频生成领域的技术主流,新一代视频生成模型大多建立在这一架构之上。
为什么用Transformer
- 传统扩散模型用UNet做去噪,处理固定尺寸图像高效,但可扩展性和对全局关系的建模能力有限
- Transformer具有成熟的「扩展法则」:模型越大、数据越多,效果越稳定地变好,这让DiT具备「大力出奇迹」的潜力
- 图像被切成小块(Patch)当作「词元」输入,与文本标记一样走注意力机制,天然适合与文本、视频统一建模
- 文本到图像:新一代文生图模型纷纷以DiT为骨干,逐步替代Stable Diffusion系列的UNet路线
- 视频生成:以Sora为代表,视频生成模型直接以DiT为骨架,把视频帧统一建模,实现连贯的长视频生成
- 可控生成:DiT配合条件注入机制,可精细控制构图、运动、镜头等内容
- 计算量巨大,训练和推理成本高,推动了各类并行与加速方案的涌现
- 2026年,DiT已成为图像与视频生成的「默认底座」,研究重心转向更大规模的时序建模、多模态统一与推理加速。