🎬

扩散Transformer(DiT)

Diffusion Transformer
技术原理
扩散模型视频生成

扩散Transformer(Diffusion Transformer,DiT)是把扩散模型中的去噪骨干网络从传统的卷积网络(UNet)替换为Transformer的一种生成架构。它于2023年前后被研究者提出,2024年起成为图像与视频生成领域的技术主流,新一代视频生成模型大多建立在这一架构之上。

为什么用Transformer

  • 传统扩散模型用UNet做去噪,处理固定尺寸图像高效,但可扩展性和对全局关系的建模能力有限
  • Transformer具有成熟的「扩展法则」:模型越大、数据越多,效果越稳定地变好,这让DiT具备「大力出奇迹」的潜力
  • 图像被切成小块(Patch)当作「词元」输入,与文本标记一样走注意力机制,天然适合与文本、视频统一建模
代表应用
  • 文本到图像:新一代文生图模型纷纷以DiT为骨干,逐步替代Stable Diffusion系列的UNet路线
  • 视频生成:以Sora为代表,视频生成模型直接以DiT为骨架,把视频帧统一建模,实现连贯的长视频生成
  • 可控生成:DiT配合条件注入机制,可精细控制构图、运动、镜头等内容
挑战与趋势
  • 计算量巨大,训练和推理成本高,推动了各类并行与加速方案的涌现
  • 2026年,DiT已成为图像与视频生成的「默认底座」,研究重心转向更大规模的时序建模、多模态统一与推理加速。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

0