将Transformer用于扩散模型,AI 生成视频达到照片级真实感

W.A.L.T成功将Transformer架构整合到了隐视频扩散模型中,生成的视频质量高、连贯、无伪影,能将视频和图像映射到一个统一的低维隐空间中,显著降低了生成高分辨率视频的计算成本;并设计了一种新的Transformer块,其自注意力层能在非重叠、窗口限制的空间和时空注意力之间交替。

上一篇:

下一篇:

发表回复

登录后才能评论