W.A.L.T成功将Transformer架构整合到了隐视频扩散模型中,生成的视频质量高、连贯、无伪影,能将视频和图像映射到一个统一的低维隐空间中,显著降低了生成高分辨率视频的计算成本;并设计了一种新的Transformer块,其自注意力层能在非重叠、窗口限制的空间和时空注意力之间交替。
W.A.L.T成功将Transformer架构整合到了隐视频扩散模型中,生成的视频质量高、连贯、无伪影,能将视频和图像映射到一个统一的低维隐空间中,显著降低了生成高分辨率视频的计算成本;并设计了一种新的Transformer块,其自注意力层能在非重叠、窗口限制的空间和时空注意力之间交替。