生成一段短视频,AI 往往要把同一批画面位置反复计算许多轮,成本自然居高不下。Kaleido 的思路像整理连拍照片:相邻画面若高度相似,就不必每张都从头处理。它面向视频扩散 Transformer(vDiT)——一种从随机噪声逐轮“擦出”视频、并让不同时刻和位置互相参考的模型;论文测得,自注意力这种全局比较占模型总执行时间的 68%。
团队发现,视频在潜空间——压缩后的数字表示——中,不只相邻位置和时刻存在重复,不同通道也呈现可利用的相关性。Kaleido 先比较相邻 token(视频片段的数字单元)各通道的相似度,让相似通道复用先前的部分结果,从而最多减少 85% 的注意力计算。难点是,这会产生不规则的数据跳过模式,因此团队同时设计了可重配置计算单元和数据调度器,把相似任务重新归组,避免芯片空等。作者在四种 vDiT 上报告:相较现有专用加速器,最高提速 5.9 倍、节能 16 倍,但这些效果仍是论文自述。它的价值在于提供了一条不同于常规剪枝、量化的路径:先找到视频自身的重复结构,再让硬件真正吃到这份节省。