基于光流增强分数蒸馏的免训练视频编辑

《Pattern Recognition》:Training-free video editing via optical flow-enhanced score distillation

【字体: 大 中 小 】 时间:2026年10月11日 来源:Pattern Recognition 9.1

编辑推荐:

   提出一种基于分数蒸馏的范式,用于文本驱动的训练自由视频编辑。提出光流引导的梯度细化,以提高局部时间连续性。引入辅助损失以抑制过度编辑并增强全局一致性。实验展示了在保持性、一致性和文本对齐方面的性能。引言视频编辑作为一种交互式且可控的生成任务,一直受到人工智能生成内容(AIGC



提出一种基于分数蒸馏的范式,用于文本驱动的训练自由视频编辑。提出光流引导的梯度细化,以提高局部时间连续性。引入辅助损失以抑制过度编辑并增强全局一致性。实验展示了在保持性、一致性和文本对齐方面的性能。引言视频编辑作为一种交互式且可控的生成任务,一直受到人工智能生成内容(AIGC)社区的广泛关注。这些技术能够实现视觉内容的修改以满足特定期望,并在摄影、电影制作和艺术创作等领域有广泛应用。近年来,文本到图像(T2I)和文本到视频(T2V)扩散模型的激增显著推进了下游应用的发展,包括图像生成[1]、图像编辑[2]、视频增强[3]、[4]、[5]、视频编辑[6],以及视频生成在某些垂直领域的应用,例如自动驾驶场景的数据生成[7]、[8]。基于这些预训练模型,当前研究主要分为两类:零样本方法和单样本方法。单样本方法[9]、[10]微调预训练模型以学习原始视频内容和运动模式,通过在推理阶段通过目标提示引导来实现视频内容编辑。相比之下,零样本方法[11]、[12]通常利用反演相关方法[13]、[14]、[15]来保留原始视频信息,通过在推理过程中操纵U-Net的中间特征和注意力计算,实现无需额外训练的视频编辑。这些方法的共同之处在于,它们都依赖于扩散模型的推理过程从初始噪声开始,逐步恢复编辑后的视频——一种被称为基于噪声的编辑视频生成的范式。尽管利用了反演相关技术来保留原始视频信息,但这些方法本质上会导致原始输入结构的退化。此外,推理过程中累积的不确定性加剧了这种效应,导致非编辑区域干扰、时间不连续性和内容不一致等问题。因此,主流零样本流水线的核心限制不仅在于反演本身的使用,还在于其依赖于从噪声到视频的完整去噪轨迹,在此过程中错误会不断累积,直到获得编辑结果。一个直观的解决方案是设计一种鲁棒的更新范式,通过预测更新梯度来直接优化原始视频(或原始视频潜在编码)中的目标区域,同时保持非编辑区域不变。受文本到3D工作的启发[16],分数蒸馏采样(SDS)是一种广泛采用的方法,它利用预训练的文本到图像模型为初始化的3D表示提供更新引导,最终实现3D生成。此外,一个类似的概念——Delta去噪分数(DDS)[17]——也已被证明在图像编辑中有效。这些方法直接利用预训练模型提供的更新梯度来优化初始表示的参数以实现编辑。对于视频编辑,这暗示了一种不同的范式:与其从噪声重新生成编辑后的视频,我们可以将源视频潜在编码视为优化变量,并使用文本条件分数蒸馏信号来更新它。然而,将这种范式直接应用于视频编辑存在显著挑战。实证研究表明,编辑后的视频往往表现出过度编辑和明显伪影,与原始视频相比,运动连续性和内容一致性有所下降。因此,我们的目标是改进更广泛的分数蒸馏范式以用于训练自由视频编辑,而不是仅仅呈现图像DDS到视频的逐帧移植。方法学挑战在于如何将嘈杂的单步T2V分数预测转化为尊重视频特定时间和语义结构的稳定编辑更新。我们认为,挑战源于T2V扩散模型的弱泛化能力和鲁棒性问题,导致计算出的更新梯度不稳定。此外,这种范式基于预训练扩散模型的单步噪声预测来计算更新梯度,这本质上加剧了该问题。图2经验证了这一假设,表明ModelscopeT2V和Zeroscope等T2V扩散模型在大时间步长中,用于视频更新梯度的单步预测噪声存在显著误差,与StableDiffusion-v1.5相比。在优化过程中,这些更新梯度中的偏差逐渐累积,最终导致编辑后视频中出现严重伪影。为解决上述挑战,本研究引入了一种光流增强的内容与一致性保持分数蒸馏方法,旨在整合更鲁棒的更新梯度和视频先验。所提出的框架定位为分数蒸馏的视频特定增强:它保留了DDS风格编辑的直接潜在优化优势,同时明确根据视频运动、内容保持和语义一致性先验来校正和正则化更新梯度。具体而言,我们从两个角度提出了一种改进的分数蒸馏策略:编辑梯度优化和辅助损失。通过在中间编辑视频和原始视频之间引入梯度自适应内容保持辅助损失,我们抑制过度编辑并确保非编辑区域的保持。通过选择编辑视频中的锚帧并约束其他帧与锚帧高级语义特征之间的一致性辅助损失,我们增强了编辑结果视频的全局一致性。考虑到视频中连续帧之间的相关性,相邻帧的编辑梯度也应该表现出这种关系。因此,我们利用视频的光流预测对相邻帧的编辑梯度执行基于光流预测的平滑操作,减轻局部时间序列中的梯度突变,增强帧间连续性。与相同空间位置的简单时间平滑不同,此细化过程在融合前将相邻帧梯度变换到运动对应的位置,使分数蒸馏更新既具有运动感知能力又具有局部一致性。最终,通过全面利用梯度优化和辅助损失两个角度的局部和全局信息,我们提出的视频编辑方法有效地解决了上述零样本视频编辑任务面临的主要挑战。在文本引导的真实视频编辑任务上进行的全面实验证实了我们所提出方法的有效性,与替代方法相比取得了更优越的结果(图1)。总之,我们的贡献是:我们将训练自由视频编辑表述为分数蒸馏范式下的直接潜在优化,并明确将我们的工作定位为对基于分数蒸馏的视频编辑的改进,而非图像DDS的直接应用。我们进一步识别了原始T2V分数蒸馏梯度的不稳定性是该范式的关键障碍。为了解决基于分数蒸馏的视频编辑中过度编辑和缺乏全局一致性的问题,我们在迭代优化过程中引入了内容保持损失和全局语义一致性损失作为辅助损失。我们根据视频光流预测对相邻帧的更新梯度执行平滑操作,相邻帧梯度在运动对应位置融合,抑制编辑梯度的不稳定波动并增强局部时间连续性。真实视频编辑实验表明,我们的方法在编辑视频与目标文本提示的对齐度、编辑视频的连续性和一致性、以及原始视频非编辑区域的保持等多个维度上达到与现有方法相当或更优的性能。文本到视频生成。早期关于条件视频生成的工作利用了变分自编码器[18]、生成对抗网络[19]、[20]或自回归Transformer[21]、[22]等框架,这些框架在小型特定领域数据集上进行训练。尽管取得了令人满意的结果,但这些方法难以推广到训练数据集以外的场景。最近,人们做出了大量努力,将扩散模型在文本到图像生成中的成功扩展到文本条件潜在视频扩散模型。我们利用预训练的文本条件潜在视频扩散模型[41]、[42]为视频编辑提供引导。这些模型基于具有编码器E(·)和解码器D(·)的自编码器,在潜在空间中执行前向噪声添加和反向去噪操作。我们将由N帧组成的视频序列表示为X?={x??,…,x??}。在训练阶段,潜在输入Z?={z??,…,z??}=E(X?)通过前向扩散过程被扰动为Z?={z??,…,z??}:Z?=√??Z?+√(1-??)……。方法论。我们在4.1节介绍整体任务流程,在4.2节提出基于光流预测的编辑梯度校正策略,在4.3节提出内容保持辅助损失和全局语义一致性辅助损失。实验。我们在5.1节介绍实验设置,在5.2节展示我们方法与基线方法的视觉对比。在5.3节,我们描述定量指标的定义并报告我们方法与基线方法之间的定量对比结果。在5.4节,我们进行消融研究以验证每个提出模块的有效性,既有定性也有定量分析。在5.5节,我们验证我们方法的兼容性。结论与局限。本工作证明了分数蒸馏范式,先前在图像编辑和3D生成中探索过,可以成功迁移并大幅改进以应用于具有挑战性的零样本视频编辑任务。我们的迭代潜在优化框架提供了一种根本不同的视角:将编辑视为直接的……(原文截断)CRediT作者贡献声明。梁翰朱:写作-审阅与编辑,写作-初稿,可视化,概念化。包艳琪:写作-审阅与编辑,可视化,验证。霍靖:写作-审阅与编辑,资源,形式分析。吴靖:可视化,验证,调查,概念化。赖宇坤:形式分析,数据管理,概念化。李文彬:写作-审阅与编辑,监督,概念化。高洋:写作-审阅与编辑,监督,利益冲突声明。作者声明,他们没有已知的竞争财务利益或个人关系,这些可能影响本文所报告的工作。梁翰朱|包艳琪|霍靖|吴靖|赖宇坤|李文彬|高洋

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号