编辑您感兴趣的内容:通过“最相似特征传播”方法实现高效视频编辑

《Pattern Recognition》:Edit-Your-Interest: Efficient video editing via Feature Most-Similar Propagation

【字体: 大 中 小 】 时间:2026年10月11日 来源:Pattern Recognition 9.1

编辑推荐:

   • 提出 Edit-Your-Interest,一个轻量级的零样本视频编辑框架。

  • •
    提出 Edit-Your-Interest,一个轻量级的零样本视频编辑框架。
  • •
    引入基于有界记忆的传播设计,以实现高效视频编辑。
  • •
    在固定的内存预算下维护一个具有代表性的时空特征记忆库。
  • •
    通过特征最相似传播查询内存,以实现基于相似性的特征检索。
  • •
    自动提取物体掩码并将其集成到去噪过程中。

引言

近年来,扩散模型在文本到图像(T2I)和文本到视频(T2V)生成方面取得了显著进展[1],其中一些著名的模型包括 DALL[E]、DiT[2] 和 Stable Diffusion[3]。在 T2V 生成中,文本驱动的视频编辑模型因其实用性而受到了广泛关注。
这些模型旨在根据源视频、源提示和目标提示生成与描述相符的编辑后的视频。生成的视频应保持源视频的结构一致性。当前的文本驱动视频编辑模型主要分为两大类:基于微调的方法[4] [5] 和零样本视频编辑方法[6]。基于微调的方法使用视频数据集或单个输入视频来调整预训练模型。
这些方法在模型开发或每个视频的适配过程中会产生训练成本。相比之下,零样本视频编辑模型提供了一种更高效的资源利用方式。因此,我们专注于文本驱动的零样本视频编辑,以在保持高质量编辑能力的同时最小化资源消耗。
现有的零样本视频编辑模型主要依赖文本提示来指导视频内容的编辑。一些方法[6] [7] 在反转和采样过程中整合了各种注意力图。然而,当应用于长视频序列时,这些方法存在显著的限制,因为存储全局注意力图会导致过高的内存消耗和计算开销。其他方法[8] [9] [10] 通过关键帧采样和滑动窗口策略来减少注意力图的存储需求。尽管这些方法有潜力,但由于特征平滑,它们通常生成的视频视觉保真度较低,表现为模糊和马赛克样伪影。为了实现轻量级且实用的视频编辑,并在低计算成本下保持高视觉保真度,我们提出了两个关键 idea:(1)将前一帧的特征缓存到特征记忆库中;(2)将这些缓存的特征传播到当前帧。
在本文中,我们提出了 Edit-Your-Interest,这是一个轻量级的零样本视频编辑框架,能够同时实现高效率和视觉质量。首先,我们引入了一个时空特征记忆库(SFM),在固定内存预算下缓存前一帧的空间注意力特征。SFM 保留了一个具有代表性的候选池,从而避免了全局时间注意力的高计算开销。其次,我们提出了基于特征最相似性的传播(FMP)作为对此特征记忆池的查询规则。SFM 和 FMP 共同构成了基于有界记忆的传播设计,以实现高效的零样本视频编辑。第三,我们设计了一个基于特征多样性的 SFM 更新算法,以保持记忆库在整个视频序列中的代表性和非冗余性。
此外,为了实现精确的物体级编辑,我们根据文本提示自动从交叉注意力图中提取感兴趣物体的掩码,并将其无缝集成到扩散去噪过程中。这种策略支持细粒度物体编辑,无需外部视频分割模型,同时能够稳健地保持背景完整性。
总之,我们的主要贡献如下:
  • •
    我们提出了 Edit-Your-Interest,一个轻量级的零样本视频编辑框架,能够在低计算开销下实现高质量编辑。
  • •
    我们引入了基于有界记忆的传播设计。SFM 在固定内存预算下维护一个具有代表性的候选池,FMP 通过基于相似性的检索来查询该池。
  • •
    我们设计了一个基于特征多样性的 SFM 更新算法,以保持记忆库在整个视频序列中的代表性和非冗余性。
  • •
    为了实现精确的物体编辑,我们自动从交叉注意力图中提取感兴趣物体的掩码,并将其无缝集成到扩散去噪过程中。
  • •
    我们的方法能够在拥有 24 GB 内存的 RTX 4090 GPU 上处理超过 100 帧的视频,证明了其实用效率和可扩展性。此外,我们的方法在不同视频上实现了先进的编辑性能,验证了其有效性和泛化能力。
本文的其余部分安排如下。第 2 节介绍相关工作。第 3 节详细介绍了我们提出的 Edit-Your-Interest。第 4 节描述了实验设置、比较结果、模块分析、消融研究和局限性。第 5 节提出了结论和未来方向。

章节片段

相关工作

与我们的方法最相关的研究领域包括文本驱动的图像生成和编辑、基于微调的文本驱动视频编辑以及基于零样本的文本驱动视频编辑。

方法

为了详细介绍我们提出的方法,第 3.1 节回顾了视频编辑涉及的初步知识。第 3.2 节介绍了我们提出的 Edit-Your-Interest 的整体架构。第 3.3 节介绍了 SFM 及其更新算法。第 3.4 节详细介绍了我们提出的 FMP 算法。最后,第 3.5 节描述了感兴趣物体的掩码的自动提取和注入策略。

实现细节

我们采用官方预训练权重的 Stable Diffusion v1.5 作为基准,并使用 CLIP[44] 作为文本编码器。为了获得初始噪声,我们使用 DDIM 反转 T=50 步,然后进行 DDIM 采样以实现去噪过程。无分类器引导的比例设置为 7.5,相似性阈值 λ 设置为 0.9,所有实验中的 SFM 长度都设置为 5。在拥有 24 GB 内存的 RTX 4090 上,我们的方法可以处理包含多达 100 帧的视频

结论

在本文中,我们提出了 Edit-Your-Interest,这是一个轻量级的零样本视频编辑框架,旨在解决视频编辑中的两个主要挑战:高计算开销和视觉模糊。为了减轻计算开销,我们构建了一个时空特征记忆库(SFM)来缓存前一帧的特征标记。我们进一步设计了一个基于特征多样性的更新算法来不断更新 SFM。为了减轻视觉模糊和马赛克样伪影

CRediT 作者贡献声明

左毅:写作 - 审稿与编辑、初稿撰写、可视化、验证、监督、软件、资源、方法论、调查、数据策划、概念化。 王梓涛:可视化、验证、监督、软件、资源。 李玲玲:资源、调查、资金获取、形式分析、概念化。 刘旭:资金获取、形式分析、数据策划。 刘芳:可视化、验证、监督。 焦立成:项目

利益冲突声明

作者声明他们没有已知的可能影响本文工作的竞争财务利益或个人关系。

致谢

本工作部分得到了以下机构的支持:国家自然科学基金联合资金(U22B2054)、国家自然科学基金(62076192、62276199、62431020、62276201 和 62476209)、111 计划、中国教育部的科技创新项目、国家人机混合增强重点实验室
左毅于 2022 年在中国西安电子科技大学获得经济学和管理学学士学位,目前他在该校人工智能学院攻读博士学位。他的研究兴趣包括视频处理、自然计算、机器学习和智能信息处理。
左毅 | 王梓涛 | 李玲玲 | 刘旭 | 刘芳 | 焦立成

订阅生物通快讯

订阅快讯:

最新文章

限时促销

会展信息

关注订阅号/掌握最新资讯

今日动态 | 人才市场 | 新技术专栏 | 中国科学人 | 云展台 | BioHot | 云讲堂直播 | 会展中心 | 特价专栏 | 技术快讯 | 免费试用

版权所有 生物通

Copyright© eBiotrade.com, All Rights Reserved

联系信箱:

粤ICP备09063491号