新闻
ICML 2026|美图提出BridgeRemoval,让视频消除不再穿帮
1 分钟阅读
来源:zhidx.com
智东西 作者 | ZeR0 编辑 | 漠影 消除照片中的路人、杂物,现在已经是节假日出片的“必备神器”,AI消除的能力逐步从图片拓展到视频,但既要补全单帧内容,还要确保单帧内空间连贯性和帧间时序一致性,使得视频目标移除的难度明显上升。 目前主流的方法是基于扩散模型“从噪声到数据”的生成范式,即以无信息的高斯噪声为起点逐步重建,这一过程丢弃了源视频中大量有效的结构与场景先验,在面对大范围遮挡或需要生成复杂物理逻辑的内容时,往往导致物体消除不彻底,或生成与场景相悖的内容,因此一般通过引入参考帧引导机制进行解决,但该机制显著增加了系统复杂性。 对此,美图影像研究院(MT Lab)提出基于随机桥模型的新框架——BridgeRemoval,首次将“视频目标移除”定义为“视频到视频的翻译任务”,通过构建基于随机桥(VP-SDE Bridge)的直接生成路径,更好地平衡背景保真度与生成灵活性,显著提升视频目标移除精准度与画面内容时空逻辑一致性。该成果近期已被机器学习领域三大顶级会议之一的ICML 2026(International Conference on Machine Learning)录用。 论文链接:https://arxiv.org/pdf/2601.12066 项目主页:https://bridgeremoval.github.io/ BridgeRemoval的架构是将源视频输入通过冻结的VAE编码器投射至隐空间,基于VP-SDE Bridge 构建一条直接从源视频先验(z_src)到干净目标(z_tgt)的插值轨迹,再通过拼接掩码隐变量(z_M)与源视频隐变量(z_src