“VOID”,Netflix 的一种人工智能,可以让物体出现在视频中,就好像它们从未存在过一样——这是一项重写物理定律的新技术

2026 年 4 月 3 日,Netflix 宣布推出“VOID”(视频对象和交互删除),这是一种从视频中删除对象的 AI 模型。

VOID是一种VLM(视觉语言模型),不仅可以删除对象,还可以自动生成视频,显示删除后剩余对象的物理一致行为。这六位开发者分别是 Saman Motamed(Netflix/索非亚大学)、William Harvey、Benjamin Klein、Zhuoning Yuan、Ta Ying Chen(均为 Netflix)和 Luc van Goel(索非亚大学)。

该论文可在 arXiv 上作为预印本获取,该模型可在 Hugging Face 上公开获取。在25人的对比评测中,VOID在64.8%的情况下被选中,远超亚军Runway的18.4%。比较包括 Runway、Generative Omnimatte、DiffuEraser、ROSE、MiniMax-Remover 和 ProPainter。

从: Netflix – 是的 Netflix – 通过视频编辑器搭上了人工智能的潮流

【编辑部评论】

VOID 与现有视频编辑工具的不同之处在于它“对物理定律的理解”。传统的对象删除工具擅长“填充”删除的区域,进行视觉校正,例如校正阴影和反射。但 VOID 回答了一个更基本的问题。“如果那个物体从一开始就不存在,世界会是什么样子?”想想这种差异在视频制作领域意味着什么。

让我们先讨论一下技术细节。 VOID 并不是 Netflix 从头开始​​构建的模型。其基础是CogVideoX,这是阿里巴巴开发的视频传播模型。谷歌的“Gemini”分析场景中的影响范围死亡,Meta 的“SAM2”分段对象以进行删除我会。 Netflix 的贡献结合了这些现有的强大组件使用考虑到物理交互的独特训练数据和称为“quad mask”的四值掩模技术进行精确微调位于 The Register 的一篇文章将 VOID 描述为“VLM(视觉语言模型)”,但更准确地说,VLM 是管道(Gemini,处理场景分析)的一部分,其核心是视频扩散模型。

训练数据的生成方式也值得注意。 Netflix 和保加利亚索非亚 INSAIT(计算机科学、人工智能和技术研究所)的团队使用了 Blender、HUMOTO(模拟人与物体物理交互的数据集)和 Google 的 Kubric。人工生成“删除对象的反事实视频对”我正在做。由于仅使用真人数据不可能在移除前后创建正确的图像,因此在模拟环境中自行创建训练数据的方法作为基于视频的 AI 的未来训练策略具有很强的启发性。

积极利用的潜力是广泛的。这项技术预计将有娱乐以外的应用,例如大幅降低电影和电视剧的后期制作剪辑成本、自动去除进入拍摄地点的不必要物体(电线、广告牌、摄制组的影子等)、体育广播和纪录片的视频校正,以及在康复医学和教育领域生成“排除特定刺激的视频材料”。

另一方面,风险的轮廓也很清晰。让篡改物理一致的视频变得更容易将大大增加虚假视频的“说​​服力”。虽然传统的深度假货经常因不自然的行为或物理不一致而被发现,但像 VOID 这样的技术如果被滥用,可能会从根本上破坏人们对法医证据和新闻片段的信任。此外,该模型已在 Apache 2.0 许可下向公众发布,包括商业用途,并且使用范围将迅速扩大。

此外,25人的评估样本量在统计上也相当小。该论文仍处于预印本阶段(尚未通过同行评审),可重复性还有待独立第三方验证。 “业界最佳表现”的说法必须被视为作者的自我评价。

从监管角度来看,欧盟人工智能法案已经包含了视频操纵技术的透明度义务,并且正在朝着要求对生成和篡改的视频添加水印的方向发展。 VOID很可能会加速这场争论,而在日本,确保图像真实性的系统设计将受到质疑。

从长远来看,VOID是一项挑战“图像是现实记录”这一前提的技术。当事后重写已经拍摄的镜头的能力变得普遍时,视频内容的制作成本将会降低,表达的自由度将会增加,但我们将被迫重新考虑视频作为媒介的证据和见证能力。 Netflix决定将这一模型开源,可以被解读为一种旨在加速研究并在社会中实施的战略,但其风险管理的性质仍然存在整个行业应密切关注的问题。

【术语解释】

VLM(视觉语言模型)
能够理解和处理文本和图像/视频的人工智能模型的总称。在 VOID 管道中,Gemini 作为 VLM,负责识别视频中的“删除影响范围”。

视频扩散模型
一种从随机噪声中逐步生成图像的人工智能模型。 VOID的核心采用了阿里巴巴的CogVideoX,通过quad mask控制生成方向。

在绘画中
以自然方式补充和再现部分图像和视频的技术。此前,修正仅限于视觉层面,而VOID实现了考虑物理因果关系的修正。

四重掩模
VOID独特的4值掩模技术。视频的每个区域被识别为四个阶段:“删除目标”、“重叠区域”、“受影响区域”和“保留区域”,并详细指导扩散模型的生成范围和行为。

阿帕奇2.0许可证
开源软件的典型许可证之一。只要明确说明版权声明和免责声明,就可以进行商业使用、修改和重新分发。 VOID 是根据该许可证发布的,可供广泛的公司和个人使用。

I AI法(I AI Act)
欧盟制定的人工智能监管法。已经根据人工智能系统的风险级别制定了义务,并且讨论正在朝着要求视频操纵技术的透明度和水印的方向发展。

库布里奇
由 Google 开发的开源数据生成管道。物理引擎可用于生成 3D 场景的合成图像,VOID 的一些训练数据就是使用它创建的。

胡莫托
使用 Blender 的物理模拟再现人类与物体之间交互的 3D 数据集。它与 Kubric 一起用于生成 VOID 的训练数据,并用于学习人触摸或举起物体的情况下的因果关系。

[参考链接]

VOID官方演示网站(外部)
官方项目页面总结了 VOID 演示视频、比较滑块和论文信息。实际运行结果可以目视确认。

VOID — GitHub(Netflix 官方存储库)(外部)
源代码、训练、推理过程和四元掩模生成管道都是公开的。 Apache 2.0 许可证可用于商业用途。

VOID — 拥抱脸(模特公共页面)(外部)
提供模型权重和演示应用程序。运行需要具有 40GB 或更多 VRAM(例如 A100)的 GPU。

VOID 论文(arXiv 预印本)(外部)
由 6 位作者撰写的技术论文。描述了方法、训练数据和评估实验的结果。请注意,这是尚未经过同行评审的预印本。

跑道(外部)
专门从事视频生成和编辑的人工智能平台。该商业工具在本次对比评测中排名第二(18.4%),仅次于VOID。

抱脸(外部)
人工智能模型和数据集的共享平台。包括 VOID 在内的许多开源模型已经发布,使其成为研究和开发的中心枢纽。

专业画家(外部)
领先的视频修复开源模型。在再现物理交互方面与 VOID 不同的比较目标。

扩散橡皮擦(外部)
使用扩散模型的视频对象去除工具。论文中将其作为与VOID进行对比评价的课题之一出现。

生成全遮罩(外部)
一种开源视频编辑方法,可同时处理视频中的前景物体及其阴影、反射等。与 VOID 的比较目标之一。

MiniMax-去除剂(外部)
用于从视频中删除对象的 AI 工具。论文中将其作为与VOID进行对比评价的课题之一出现。

[参考文章]

Netflix 开源 VOID,这是一个人工智能框架,可以擦除视频对象并重写它们留下的物理原理(外部)
VOID技术栈的详细信息。明确规定了 CogVideoX、Gemini 和 SAM2 的作用以及与 INSAIT 索非亚大学的联合研究。

Netflix AI 团队刚刚开源了 VOID:一种可以从视频中删除对象的 AI 模型 - 物理和所有(外部)
它用一个具体的例子以简单的方式解释了物理因果关系的建模:“如果你删除拿着吉他的人,吉他就会掉落。”

Netflix 发布 VOID 视频修复模型(外部)
简单总结了对比评价(VOID:64.8%,Runway:18.4%,样本量25人)以及论文处于预印本阶段的事实。

[编者后记]

“图像是现实的记录”这一前提正在悄然开始动摇。当像VOID这样的技术变得普遍时,我们将如何感知图像?

甚至在决定某件事是否是假的之前,“相信你所看到的”的感觉可能正在发生变化。大家感觉怎么样?如果您与亲近的人交谈,您可能会看到不同的观点。