谷歌研究人员开发了一种名为 VLOGGER 的新型人工智能系统,可以从单个静态图像生成人们说话、手势和移动的逼真视频。该技术使用先进的机器学习模型来合成令人惊叹的真实镜头,扩大了其潜在应用范围,并引发了人们对深度造假和错误信息的担忧。
VLOGGER 将人的照片和音频剪辑作为输入,并输出显示人讲话的视频以及相应的面部表情、头部动作和手势以及音频。该视频并不完美,并且存在一些伪影,但它代表了静态图像动画制作能力的重大进步。
该人工智能模型利用一种称为扩散模型的机器学习模型,最近在从文本描述生成高度逼真的图像方面取得了显着的成果。通过将这些扩展到视频领域并在新的大规模数据集上对其进行训练,他们创建了一个能够以逼真的方式处理照片的人工智能系统。
VLOGGER 的潜在应用包括自动配音为其他语言、编辑和填充视频中缺失的帧以及从单张照片创建一个人的完整视频。还有人指出,它可能会被滥用,例如制造深度伪造品。 VLOGGER仍然有其局限性:它制作的视频相对较短,背景是静态的,并且人在3D环境中不会移动。然而,据报道,它在图像质量、身份保存和时间一致性方面优于其他最先进的技术。
【新闻评论】
谷歌研究人员开发的一种名为 VLOGGER 的新型人工智能系统可以从单个静态图像生成人们说话、手势和移动的逼真视频。该技术使用先进的机器学习模型,特别是扩散模型,来合成高度逼真的镜头。虽然这使得各种应用成为可能,但它也可能带来深度伪造和错误信息传播等问题。
VLOGGER 将一个人的照片和音频片段作为输入,并输出一个视频,其中显示该人的讲话、面部表情、头部动作和手势以及音频。与以前的方法相比,该技术的进步在于它不需要针对每个特定的人进行训练,不依赖于面部检测或裁剪,生成完整的图像(不仅仅是面部和嘴唇),并且考虑了各种各样的场景。
一个名为 MENTOR 的新大型数据集被用来开发这个人工智能模型。该数据集包含超过 800,000 个不同身份和超过 2,200 小时的视频,让您能够公正地了解一个人的不同种族、年龄、服装、姿势和环境。
VLOGGER 应用程序的示例包括自动配音视频、编辑和填充视频中缺失的帧以及从单张照片创建人物的完整视频。这使得演员能够授权自己的详细 3D 模型来生成新的表演、在虚拟现实和游戏中创建逼真的化身、开发人工智能驱动的虚拟助手和聊天机器人等等。
然而,这项技术也可能被滥用,包括创建深度伪造品。随着人工智能生成的视频变得更加真实、更容易制作,错误信息和数字伪造的问题可能会变得更加严重。
VLOGGER还不够完善,它制作的视频比较短,背景是静态的,人在3D环境中不会走动。角色的举止或言语也与现实完全没有区别。然而,据报道,它在图像质量、身份保存和时间一致性方面优于其他最先进的技术。
诸如此类的人工智能生成媒体的进步表明,我们将很难区分真实的人和计算机程序生成的人。 VLOGGER 有力地展示了人工智能的快速进步以及辨别真假所面临的日益严峻的挑战。
