谷歌的 Lumiere 在视频生成 AI 领域开辟了新天地

【消化】

谷歌宣布推出新一代视频人工智能模型“Lumiere”。该模型使用一种名为 Space-Time-U-Net (STUNet) 的新扩散模型,该模型同时知道视频中的对象在何处(在空间中)以及它们如何移动和变化(在时间上)。 Lumiere 根据提示创建一个基本框架,使用 STUNet 框架推断该框架内的对象将移动的位置,并创建相互流动的框架以创建无缝移动的外观。 Lumiere 生成 80 帧,这比稳定视频扩散生成的 25 帧要多。

谷歌发布了预览视频和科学论文预印本,展示了其人工智能视频生成和编辑工具如何在短短几年内从恐怖谷发展到接近现实的水平。此外,虽然谷歌在文本转视频领域还不是大玩家,但它已经逐渐发布了更先进的人工智能模型,并专注于更多样化的模式。其Gemini大语言模型最终将为Bard带来图像生成。尽管Lumiere尚未发布测试,但与Runway和Pika等公开的AI视频生成器相比,它显示了谷歌开发AI视频平台的能力。

除了文本到视频生成之外,Lumiere 还支持图像到视频生成、风格化生成以创建特定风格的视频、电影图片以仅对视频的一部分进行动画处理,以及修复以遮盖视频区域并更改颜色或图案。然而,谷歌关于 Lumiere 的论文指出,存在滥用该技术来创建虚假或有害内容的风险,开发和应用工具来检测偏见和恶意用例对于确保安全和公平使用至关重要。

【新闻评论】

谷歌宣布推出新一代视频人工智能模型“Lumiere”。该技术使用 Space-Time-U-Net (STUNet),这是一种新的扩散模型,可以了解视频中对象的位置(空间)以及它们如何移动和变化(时间)。 Lumiere 根据提示创建基本帧,然后使用 STUNet 框架推断对象将移动的位置并生成无缝运动的视频帧。这使得创建比传统人工智能视频生成工具更逼真的运动视频成为可能。

这一技术演变表明,人工智能视频生成和编辑工具已经跨越了恐怖谷,并在几年内达到了接近现实的水平。除了文本到视频生成之外,Lumiere 还提供多种功能,包括图像到视频生成、以特定风格创建视频的风格化生成、仅对视频的一部分进行动画处理的电影图片,以及遮盖视频特定区域并更改颜色和图案的修复。

然而,这项技术的发展也伴随着潜在的风险。人们尤其担心它可能被滥用来生成虚假或有害内容。因此,谷歌关于 Lumiere 的论文指出,开发和应用工具来检测偏见和恶意用例对于确保安全和公平使用至关重要。

这项技术进步有可能彻底改变视频制作领域。例如,电影和游戏的CG制作预计将变得更加真实和高效。它还将使在教育和培训视频的制作中创建真实的模拟和演示变得更加容易。但同时,也需要应对假新闻产生、侵犯隐私等社会问题。

支持该技术健康发展和使用的努力非常重要,例如制定法规和指南、确保技术透明度和教育用户。未来,基于人工智能的视频生成技术将进一步发展,我们可能会达到生成与现实无法区分的图像的时代。在这种情况下,一个重大挑战将是如何平衡技术进步与社会责任。

谷歌的 Lumiere 让人工智能视频更接近真实而不是虚幻.