2024年12月17日,谷歌宣布推出AI图像生成工具“Whisk”。Whisk 的独特功能是您可以使用图像而不是文本作为提示。用户根据主题、场景、风格三要素提供图像,AI生成新图像。
Whisk 使用最新的 Imagen 3 模型。谷歌 AI 研究员 Douglas Eck 表示,与之前的版本相比,Imagen 3 显着提高了图像生成的质量。
与此同时,谷歌正在推出视频生成AI「我看到2了」还宣布。据称,与 OpenAI 的 Sora 等其他模型相比,Veo 2 能够理解视频制作专业知识,并且生成多余手指等伪像的频率较低。
Veo 2 最初将在 Google 的 VideoFX 上提供。 VideoFX 目前正在接受 Google 实验室候补名单上的申请。它将于 2025 年推广到 YouTube Shorts 和其他 Google 产品。
这些公告发布之际,来自 OpenAI、Meta 和 Anthropic 等其他人工智能公司的竞争日益激烈。根据市场研究公司 Statista 的数据,生成式人工智能的全球市场规模预计到 2024 年将达到约 320 亿美元,到 2030 年将增长到 1260 亿美元。
从:谷歌的 Whisk AI 生成器将“重新混合”你插入的图片
【编辑部评论】
谷歌宣布推出一款名为 Whisk 的新型人工智能图像生成工具,这是提高人工智能创造力和易用性的重要一步。创新之处在于可以使用图像作为提示,而不是传统的基于文本的提示。
打蛋器特点:您可以指定图像中的三个元素:主题、场景和风格。就是这样。这使得用户能够直观地表达他们的想法。例如,您可以使用自己的照片作为主题,未来派风景作为场景,并指定动漫风格来创作全新的作品。
在技术方面,Whisk 将 Google 最新的图像生成模型 Imagen 3 与语言模型 Gemini 相结合。 Gemini 生成输入图像的详细描述,Imagen 3 使用它来生成新图像。
Whisk 的到来可能会对创意产业产生重大影响。设计师和艺术家会发现更容易将他们的想法形象化并探索表达它们的新方法。它还允许普通用户在不具备高级设计技能的情况下创建独特的视觉表达。
然而,这项技术既有潜力也有风险。可能会出现法律和道德问题,例如版权问题和基于人工智能的创作的归属问题。它还可能引发关于人类创造力与人工智能之间关系的新讨论。
从长远来看,像 Whisk 这样的技术的发展可能会显着改变我们视觉交流的方式。使个人能够轻松创建高质量的视觉内容可以彻底改变媒体和广告行业。
谷歌还担心安全性,并引入了名为 SynthID 的过滤和数字水印来防止有害内容的生成。这是确保人工智能生成内容的透明度和可追溯性的一项重要举措。
目前,Whisk 仅可通过 Google 实验室在美国试用。我们希望随着世界各地的用户体验这项技术并提供反馈,看到进一步的发展。

我们 innovaTopia 将密切关注这些技术进步,并让我们的读者了解他们的机遇和挑战。我们必须继续关注像Whisk这样的创新工具如何扩展人类创造力并影响社会。
【术语解释】
- 图3:
谷歌最新的图像生成人工智能。自然光的出色表现和细节刻画 - 我看到2:
支持4K分辨率的视频生成AI。了解视频制作的技术术语 - 合成ID:
Google 的数字水印技术。用于识别人工智能生成的内容
[参考链接]
- 谷歌实验室(外部)
您可以在这个平台上试用 Google 的实验性 AI 工具。可以使用Whisk、VideoFX等 - 谷歌云顶点人工智能(外部)
谷歌的人工智能开发平台。使用最新的 AI 模型,例如 Imagen 3 和 Veo 2
