上一次更新于2024-03-31 02:52
Openai宣布了新的文本到语音AI模型“语音引擎”,该模型可以重现人类的声音。这项技术使您可以基于仅15秒的录制音频样本来创建合成语音。但是,Openai在此时决定避免出版,因为释放该技术是有风险的。
语音引擎允许用户在克隆语音后输入文本以获得AI生成的声音。该技术提供了许多好处,包括阅读支持,全球内容覆盖范围,为非语言个人提供个性化的语音选项,并帮助言语障碍后恢复您的声音。
但是,从15秒的录音中克隆某人的声音的能力也带来了滥用的可能性。电话欺诈和选举活动的Robocalls已经在社会上引起问题。还指出了诸如未经授权访问银行帐户之类的安全问题。
OpenAI已建立了一套规则,以避免该技术广泛发布所带来的问题。例如,与海根(Heygen)这样的合作伙伴公司进行测试要求他们禁止对他人或组织的模仿,从具有克隆声音的人中获得明确的同意,并明确披露生成的声音来自AI。此外,所有生成的语音样品都将嵌入水印,以帮助跟踪其起源。
Openai希望采取仔细的方法来广泛发布该技术,并就合成语音负责部署以及社会如何适应这些新能力的对话进行对话。它还为社会提供了适应该技术的建议,包括基于银行帐户的声音逐步验证身份验证,公共教育,以了解欺骗AI内容的潜力以及加速技术以跟踪音频内容的起源。
该技术是在2022年底开发的,已经以多种形式开发,包括Chatgpt应用中的对话模式以及OpenAI的文本到语音API。但是,Openai选择将此语音引擎专门发布给某些合作伙伴。
[新闻评论]
由OpenAI开发的新的文本到语音AI模型“语音引擎”可让您创建合成声音,这些声音可根据录制的音频样本仅15秒钟来重现该人的声音。该技术提供了广泛的好处,包括阅读支持,扩大内容的全球范围,为非语言个人提供个性化的语音选项,并帮助恢复言语障碍者的声音。
但是,这项技术也有滥用的风险。在某些情况下,人们可以从仅15秒的音频样本中克隆某人的声音,包括电话欺诈,选举活动Robocalls,甚至未经授权访问银行帐户。
考虑到这一点,Openai仅在广泛发行语音引擎之前与某些合作伙伴公司进行测试。这些合作伙伴必须禁止对他人或组织的模仿,获得克隆声音的人的明确同意,并清楚地透露生成的声音来自AI。声音的生成样品还具有嵌入水印,以帮助跟踪其起源。
Openai的目标是发起有关负责部署合成语音以及社会如何适应这些新能力的对话。为此,我们为社会提供了适应该技术的建议,包括基于银行帐户的声音逐步验证身份验证,公共教育,以了解欺骗AI内容的潜力以及加速技术来跟踪音频内容的起源。
这项技术和仔细发布策略的发展说明了平衡AI进化的好处和风险的重要步骤。将来,希望该技术将以更安全的方式公开,从而使其充分利用其潜力。同时,整个社会必须适应这些技术进步,并采取措施防止虐待。
