麻省理工学院和 MIT-IBM Watson AI 实验室的研究人员开发了一种新技术来提高 AI 聊天机器人的安全性。与传统的人类测试方法相比,该技术使用机器学习来生成更多种类的提示,并训练聊天机器人以避免有害的响应。研究人员通过开发好奇心红队模型并利用好奇心作为模型生成新的提示,能够获得更有效的结果。与其他自动化技术相比,该技术显着提高了输入覆盖范围,并且还能够引发受人类专家保护的聊天机器人的有害响应。
大规模语言模型用于人工智能聊天机器人等,并通过从数十亿个公共网站学习文本来进行训练。人类红队既费力又低效,因此研究人员正在尝试使用机器学习来自动化这一过程。他们开发的好奇的红队模型能够自动生成各种提示来引发毒性反应,并且与其他自动化技术相比,事实证明能够生成更多种类的提示并引发毒性反应。
验证人工智能模型通常需要很长时间。研究人员正在提出新技术来改进红队技术并实现更快、更有效的验证。该技术可以提高人工智能模型更新频繁的环境中的质量保证。未来的工作还将探索针对更多样化的主题生成提示并使用大规模语言模型作为毒性分类器的可能性。
新闻评论
麻省理工学院和 MIT-IBM Watson AI 实验室的研究人员开发了一种新技术,可以防止 AI 聊天机器人给出不当或有害的响应。该技术利用机器学习来生成比传统人类测试更多样的提示,旨在训练聊天机器人以避免有害反应。研究团队通过开发具有好奇心的红队模型,在生成新提示时利用好奇心,能够获得更有效的结果。与其他自动化技术相比,该技术显着提高了输入覆盖范围,并且还能够引发受人类专家保护的聊天机器人的有害响应。
这项研究背后的问题是,人工智能聊天机器人可能有能力通过从公共网站学习来描述不恰当的语言和非法活动。人工测试(红队)是解决此问题的常用方法,但由于难以生成足够的即时多样性,因此非常耗时且效果有限。为了解决这个问题,研究团队开发了一种新方法,利用利用好奇心驱动探索的机器学习技术来提高人工智能聊天机器人的安全性。
这种方法的积极之处在于,它可以让我们快速有效地验证AI模型的安全性。这使得即使在人工智能聊天机器人频繁更新的环境中也能维持质量保证流程。此外,该技术允许在人工智能聊天机器人公开使用之前对其进行更广泛的验证,这有望提高用户的信任和安全性。
然而,此技术的潜在风险是自动红队可能会生成不适当的提示。这可能会导致人工智能聊天机器人学习有害内容。还需要讨论如何监管这项技术。随着这种新方法的引入,确保人工智能安全的法规和指南可能需要更新。
未来,这项研究可能会改变人工智能聊天机器人的开发和验证过程。通过更快地更新人工智能模型并同时确保其安全性,有望加速人工智能技术的进步及其在社会中的应用。随着人工智能技术扩展到更广泛的用途,我们还期望看到更多的应用,例如生成各种主题的提示以及测试是否违反公司政策。
[编者按]2024/04/11
红队模型是一种使人工智能聊天机器人更加安全和稳健的创新方法。通过从各种角度提出问题并进行培训以适当地响应意外输入,我们将为实现更可靠的人工智能做出贡献。
编辑的感想
我对提高人工智能聊天机器人安全性的新方法非常感兴趣。它具有开创性,因为它使用机器学习来生成多样化的提示并避免有害的反应。使用红队模型的有效验证也令人印象深刻。另一方面,这也让我思考诸如通过自动红队生成不适当提示的风险以及更新法规和指南的必要性等问题。我们希望这项研究能够为人工智能的健康发展做出重大贡献。
