革命性AI防御:麻省理工新技术让聊天机器人远离有害言论|TodayAI

本文主要是介绍革命性AI防御:麻省理工新技术让聊天机器人远离有害言论|TodayAI,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

为了防止AI聊天机器人给出有害回应,研究者们开发了一种新的机器学习模型。这种模型能够找到更多样化的训练聊天机器人的提示,以避免令人讨厌或有害的输出。用户可能会要求AI聊天机器人编写计算机程序或总结一篇文章,而该聊天机器人很可能能够生成有用的代码或撰写出清晰的概要。然而,也有可能被请求提供制造炸弹的指导,聊天机器人也可能应对得来。

为了防止这种及其他安全问题,构建大型语言模型的组织通常会采用一种称为红队测试的过程来进行保护。人类测试团队会编写旨在引发不安全或有毒文本的提示,用于训练聊天机器人避免这类回答。

然而,这种方法只有在工程师知道哪些提示可能有害时才有效。如果测试人员漏掉了某些提示,这是很可能发生的,一个被认为是安全的聊天机器人仍然有可能产生不安全的回答。

来自麻省理工学院不可能实验室和麻省理工学院-IBM沃森人工智能实验室的研究小组利用机器学习技术改进了红队测试。他们开发了一种技术,可以训练一个专门的大型语言模型,自动生成多样化的提示,以触发被测试聊天机器人更广泛范围的不良反应。

他们通过指导专门模型在编写提示时保持好奇心,并专注于那些能引发目标模型有害反应的新颖提示来实现这一点。

这项技术在生成更多独特提示和引发更有害反应方面,超过了人类测试者和其他机器学习方法。这种方法不仅显著提高了与其他自动化方法相比被测试输入的覆盖面,而且还能够从已经加入了人类专家设置的安全防护措施的聊天机器人中引出有害反应。

目前,每个大型语言模型都需要经过长时间的红队测试以确保其安全。如果希望在快速变化的环境中更新这些模型,这种方法将不可持续。该研究团队提供了一种更快、更有效的质量保障方法。

该团队还包括一群研究生、研究科学家以及来自计算机科学与人工智能实验室(CSAIL)的高级研究科学家和负责人。这项研究将在国际学习表征会议上展示。

自动化红队测试

像那些支撑AI聊天机器人的大型语言模型通常通过展示来自数十亿公共网站的大量文本进行训练。因此,它们不仅能学会生成有害内容或描述非法活动,这些模型还可能泄露它们可能收集的个人信息。

人类红队测试的繁琐和高成本本质,以及在生成足够多样化的提示以完全保护模型方面的低效性,促使研究者们寻求通过机器学习来自动化这一过程。

这些技术通常通过使用强化学习训练专门模型。这种试错过程奖励专门模型生成触发被测试聊天机器人产生有害反应的提示。

但由于强化学习的工作机制,专门模型往往会重复生成少数几个相似且高度有害的提示,以最大化其奖励。

该研究小组采用了一种名为好奇心驱动探索的技术。这种方法激励专门模型对每个生成的提示的后果保持好奇,因此它会尝试使用不同的词汇、句子结构或含义的提示。

当专门模型已经遇到过特定提示时,重复使用不会激发其好奇心,因此它会被激励创造新的提示。

在其训练过程中,专门模型生成一个提示并与聊天机器人交互。聊天机器人响应,安全分类器根据其回应的有害程度进行评分,根据这个评分奖励专门模型。

奖励好奇心

专门模型的目标是通过引发更有害的回应来最大化其奖励。研究团队通过修改强化学习设置中的奖励信号来激发专门模型的好奇心。

首先,他们增加了一个熵奖励,鼓励专门模型在探索不同提示时变得更加随机。其次,为了使代理更加好奇,他们引入了两种新颖奖励。一种基于提示中词汇的相似性,另一种基于语义相似性。(相似性较低的奖励更高。)

为了防止专门模型生成随机的、无意义的文本,这可能会误导分类器授予高有害评分,研究团队还在训练目标中加入了自然语言奖励。

通过这些调整,研究团队比较了他们的专门模型生成的反应的有害性和多样性与其他自动化技术。他们的模型在这两个指标上都超过了基线。

他们还使用专门模型测试了一个经过人类反馈调整的聊天机器人,使其不产生有害回应。他们的好奇心驱动方法能够迅速产生196个引发这个“安全”聊天机器人有害反应的提示。

模型的激增是一个趋势,预计只会增加。可以想象成千上万的模型,以及公司/实验室频繁推出模型更新。这些模型将成为我们生活中不可或缺的一部分,确保在公开发布前进行验证非常重要。手动验证模型根本不具备可扩展性,该团队的工作旨在减少人力,确保一个更安全、更值得信赖的人工智能未来。

未来,研究团队希望使专门模型能够生成涵盖更广泛主题的提示。他们还希望探索使用大型语言模型作为有害性分类器。这样,用户可以使用公司政策文件来训练有害性分类器,使专门模型能够针对公司政策违规测试聊天机器人。

如果您正准备发布一个新的AI模型,并担心它是否会按预期行为,那么请考虑使用好奇心驱动的红队测试方法。

这篇关于革命性AI防御:麻省理工新技术让聊天机器人远离有害言论|TodayAI的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/892632

相关文章

Ilya-AI分享的他在OpenAI学习到的15个提示工程技巧

Ilya(不是本人,claude AI)在社交媒体上分享了他在OpenAI学习到的15个Prompt撰写技巧。 以下是详细的内容: 提示精确化:在编写提示时,力求表达清晰准确。清楚地阐述任务需求和概念定义至关重要。例:不用"分析文本",而用"判断这段话的情感倾向:积极、消极还是中性"。 快速迭代:善于快速连续调整提示。熟练的提示工程师能够灵活地进行多轮优化。例:从"总结文章"到"用

AI绘图怎么变现?想做点副业的小白必看!

在科技飞速发展的今天,AI绘图作为一种新兴技术,不仅改变了艺术创作的方式,也为创作者提供了多种变现途径。本文将详细探讨几种常见的AI绘图变现方式,帮助创作者更好地利用这一技术实现经济收益。 更多实操教程和AI绘画工具,可以扫描下方,免费获取 定制服务:个性化的创意商机 个性化定制 AI绘图技术能够根据用户需求生成个性化的头像、壁纸、插画等作品。例如,姓氏头像在电商平台上非常受欢迎,

从去中心化到智能化:Web3如何与AI共同塑造数字生态

在数字时代的演进中,Web3和人工智能(AI)正成为塑造未来互联网的两大核心力量。Web3的去中心化理念与AI的智能化技术,正相互交织,共同推动数字生态的变革。本文将探讨Web3与AI的融合如何改变数字世界,并展望这一新兴组合如何重塑我们的在线体验。 Web3的去中心化愿景 Web3代表了互联网的第三代发展,它基于去中心化的区块链技术,旨在创建一个开放、透明且用户主导的数字生态。不同于传统

AI一键生成 PPT

AI一键生成 PPT 操作步骤 作为一名打工人,是不是经常需要制作各种PPT来分享我的生活和想法。但是,你们知道,有时候灵感来了,时间却不够用了!😩直到我发现了Kimi AI——一个能够自动生成PPT的神奇助手!🌟 什么是Kimi? 一款月之暗面科技有限公司开发的AI办公工具,帮助用户快速生成高质量的演示文稿。 无论你是职场人士、学生还是教师,Kimi都能够为你的办公文

Andrej Karpathy最新采访:认知核心模型10亿参数就够了,AI会打破教育不公的僵局

夕小瑶科技说 原创  作者 | 海野 AI圈子的红人,AI大神Andrej Karpathy,曾是OpenAI联合创始人之一,特斯拉AI总监。上一次的动态是官宣创办一家名为 Eureka Labs 的人工智能+教育公司 ,宣布将长期致力于AI原生教育。 近日,Andrej Karpathy接受了No Priors(投资博客)的采访,与硅谷知名投资人 Sara Guo 和 Elad G

【专题】2024飞行汽车技术全景报告合集PDF分享(附原数据表)

原文链接: https://tecdat.cn/?p=37628 6月16日,小鹏汇天旅航者X2在北京大兴国际机场临空经济区完成首飞,这也是小鹏汇天的产品在京津冀地区进行的首次飞行。小鹏汇天方面还表示,公司准备量产,并计划今年四季度开启预售小鹏汇天分体式飞行汽车,探索分体式飞行汽车城际通勤。阅读原文,获取专题报告合集全文,解锁文末271份飞行汽车相关行业研究报告。 据悉,业内人士对飞行汽车行业

AI hospital 论文Idea

一、Benchmarking Large Language Models on Communicative Medical Coaching: A Dataset and a Novel System论文地址含代码 大多数现有模型和工具主要迎合以患者为中心的服务。这项工作深入探讨了LLMs在提高医疗专业人员的沟通能力。目标是构建一个模拟实践环境,人类医生(即医学学习者)可以在其中与患者代理进行医学

AI行业应用(不定期更新)

ChatPDF 可以让你上传一个 PDF 文件,然后针对这个 PDF 进行小结和提问。你可以把各种各样你要研究的分析报告交给它,快速获取到想要知道的信息。https://www.chatpdf.com/

金融业开源技术 术语

金融业开源技术  术语 1  范围 本文件界定了金融业开源技术的常用术语。 本文件适用于金融业中涉及开源技术的相关标准及规范性文件制定和信息沟通等活动。

【北交大信息所AI-Max2】使用方法

BJTU信息所集群AI_MAX2使用方法 使用的前提是预约到相应的算力卡,拥有登录权限的账号密码,一般为导师组共用一个。 有浏览器、ssh工具就可以。 1.新建集群Terminal 浏览器登陆10.126.62.75 (如果是1集群把75改成66) 交互式开发 执行器选Terminal 密码随便设一个(需记住) 工作空间:私有数据、全部文件 加速器选GeForce_RTX_2080_Ti