比特派钱包 20 步内逃狱自便大模子!更多“奶奶缝隙”全自动发现

发布日期:2023-12-30 14:16    点击次数:59

比特派钱包 20 步内逃狱自便大模子!更多“奶奶缝隙”全自动发现

1 分钟不到、20 步以内“逃狱”自便大模子比特派钱包,绕过安全适度!

况且无谓知说念模子里面细节 ——

只需要两个黑盒模子互动,就能让 AI 全自动攻陷 AI,说出危急执行。

传闻也曾红极一时的“奶奶缝隙”还是被设立了:

那么现时搬出“窥察缝隙”、“冒险家缝隙”、“作者缝隙”,AI 又该如何搪塞?

一波猛攻下来,GPT-4 也遭不住比特派钱包,奏凯说出要给给水系统投毒唯有…… 如此这般。

要津这仅仅宾夕法尼亚大学议论团队晒出的一小波缝隙,而用上他们最新斥地的算法,AI 不错自动生成各式挫折辅导。

议论东说念主员示意,这种方法比较于现存的 GCG 等基于 token 的挫折方法,效力栽培了 5 个量级。况且生成的挫折可确认性强,谁齐能看懂,还能迁徙到其它模子。

不管是开源模子如故闭源模子,GPT-3.5、GPT-4、 Vicuna(Llama 2 变种)、PaLM-2 等,一个齐跑不掉。

得胜率可达 60-100%,拿下新 SOTA。

话说,这种对话样貌大概有些似曾领路。多年前的初代 AI比特派钱包,20 个问题之内就能破解东说念主类脑中想的是什么对象。

如今轮到 AI 来破解 AI 了。

现时主流逃狱挫折方法有两类,一种是辅导级挫折,一般需要东说念主工筹划,况且不成延迟;

另一种是基于 token 的挫折,有的需要超十万次对话,且需要看望模子里面,还包含“乱码”不成确认。

△ 左辅导挫折,右 token 挫折

宾夕法尼亚大学议论团队冷落了一种叫 PAIR(Prompt Automatic Iterative Refinement)的算法比特派钱包,不需要任何东说念主工参与,是一种全自动辅导挫折方法。

PAIR 触及四个主要门径:挫折生成、成见反应、逃狱评分和迭代细化;主要用到两个黑盒模子:挫折模子、成见模子。

具体来说,挫折模子需要自动生谚语义级别的辅导,来攻破成见模子的安全防地,迫使其生成无益执行。

中枢想路是让两个模子相互招架、你来我往地疏浚。

挫折模子会自动生成一个候选辅导,然后输入到成见模子中,获取成见模子的回报。

要是此次回报莫得得胜攻破成见模子,那么挫折模子会分析此次失败的原因比特派钱包,矫正并生成一个新的辅导,再输入到成见模子中。

比特派从哪里下载

这么握续疏浚多轮,挫折模子每次笔据上一次的完了来迭代优化辅导,直到生成一个得胜的辅导将成见模子攻破。

此外,迭代经由还不错并行,也即是不错同期入手多个对话,从而产生多个候选逃狱辅导,进一步栽培了效力。

议论东说念主员示意,由于两个模子齐是黑盒模子,是以挫折者和成见对象不错用各式说话模子开脱组合。

PAIR 不需要知说念它们里面的具体结构和参数,只需要 API 即可,因此适用范围异常广。

实验阶段比特派钱包,议论东说念主员在无益举止数据集 AdvBench 中选出了一个具有代表性的、包含 50 个不同类型任务的测试集,在多种开源和闭源大说话模子上测试了 PAIR 算法。

完了 PAIR 算法让 Vicuna 逃狱得胜率达到了 100%,平均不到 12 步就能攻破。

闭源模子中,GPT-3.5 和 GPT-4 逃狱得胜率在 60% 阁下,平均用了不到 20 步。在 PaLM-2 上得胜率达到 72%,步数约为 15 步。

然而 PAIR 在 Llama-2 和 Claude 上的后果较差,议论东说念主员觉得这可能是因为这些模子在安全防护上作念了更为严格的微调。

他们还比较了不同成见模子的可转动性。完了自满,PAIR 的 GPT-4 辅导在 Vicuna 和 PaLM-2 上转动后果较好。

议论东说念主员觉得,PAIR 生成的语义挫折更能披露说话模子固有的安全劣势,而现存的安全法度更侧重防护基于 token 的挫折。

就比如斥地出 GCG 算法的团队,将议论完了共享给 OpenAI、Anthropic 和 Google 等大模子厂商后,相关模子设立了 token 级挫折缝隙。

大模子针对语义挫折的安全防护机制还有待完善。

论文不时:https://arxiv.org/ abs / 2310.08419

参考不时:https://x.com/ llm_sec / status / 1718932383959752869?s=20

本文来自微信公众号:量子位 (ID:QbitAI),作者:西风

告白声明:文内含有的对外跳转不时(包括不限于超不时、二维码、口令等样式)比特派钱包,用于传递更多信息,省俭甄选时分,完了仅供参考,IT之家所有著述均包含本声明。

  声明:新浪网独家稿件,未经授权隔绝转载。 -->

 



    Powered by 比特派客服 @2013-2022 RSS地图 HTML地图

    Copyright 365站群 © 2013-2023 比特派 版权所有