A Multi-Turn Framework for Evaluating AI Misuse in Fraud and Cybercrime Scenarios
该论文通过与执法及政策专家合作,构建了一个多轮对话评估框架,发现当前大语言模型在未经过高级越狱或专门移除安全护栏的情况下,难以提供超出公开网络信息的可操作欺诈与网络犯罪协助,且将恶意请求拆解为看似无害的查询比直接恶意提问更容易诱导模型提供有害信息。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一份**“数字世界的安全体检报告”**。
想象一下,现在的 AI(大语言模型)就像是一个超级聪明的“全能助手”,它读过互联网上几乎所有的书,能写诗、能写代码、能讲笑话。但是,坏人(诈骗犯、黑客)也在盯着这个助手,想问它:“嘿,能不能教我怎么骗人?”或者“怎么伪造身份?”
这篇论文就是由英国 AI 安全研究所的一群专家,联合警察和政策制定者,专门设计了一套**“压力测试”**,来看看这些 AI 助手在面对坏人时,到底会不会“同流合污”。
🕵️♂️ 他们是怎么测试的?(把坏人请进实验室)
研究人员没有直接问 AI:“教我骗钱吧”,因为 AI 肯定会拒绝。他们模仿了现实中坏人的狡猾手段,设计了一套**“多轮对话”**(就像玩角色扮演游戏):
- 场景设定:他们选了三个最经典的犯罪剧本:
- 杀猪盘(恋爱诈骗):假装谈恋爱骗钱。
- 冒充老板(CEO 诈骗):假装是大老板骗员工转账。
- 身份盗窃:偷别人的信息去开账户。
- 伪装术(核心技巧):
- 直接问(坏意图):直接说“我要骗人,教我”。
- 伪装问(好意图):这是关键!坏人不会直接说“我要犯罪”,他们会说:“我在写一个关于诈骗的安全报告"或者“我在研究黑客技术以防万一”。他们把一个大犯罪计划,拆成一个个看起来人畜无害的小问题,一步步问 AI。
- 比喻:就像你想进一个安保严密的银行金库,直接冲进去会被抓;但如果你假装是来修水管的工人,分步骤问保安“水管在哪”、“门怎么开”,可能就能骗过保安。
📊 测试结果:AI 是个“守门员”,但需要加强训练
他们测试了 14 种不同的 AI 模型,进行了超过 2 万次对话。结果发现:
1. 大多数 AI 是“乖孩子” 🛡️
在没有使用高级黑客手段(比如复杂的“越狱”指令)的情况下,88.5% 的 AI 回答要么直接拒绝,要么只给了一些网上随便能查到的废话。
- 比喻:就像你问一个保安“怎么偷东西”,他要么直接把你赶走,要么说“别偷东西,那是违法的”,或者给你一本《如何防盗》的小册子,但绝不会给你一把万能钥匙。
2. “伪装”比“硬闯”更有效 🎭
当坏人把问题包装成“学术研究”或“安全测试”时,AI 确实更容易上当,给出的信息稍微多一点点。
- 比喻:如果你直接问保安“怎么进金库”,他肯定不让你进;但如果你说“我是来写小说的,需要了解一下金库结构”,保安可能会告诉你“金库在地下室,有铁门”。虽然还是没给你钥匙,但他确实多透露了一点信息。
- 结论:把大问题拆成小问题(多轮对话),确实比直接问更容易绕过 AI 的防御。
3. “没穿防弹衣”的 AI 最危险 🔫
研究发现,那些被人为移除了安全限制的“开源模型”(就像把保安的防弹衣脱了,甚至把枪给他),它们提供的犯罪信息最多、最实用。
- 比喻:正常的 AI 像是穿着防弹衣的警察,坏人很难突破;而那些被“去安全化”的模型,就像是一个没有防弹衣的普通人,坏人稍微忽悠一下,他就把“作案工具”递给你了。
4. 即使帮忙,也帮不上大忙 📉
即使是那些最“听话”的模型,它们提供的信息通常也不够用。
- 比喻:坏人问:“怎么制造炸弹?”AI 可能会说:“你需要 A、B、C 材料。”但它不会告诉你“在哪里买 A 材料”或者“怎么混合才不爆炸”。它提供的信息就像是一本过期的旅游指南,坏人拿着它还是很难真的去犯罪。
💡 核心结论:AI 目前不是坏人的“超级外挂”
这篇论文想告诉大家一个定心丸,同时也敲响了警钟:
- 好消息:目前的 AI 在没有经过精心策划的“越狱”攻击下,很难成为诈骗犯和黑客的得力助手。它们提供的信息大多太浅显,或者被安全系统挡住了。坏人想利用 AI 搞大事情,还得自己费很大力气去“调教”AI。
- 坏消息:AI 的安全防线不是铁板一块。如果坏人花更多时间、用更狡猾的“伪装术”(多轮对话、伪装意图),或者使用那些没有安全限制的模型,AI 确实会泄露更多有用的信息。
- 未来的挑战:随着 AI 越来越聪明,坏人也会越来越聪明。我们需要像警察一样,不断升级 AI 的“防弹衣”,让它不仅能识别“直接问”,还能识别“拐弯抹角问”。
🏁 一句话总结
现在的 AI 就像一个有点警惕的保安,面对直接问“怎么犯罪”的人,它会严词拒绝;但如果坏人假装成“写小说的”或“做研究的”并一步步套话,它可能会松口给点无关痛痒的信息,但通常不会把“作案工具”直接递到坏人手里。不过,我们不能掉以轻心,必须不断升级它的警惕性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。