✨ 要点🔬 技术摘要
把互联网想象成一个繁忙、喧闹的大型集市,每个人都在试图向你推销东西、给你讲故事,或者向你寻求帮助。在这个混乱的集市中,还潜伏着一些聪明的骗子——他们伪装成友好的邻居或值得信赖的官员,以此窃取你的金钱或秘密。多年来,安全专家一直试图建立数字保镖来捕捉这些骗子。传统上,这些保镖就像是刻板的守规矩者:他们会记住特定的短语,比如“点击这里领取奖品”,并标记任何匹配的内容。但骗子非常有创意;他们会改变自己的说辞,因此那些旧的守规矩者经常会漏掉新的诡计。
迎来新一代数字保镖:大语言模型(LLMs)。不要把它们看作是守规矩的人,而要将它们视为“超级读者”,它们几乎读遍了互联网上的每一本书、每一个网站和每一段对话。它们不仅仅寻找关键词;它们试图理解一条信息背后的“意图”和“情绪”。它们就像侦探一样,能够读懂字里行间的含义,从而判断一个人是否在撒谎,即使这个骗子使用的是一套全新的剧本。大家都在问的一个大问题是:这些超级读者真的能在现实世界中抓到骗子吗,还是说它们只是会被现实诡计搞糊涂的高级聊天机器人?
这篇论文深入探讨了那个问题。作者们是一群来自大学和安全公司的研究人员,他们决定对九种不同的“超级读者”进行测试。他们不仅是让它们去猜测,还利用超过 2,700 个真实的案例(包括诈骗信息、正常信息以及连专家都难以分类的模糊信息)创建了一场大规模且独特的“诈骗考试”。他们测试了从小型、高效的模型到庞大、强力模型的各种类型,并尝试了不同的提问方式(例如给它们提供示例或要求它们进行逐步思考)。
以下是他们的发现:规模最大、最强大的模型(例如拥有 700 亿参数的巨型 Llama 3.1 以及最新版本的 ChatGPT)确实是最优秀的侦探,能正确识别大约 65% 的棘手案例。然而,规模并非一切。论文指出,你提问的方式至关重要。对于较小的模型,给它们一点“提示”或一份常见的诈骗特征清单(如“好得令人难以置信”或“紧迫压力”)可以显著提升它们的表现,使其几乎能与大型模型一样出色。但问题在于:这些超级读者并不是万能灵药。它们并不完美,有时也会像人类一样感到困惑。
有趣的是,研究人员还将这些高级的新型模型与一种更旧、更简单的 AI 类型——BERT 进行了对比。在受控测试中,旧模型表现得相当不错,但当骗子改变策略(使用该模型从未见过的数据)时,旧模型就踉跄了。然而,巨型 LLM 在处理这些新的、未见过的诡计方面表现得更好,这表明它们广博的世界知识有助于它们更好地进行泛化。论文总结道,虽然这些 AI 模型是强大的工具,但最好的方法不是仅仅依赖一个巨大的大脑,而是建立一个混合团队,将大模型的深度理解能力与简单、传统工具的速度和可靠性结合起来。他们还将他们的“考试题目”(数据集)公之于众,希望能帮助他人构建起对抗不断演变的诈骗艺术的更好防御。
技术摘要:用于诈骗检测的生成式人工智能模型的测量与评估
问题陈述
在线诈骗代表着日益增长的威胁,通过利用人类的信任和情感造成了巨大的财务和个人伤害。虽然传统的机器学习技术(如逻辑回归、SVM、朴素贝叶斯)已被广泛应用于诈骗检测,但它们在面对新型或未见的攻击时往往泛化能力较差。因此,由于一种普遍的观点认为,大语言模型(LLM)在理解意图、上下文和推理方面的强大能力使其广泛适用于诈骗检测,导致安全产品中正迅速采用大语言模型。然而,本文认为,尽管生成式人工智能在漏洞和缺陷检测等领域备受关注,但目前仍缺乏针对诈骗检测领域对大语言模型进行的严格且全面的评估。
方法论
作者进行了首个评估流行大语言模型在诈骗检测中有效性和局限性的全面实证研究。该方法论包含以下关键组成部分:
1. 数据集构建 (ScamBenchmark)
研究人员构建并发布了一个独特的基准数据集,包含来自三个主要来源的 2,742 个独特样本:
Reddit: 来自 “Is this a scam?” 子版块的 1,270 条帖子,通过 OCR 处理。
Google Images: 通过特定查询(如 “hi mom scams”)收集的 615 张图像,通过 OCR 处理。
MTurk: 来自参与者提交的 857 张合法消息截图。
专有数据: 由一家安全公司提供的 59,991 个真实世界样本的验证集。
每个样本被标记为 诈骗 (Scam) 、清洁 (Clean) 或 不确定 (Uncertain) (针对需要外部元数据的模糊情况)。数据进一步细分为 25 种精细的诈骗类型。
2. 模型选择
研究评估了九种不同规模和架构的大语言模型,以及一个经过微调的基于 BERT 的分类器:
开源模型: Mistral (7B, 8x7B), Llama 3 (8B), Llama 3.1 (8B, 70B), Llama 3.2 (11B)。
专有模型: OpenAI ChatGPT (4 Turbo, 4o, 4o1)。
基准模型: 微调后的 BERT。
3. 实验设计
评估侧重于以下变量:
提示策略 (Prompting Strategies): 零样本 (Zero-shot)、少样本 (Few-shot, 1, 5, 10 shots)、思维链 (CoT)、包含“常见特征 (Common Signs)”的提示,以及增强了“URL 智能 (URL Intelligence)”(使用外部安全评估)的提示。
超参数调优: 评估温度 (temperature) 和 top-p 值 (0.1, 0.5, 0.9),以评估输出随机性的影响。
微调 (Fine-Tuning): 使用平衡训练集(每类 400 个样本)对 Mistral 7B、Llama 3.1 8B 和 BERT 进行监督式微调。
集成分析 (Ensemble Analysis): 使用 Cohen's Kappa 评估模型一致性,并测试集成组合。
关键结果
模型性能与规模
大模型表现更优: 通常,较大的模型取得了更好的结果。在零样本提示下,ChatGPT 4o1 和 Llama 3.1 70B 实现了最高的 micro-F1 分数(分别为 64% 和 65%)。
提示敏感性: 提示策略显著影响性能,但其效果取决于具体模型。
小模型: 有效的提示(如“常见特征”)大幅提升了较小模型的性能。例如,Llama 3.1 8B 在使用定制提示后,其 micro-F1 从 50% 提升至 57%。
大模型: 一些大模型(如 ChatGPT 4o1)在使用复杂的思维链 (CoT) 等提示策略时,出现了性能下降或结果不确定的情况。
少样本学习: 增加 shot 的数量通常会提高性能,但并非普遍现象。对于某些模型(如 Llama 3.2 11B),1-shot 或 5-shot 设置的表现优于 10-shot 设置。
泛化能力 vs. 微调
泛化能力: 与微调模型相比,大语言模型在未见数据上表现出更优越的泛化能力。当在大型专有数据集上进行测试时,微调后的 BERT 模型性能显著下降(micro-F1 为 0.393),而 Llama 3.1 70B 则保持了稳定的得分(0.596)。
微调的局限性: 虽然微调提升了较小规模 LLM 的性能(例如 Mistral 7B 的 micro-F1 从 0.470 提升至 0.543),但它们仍然无法达到表现最佳的零样本大模型的水平。
BERT 的竞争力: 在受控设置下,微调后的 BERT 表现出了竞争力(0.59 micro-F1),超过了较小的 LLM,但在分布偏移方面缺乏 LLM 的鲁棒性。
特定类别
诈骗 vs. 清洁: 大多数模型在对“清洁”样本进行分类时表现挣扎,部分模型的召回率低至 0.019。ChatGPT 4o1 是一个例外,其对清洁样本的召回率为 58%。
不确定类别: 许多模型在将样本分类为“不确定”时表现困难,尽管 ChatGPT 4 Turbo 在该类别中表现最好。
核心贡献
首个全面研究: 本文展示了利用各种提示技术和超参数评估流行大语言模型在诈骗检测中表现的首次评估。
ScamBenchmark 数据集: 发布了第一个专门用于评估诈骗检测中大语言模型的基准数据集,其中包含了涵盖多种格式和主题的真实世界样本。
实证局限性: 研究通过实证证明,当前的大语言模型并非诈骗检测的“银弹”;其有效性高度依赖于特定的模型提示和配置。
微调评估: 作者对 Mistral 7B、Llama 3.1 8B 和 BERT 进行了微调,并提供了其与零样本大模型性能的对比分析。
意义与主张
本文得出结论,虽然较大的大语言模型(如 ChatGPT 4o1, Llama 3.1 70B)目前提供了最佳性能,但它们并不是万能解决方案。作者声称,未来的路径不在于单纯地扩大模型规模,而在于构建混合架构 ,将大语言模型的语义理解能力与经典机器学习方法的效率和精确度结合起来。
研究强调:
大语言模型在未见诈骗上的泛化能力优于微调模型,这表明预训练知识具有价值。
提示工程至关重要,但必须针对特定模型进行定制,因为有助于小模型的策略可能会阻碍大模型。
没有单一的模型或方法能普遍解决诈骗检测问题;最优的部署方案可能是建立一个流水线,由大语言模型处理模糊输入或特征提取,而由经典模型处理确定性分类。
作者发布了其数据集和微调后的模型,以促进未来在鲁棒诈骗检测方面的研究,旨在从对广泛适用性的“普遍信念”转向更具细微差别、基于证据的部署策略。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。