LLM as Detector: An In-context Learning Approach for Tabular Anomaly Detection
本文提出了 LLM-Detector,这是一个利用上下文学习将普通表格数据转换为用于代码生成评分引擎的结构化提示词的新型框架,从而在无需微调或神经网络训练的情况下,实现对多样化数据集的高效异常检测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数据中心那广阔而寂静的轰鸣声中,一种特定的麻烦往往隐藏在众目睽睽之下。它不是一场戏剧性的爆炸或一个显眼的错误,而是电子表格中数字与类别之间一种微妙的不协调。这就是表格数据的世界——记录着从银行交易、医疗记录到服务器日志和保险索赔等一切信息的数字账本。几十年来,计算机一直承担着从数百万条合法交易中寻找单笔欺诈交易,或从数千名健康患者中寻找一名病患的任务。挑战在于,这些“异常值”很少表现为明显的错误。它们表面上往往看起来完全正常,却违反了支配不同信息片段之间如何相互关联的隐藏规则。一个人的年龄、收入和税率通常遵循一种可预测的模式;当它们不符合这一模式时,即使每个单独的数字本身看起来都合理,也预示着问题的存在。
多年来,捕捉这些隐藏错误的标准方法是构建复杂的数学模型,让模型学习什么是“正常”,然后标记任何偏离该模式的情况。近年来,科学家们尝试使用大语言模型——即那些可以写文章或回答问题的强大人工智能系统——来识别这些错误。其核心思想是,如果你能教会计算机像阅读句子一样阅读一行数据,它可能比计算器更能理解数字背后的故事。然而,这些早期的尝试面临着一个重大障碍:它们要么运行太慢,无法满足实时处理的需求;要么需要针对新数据对 AI 进行重新训练,而这既昂贵又耗费计算资源。它们难以处理现实世界数据中常见的数字与文本类别的复杂混合,且在处理过程中往往会丢失数据的含义。
来自澳大利亚大学的研究团队提出了一种解决这一难题的不同方法,他们不将人工智能视为一个需要被训练的学生,而是将其视为一个被赋予蓝图的资深建筑师。他们不再强迫 AI 从零开始学习或记忆示例,而是要求它根据“正常数据”的摘要编写一个定制程序。研究人员将这种新方法称为 LLM-Detector。该方法依赖于“上下文学习”(in-context learning)的概念,这使得大语言模型只需通过清晰的规则描述和少量示例即可执行复杂任务,而无需改变其内部大脑或经历漫长的训练过程。
该过程始于提取大量的正常、健康数据(例如数千条合法的银行记录),并将其浓缩为三种关键类型的信息。首先,系统计算每一列的统计特征,记录平均值、典型范围以及不同类别的常见程度。其次,它绘制因果关系图,理清哪些信息依赖于其他信息;例如,它会学习到高收入通常与特定的税率档位相关联。第三,它选择一小组具有代表性的实际数据点作为“锚点”,展示数据的典型形状和分布。随后,这三个元素被打包成一个详细的提示词(prompt),并发送给大语言模型。
模型读取该提示词后,作为一个代码生成器,会编写出一个专门针对该数据集的完整、可执行的计算机程序。这个程序并非凭空猜测,而是一套指令,它准确知道如何检查统计异常、如何识别变量间破裂的关系,以及如何衡量一个新数据点距离正常人群中心的距离。一旦程序编写完成,它就会被保存并应用于新的、未见的数据。每当有新记录到达时,该程序会立即计算出一个“异常得分”,这个数字指示了该记录的可疑程度。如果得分很高,则意味着该记录违反了 AI 从正常数据中推导出的规则。
研究人员在二十四个不同的数据集上测试了这种方法,涵盖了从小型医疗记录到大规模网络安全日志的各种类型。他们将自己的方法与十五种其他最先进的方法进行了对比,其中包括传统的统计工具、深度学习模型以及之前利用语言模型处理此类任务的尝试。结果显示,该方法始终优于其他方法,尤其是在处理混合了数字和文本类别的数据集时。平均而言,该方法的检测准确度得分达到了 0.7407,高于次优方法。至关重要的是,这种性能的提升并未带来沉重的计算成本。由于 AI 只编写一次代码,随后便退居幕后,因此该系统运行速度极快,处理数据仅需不到一秒钟,而其他方法则可能需要数分钟甚至数小时。
研究还探讨了系统的不同部分是如何促成其成功的。他们发现,仅提供统计数字虽然有帮助,但加入变量间的关系图谱后,系统捕捉微妙错误的能力显著增强。引入代表性正常数据示例进一步精炼了系统理解数据整体形状的能力。研究人员还测试了不同的底层 AI 模型,发现虽然更强大的模型表现略好,但“编写定制程序”这一核心设计逻辑在各类模型中均表现出色。这表明,该方法的威力源于其结构化设计——即将数据转化为一套逻辑规则——而非仅仅依赖于某种特定的 AI 类型。
通过将异常检测问题转化为代码生成任务,研究人员创造了一个既强大又实用的系统。它不需要通常与高级人工智能相关的庞大计算能力,也不需要在数据变化时进行重新训练。它只是阅读了关于“正常”的故事,编写了一本用于识别“例外”的规则手册,然后将这本手册应用于现实世界。这种方法为需要监控海量数据风险的行业(从预防金融欺诈到保障计算机网络安全)提供了一条充满前景的路径,证明了有时寻找“大海捞针”最有效的方法,是教会计算机如何制造一块更好的磁铁。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。