Security and Privacy Taxonomy Generation from Mobile App Reviews
本文介绍了 TaxoScale,这是一个可扩展的流水线,它通过过滤超过 600,000 条移动应用评论,并结合递归层次聚类与基于大语言模型(LLM)的命名方法,自动生成一个全面且新颖的安全与隐私分类法,从而克服了现有方法在处理大规模数据集时面临的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一座巨大且繁忙的城市,每一款应用程序都是一家商店、一家餐厅或是一个公园。每天,都有数百万人穿梭于这些数字之门,当他们离开时,往往会向空中大声喊出他们的抱怨或赞美。这些呐喊就是“应用评论”。有些人是在抱怨加载速度慢或颜色难看,而另一些人则是在为更严重的事情而尖叫:他们的隐私和安全。他们在说:“这个应用在监视我!”或者“它在窃取我的数据!”
长期以来,科学家和安全专家一直试图倾听这些呐喊,以了解到底出了什么问题。他们创建了“分类法”(taxonomies),这就像是巨大的、有组织的档案柜或图书馆目录。分类法不再只是听到一团混乱的抱怨,而是将它们整理成整齐的类别,例如“数据收集”、“监视”或“密码问题”。然而,这些旧档案柜有一个大问题:它们是由人类专家手工一个文件夹一个文件夹地构建出来的。应用之城的变化太快了,人类根本无法跟上。新功能不断出现,新的窥探手段层出不穷,旧的档案柜甚至还没建好就变得落满灰尘、过时了。问题变成了:我们如何建立一个能够实时组织数百万次呐喊,而不会感到不堪重负的分类系统?
这就是肯塔基大学和路易斯安那州立大学的研究人员推出名为 TaxoScale 的新工具的地方。他们意识到,构建这些目录的旧方法太慢了,无法处理如此庞大的数据量。他们拥有 1863 万条应用评论的海量数据,但其中只有大约 601,257 条实际上是关于隐私或安全的。手动对这么多投诉进行分类将耗费无穷的时间,而尝试使用标准的计算机程序来做这件事,很可能会因为列表太长而导致程序崩溃。
为了解决这个问题,团队构建了一个智能流水线,它就像一位超级高效的图书管理员。首先,他们使用了一种强大的人工智能(一种被称为 LLM 的计算机大脑)作为过滤器,从 1800 万条评论中筛选出那 60 万条真正关于隐私和安全的评论。然后,他们使用另一种人工智能来提取用户描述其担忧的具体句子,将冗长的抱怨转化为简短、清晰的“标签”,例如“需要我的联系人”或“追踪我的驾驶轨迹”。
真正的魔力发生在下一步。TaxoScale 并没有尝试一次性对所有 60 万个标签进行分类(这就像试图在一个房间里整理一百万本书),而是使用了一个被称为递归层次聚类(Recursive Hierarchical Clustering)的巧妙技巧。想象一下你有一大堆混杂在一起的玩具。与其试图一次性把它们全部分类,不如先将这堆玩具分成两个大桶。然后,你取出一个桶,将其分成两个小桶,并不断重复这个过程,直到这些堆变得足够小,可以轻松分类。一旦小堆被分类好了,再按逻辑顺序将这些组重新粘合在一起。这种“分而治之”的方法使系统能够处理如此大规模的数据而不会陷入停滞。
最后,系统使用人工智能为这些新组命名。它观察排序后的堆,并为它们发明清晰、简短的名字,比如“行为追踪”或“网络安全”。结果是一个全新的、鲜活的分类法,它比旧的手工分类法要好得多。研究人员发现,他们的新系统不仅在分类投诉方面更加准确,还发现了以前从未有人想到的全新类别。例如,他们发现了一个关于“网络安全”的全新分支(例如应用如何管理 IP 地址或使用 VPN),以及一个针对“家长控制”问题的非常具体的类别,这很有道理,因为他们的数据包含了来自教师认可的应用的评论。
这篇论文表明,TaxoScale 是向前迈出的重要一步。它不仅仅是复制旧的类别,它还能发现新的类别,并且比以往的自动方法组织得更好。通过发布他们的数据和代码,研究人员正将这个更聪明、更高效的分类系统的钥匙交给世界,希望它能在数字城市不断增长的过程中,帮助我们的城市变得更加安全和透明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。