Determination of the Number of Topics Intrinsically: Is It Possible?
本文评估了在多个语料库中用于估计主题模型中主题数量的各种内在方法,并得出结论认为这些方法是不可靠的,因为最优主题数量取决于所使用的特定模型和方法,而非数据的绝对属性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一座包含数百万本书籍的图书馆,但书架是空的,书名也失踪了。为了让这些藏书变得有意义,图书管理员可能会尝试根据其内容对书籍进行分组,即根据共同的主题将它们分堆。在计算机科学领域,这就是“主题模型”(topic model)的工作。这些统计工具通过扫描海量文本来寻找隐藏的模式,将频繁一起出现的词汇归类为我们所称的“主题”。一个主题可能关于体育,另一个关于烹饪,还有一个关于太空探索。计算机事先并不知道这些标签;它通过分析文本本身来发现它们。
然而,这个过程中存在一个根本性的问题:计算机不知道应该分成多少堆。是创建十个组、五十个组,还是一百个组?这个数字是一个至关重要的设置,或者说是一个“超参数”,用户必须在计算机开始工作之前进行选择。如果数字太低,分组会变得混乱且令人困惑,将无关的主题混杂在一起。如果数字太高,分组会变得微小且重复,将一个单一的思想拆分为许多近乎相同的碎片。多年来,研究人员一直试图构建自动化的工具,让这些工具能够观察一组文本,并告诉用户应该选择多少个主题的最佳数量,希望能从中发现隐藏在数据中的某种单一的、客观的真理。
来自莫斯科物理技术学院和莫斯科国立罗蒙诺索夫大学的一个研究小组决定测试这样一个完美的数字是否真的存在。他们收集了大量现有的方法——数十种声称能够确定最佳主题数量的不同数学公式和程序。他们将这些方法应用于多个大型的现实世界文本集,范围涵盖新闻文章、科学论文、编程论坛帖子以及一组经过筛选的俄语维基百科文章。他们还针对不同类型的计算机模型测试了这些方法,因为模型的构建方式会改变它观察数据的方式。
研究人员进行了数千次实验,让计算机模型从文本中学习,同时使用每种不同的方法来衡量结果。他们寻找清晰的信号,例如数据中的尖峰或深谷,这能指示理想的主题数量。他们曾希望发现所有不同的方法都会达成一致,针对给定的文本集指向同一个数字。然而,他们发现了一个混乱的景象。不同的方法很少达成共识。一种方法可能认为一组新闻文章最好用十个主题来理解,而另一种方法在观察完全相同的文本时,却会建议三十个主题。更令人惊讶的是,“最佳”数量通常会根据用于分析文本的具体计算机模型而改变。
这项研究表明,那些用于寻找正确主题数量的最流行且最先进的工具远非可靠。一些旨在衡量主题之间区分度的方法,一致建议的数量过高,经常将计数推向研究人员测试的极限。而另一些衡量模型预测未见文本能力的方法,产生的结果则非常平坦且毫无变化,以至于无法提供任何指导。研究人员发现,主题的数量并不是文本本身固有的自然属性(如书的页数),它更多地取决于用于测量它的特定工具以及用于分析文本的特定模型。
在结论中,作者认为该领域一直在追逐一个神话。认为任何数据集中都存在一个等待被发现的单一、“自然”主题数量的想法似乎是不正确的。主题的数量更像是一个旋钮,用户可以通过它来调节想要看到的细节程度,类似于在地图上放大或缩小。一张城市地图可以显示具体的街道,也可以只显示主要高速公路;两者都不是“真实”的地图,它们只是为了不同目的而提供的不同视图。研究人员认为,与其试图自动寻找一个完美数量,从业者应该专注于他们实际需要模型完成的任务。他们应该思考自己希望分组的细节程度如何,或者是否有一些特定的问题想要模型去回答。这项研究指出,寻找主题数量的内在、自动解决方案是一条死胡同,这意味着答案不在于更好的公式,而在于对分析背后人类目标的更好理解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。