Categorizing Mathematical Concepts with LLM Voting Ensembles in Mathswitch
本文评估了通过大语言模型投票集成在过滤 Mathswitch 项目中源自 Wikidata 的数学概念记录中的噪声方面的有效性,并识别了特定的分歧模式,以通过为未来的修复策略提供参考。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个庞大而混乱的图书馆,名叫 Mathswitch。它的目标是收集来自互联网各处的每一本书、每一条笔记和每一个图表——从正式的教科书到随意的维基百科文章——并将它们放在同一个书架上,以便你可以一次性找到所有内容。
问题在于?这个图书馆正试图从一个巨大的公共公告板——Wikidata(维基数据)——中提取书籍。这个公告板由所有人共同编辑,所以它有点乱。有时,关于“树”(那种可以攀爬的树)的帖子会被混入关于“树”(一种数学结构)的帖子中。有时,关于“函数”(你做的一份工作)的帖子会被混入关于“函数”(一个数学公式)的帖子中。
如果图书馆只是抓取所有看起来有点像数学的东西,书架上就会堆满非数学的垃圾,导致很难找到真正的数学内容。
解决方案:AI 评审团
为了清理这些混乱,这篇论文的作者构建了一个 AI 评审团。你可以把它想象成一个由三位法官(具体来说是三个不同的 AI 模型:DeepSeek、Gemma 和 Qwen)组成的法庭。
以下是流程是如何运作的:
- 审判: 当一个新的项目从 Wikidata 到达时,系统会将该项目展示给三位 AI 法官。
- 证据: 法官们会看到该项目的名称、一段简短的描述、一些关键词以及一段文章摘要。
- 判决: 每位法官都会询问:“这是一个真正的数学概念吗?”他们投出 是 或 否 的票,并给出置信度评分。
- 多数原则: 如果三位法官中有两位投了“是”,该项目就会留在数学书架上。如果两位投了“否”,它就会被丢弃。
他们是如何测试的
作者需要知道他们的 AI 法官是否真的胜任这份工作。他们运行了几个测试:
“简单”测试(正向对照): 他们选取了 1,000 个已知是数学的项目,因为这些项目带有特殊的“MathWorld” ID 标签(就像一枚金质认证印章)。他们要求 AI 法官对这些项目进行分类。
- 结果: 法官们的准确率极高,正确识别了这些项目中 98.2% 的数学项。即使作者隐藏了“MathWorld”标签,让法官无法通过寻找“印章”来作弊,法官们仍然几乎每次都能正确识别。这证明了法官们是在阅读内容,而不是仅仅在寻找捷径。
“困难”测试(负向对照): 他们选取了 500 个关于物理学的项目(例如“开普勒轨道”或“熵”)。
- 结果: 对于大多数项目,法官们正确地回答了“不,这不是数学”。然而,对于那 10 个处于物理与数学模糊边界上的项目(例如在两个领域中都使用的复杂方程),法官们自信地投了“是”。这表明法官们理解数学和物理经常重叠,而不是盲目地拒绝任何非纯数学的内容。
评审团在哪里产生了困惑
论文还观察了法官们出错或与“金标准”(MathWorld)产生分歧的少数情况。他们发现了三个主要的困惑原因:
- “描述空白”问题: 有时,一个 Wikidata 条目的描述仅仅是“数学概念”。这就像一本只有空白封面的书。由于缺乏上下文,法官们只能根据标题进行猜测。例如,他们认为“Wiener sausage”(维纳香肠/维纳过程)是食物,而“Fence”(篱笆)是建筑,而没有意识到这些其实是晦涩的数学概念名称。解决方法?在投票前给法官提供更多上下文。
- “过于严苛”的偏见: 其中一位法官(Gemma)非常严格。如果一个数学概念被用于现实世界(如生物学或工程学),这位法官会认为:“那是应用,而不是数学本身”,并投出“否”票。而其他法官则更加灵活,能够识别出它是数学。
- “范畴”不匹配: 有时,MathWorld 百科全书包含一些与数学相关的内容(如信号处理工具或历史趣闻),而 AI 法官觉得这些内容离“数学概念”太远,不足以被称为数学。这并不是法官的错误,而仅仅是对于如何严格定义“数学”存在意见分歧。
核心结论
论文得出结论,使用 AI 评审团投票机制 是过滤 Wikidata 噪声的一种切实有效的方法。它不需要通过大规模的有标签数据集来进行训练;AI 本身就已经知道数学听起来是什么样的。
通过使用这个系统,Mathswitch 可以自动清理其图书馆,保留真正的数学概念,同时剔除非数学的垃圾,并能从错误中学习,从而变得越来越好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。