A Pathway for Assessing Grey Literature: Leveraging AI to Extract Conference Metadata and Organiser Information from Calls for Papers
本文介绍了 COCI,这是一个利用大语言模型来自动从非结构化的征稿启事(Calls for Papers)中提取并结构化细粒度元数据的 AI 框架,从而实现对此前被忽视的灰色文献进行系统的元科学分析。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
科学常被想象成一叠叠整齐摆放在图书馆书架上的完结书籍,研究人员通过阅读已发表的内容来研究过去。然而,大量重要的知识存在于这些正式渠道之外。这被称为“灰色文献”,是指那些从未进入标准期刊的报告、工作论文和文档。在这些文献中,最至关重要的是“征稿启事”(calls for papers),即邀请研究人员向即将举行的会议提交作品的公告。这些文档是科学界的早期预警系统,在研究成果被撰写成最终文章之前,就揭示了新的趋势和新兴领域。然而,由于这些公告散落在网络各处,格式混乱且不统一,导致大规模研究它们几乎变得不可能。传统的计算机工具难以读取它们,这在我们的理解如何形成和演化科学共同体方面留下了巨大的空白。
为了填补这一空白,一个研究小组开发了一个名为 COCI 的新系统,该系统利用先进的人工智能来阅读并组织这些混乱的公告。该系统充当数字档案管理员的角色,将会议邀请的原始、非结构化文本转化为一份干净、有序的事实列表。它能识别活动的名称、年份和地点,以及最重要的——负责运作的人员。它不仅仅是列出姓名,还能弄清楚这些人是谁、他们隶属于哪些机构,以及他们扮演的具体角色,例如组织研讨会或负责宣传。通过这样做,该系统将一堆杂乱的文本转化为科学家可以实际用于分析研究格局的结构化数据库。
研究人员通过向该系统输入来自不同领域的四十份不同的会议公告来测试该系统,涵盖了从计算机科学、工程学到牙医学和考古学的广泛领域。目标是观察该系统是否能够应对互联网的复杂现实——在互联网上,一个会议可能会在简单的段落中列出其组织者,而另一个会议则可能将信息埋在复杂的表格中。该系统成功地从所有四十份文档中提取了关键细节。它识别出了会议系列、具体届次以及地理位置。它还提取了筹备委员会中每个人的姓名,并将其与公开的科学记录相链接,以验证其身份和所属机构。这一过程使系统能够区分同名同姓的不同人员,并确认他们目前代表哪所大学或组织。
该系统最显著的成就之一是其理解这些会议主题覆盖内容的能力。当会议公告列出其感兴趣的领域时,通常会使用非正式语言或独特的短语。该系统将这些内容转化为标准的科学概念,在公告的随性语言与全球研究人员使用的正式词汇之间搭建了一座桥梁。它还将会议名称与现有的全球数据库进行匹配,确保即使名称略有不同,或者该会议多年来曾以各种名称举办,该活动也能被正确识别。这在更广泛的科学世界中为该活动创建了一个可靠的地图。
然而,研究人员谨慎地指出,该系统并不完美,需要人工监督来纠正其错误。在一个测试案例中,由于原始文本未注明各自的隶属关系,系统错误地假设筹备委员会的每位成员都属于同一所大学。研究人员在系统中建立了一个安全检查机制来捕捉此类错误,因为他们意识到整个委员会都来自单一机构的可能性极低。在另一个案例中,由于数据库本身包含冲突信息,系统将一名研究人员匹配到了错误的个人。这些例子表明,虽然该工具功能强大,但它仍然依赖于其访问的数据质量以及所遵循规则的逻辑。
这项工作的终极目标是将科学分析的重心转向这些非传统事件。通过使系统性地研究征稿启事成为可能,该系统为理解研究共同体如何从基层建立起来打开了大门。它允许在趋势出现在正式期刊之前对其进行追踪,并提供了一种方法,去认可那些组织并塑造这些活动、但在传统指标中往往被忽视的众多贡献者。研究人员已将他们的工具作为开源项目向公众开放,邀请他人使用并改进它。这种方式暗示了一个未来:人们不仅能看到经过润色的最终结果,还能看到科学活动的完整、多样且全貌,即发现过程本身那动态且不断演进的过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。