Fast and Accurate Quotation Attribution in Literary Texts
本文介绍了“联合评分”(joint scoring),这是一种高效的基于编码器的方法,它在文学文本中将引文归于说话者的任务上实现了最先进的准确率,同时在速度上显著优于标准方法和大语言模型,并发布了 ModernBookNLP 工具包以促进其应用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名侦探,正走在一座充满尘埃、藏有数千本旧小说的巨大图书馆里。你的任务是破解一个特定的谜题:每当故事中的人开口说话时,你都必须弄清楚究竟是谁说的。有时文本很简单,比如“约翰喊道”,但有时却很棘手,比如“他说”,甚至只是一个没有名字附着的引言,让你只能根据对话的流向来猜测。这种侦探工作被称为“引语归属”(quotation attribution),对于任何想要用计算机研究文学的人来说,这都是一件大事。如果计算机无法分辨谁在说话,它就无法绘制出角色之间的友谊图谱,无法追踪情感在书中的变化,也无法理解特定人物独特的语调。长期以来,计算机在这方面表现得很差。旧的方法就像一次只检查一个线索,虽然快,但经常出错。而新的、超级智能的方法使用的是巨大的人工智能大脑,它们极其准确,但运行起来需要极高的计算能力,以至于在分析整座图书馆时几乎毫无用处。大问题在于:我们能否制造出一个既超级聪明又超级快速的侦探?
这篇论文介绍了一种名为“联合评分”(joint scoring)的新方法,它扮演着一位才华横溢且高效的侦探角色来解决这个问题。该系统不是孤立地看待每一段引言,而是同时观察故事的一个完整片段,就像在做出一个判断之前先读完小说的一整页。他们发现,通过这样做,计算机可以记住对话中较早之前的说话者,即使这些角色在文本中相隔很远。当他们在包含22本经典英文小说、超过35,000条引言的集合上进行测试时,他们的新系统在94.5%的情况下答对了。这是一个新的纪录,打破了之前的最佳方法。更令人印象深刻的是,他们的系统比标准的快速方法快20倍,比那些巨大的AI大脑快1,000多倍,而且还能在标准的显卡上运行。
秘诀不仅在于计算机变得更聪明了,还在于它的思考方式。研究人员发现,旧的快速方法就像一个读了五分钟就会忘掉刚才读了什么的优等生。它们会看一段引言,并试图在不记得上下文的情况下猜测说话者。然而,新的“联合评分”方法会将整个上下文窗口同时记在脑海中。事实证明,计算机的基础大脑(一个被称为ModernBERT的模型)本身就具备一种天赋,能够将“他”或“她在”之类的代词与正确的人联系起来,即使是在长距离的情况下。旧的方法通过强迫计算机逐一做出决策,无意中破坏了这种天赋。新方法保留了这种自然的能力,使系统能够连接起长对话中的点滴。
这篇论文还反驳了该领域的一些常见观点。长期以来,研究人员认为计算机之所以在处理这类任务时失败,主要是因为它们无法很好地处理代词和昵称,因此他们试图忽略这些内容,只寻找全名。这篇论文指出,这是一个错误。他们的实验表明,包含代词和昵称实际上会让系统变得更加准确,尤其是在说话者没有被直接命名这类棘手的情况下。他们还排除了“需要超级昂贵、庞大的AI才能获得好结果”这一观点;他们规模更小、速度更快的模型在速度和准确性方面都超越了巨大的AI。
为了证明他们的系统在现实世界中(而不只是在受控实验室中)有效,他们测试了另外100个书本片段,在这些片段中,计算机并没有角色名称的参考列表。即使在事先不知道角色列表的情况下,他们的系统在寻找说话者的准确度上,比目前文学研究者使用的标准工具提高了近10个百分点。作者们建议,这种方法为快速且准确地分析海量书籍集开了门,将过去缓慢且易错的任务变成了可以高效完成的任务。他们甚至发布了他们的新工具,名为ModernBookNLP,希望帮助更多人探索文学中隐藏的模式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。