← 最新论文
💬 NLP

Benchmarking Large Language Models on Reference Extraction and Parsing in the Social Sciences and Humanities

该论文针对社会科学和人文学科中引用提取与解析面临的复杂挑战(如多语言、脚注嵌入及历史惯例差异),提出了一个包含三个数据集的统一基准,通过评估监督基线(GROBID)与多种大语言模型在结构化输出任务中的表现,揭示了微调与混合部署策略在提升解析鲁棒性方面的关键作用。

原作者: Yurui Zhu, Giovanni Colavizza, Matteo Romanello

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Yurui Zhu, Giovanni Colavizza, Matteo Romanello

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给一群“超级智能助手”(大语言模型,LLM)和一位“老练的图书管理员”(传统工具 GROBID)举办一场学术引用提取大赛

比赛的目的很简单:看看谁能更准确地从复杂的学术论文中,把那些密密麻麻的参考文献(比如作者、书名、年份)像剥洋葱一样一层层剥出来,整理成整齐的表格。

🏆 比赛背景:为什么这很难?

想象一下,你要整理图书馆的藏书目录:

  • 简单的情况:所有的书都在最后列了一个清晰的清单,全是英文,格式统一。这就像在超市买标准包装的牛奶,很容易。
  • 复杂的情况(社会科学和人文学科,SSH):参考文献可能藏在文章的脚注里(像藏在书页夹缝中的小纸条),有的用德语写,有的用意大利语,有的缩写得像密码(比如"Ebd."代表“同上”),有的甚至混着几种语言。这就像让你在一堆杂乱无章、写满不同语言涂鸦的旧手稿里,把借书条找出来。

以前的测试大多只考“简单情况”,所以大家以为现在的 AI 已经很厉害了。但这篇论文说:“别高兴太早,真正的挑战在那些‘乱糟糟’的旧手稿里。”

🥊 参赛选手

  1. 老将 GROBID:这是一位训练有素的“图书管理员”。他非常擅长处理格式标准、排版整齐的英文文档。但他有个缺点:一旦遇到脚注满天飞、语言混杂的“乱局”,他就容易晕头转向,甚至把书弄丢。
  2. 新秀 LLMs(大语言模型):比如 DeepSeek、Qwen、Mistral 等。它们像是一群博学的年轻学者,读过海量书籍,理解力极强,能读懂各种语言和奇怪的格式。但它们有个毛病:有时候太自信,会编造格式,或者因为内容太长而“断片”(输出截断)。

📊 比赛过程与发现

研究人员准备了三套试卷(数据集),难度层层递进:

  1. 找出来(提取):把参考文献从文章里圈出来。
  2. 拆解开(解析):把圈出来的内容拆成“作者”、“标题”、“年份”等字段。
  3. 一条龙(端到端):从原始 PDF 文件直接开始,直到输出整理好的表格。

主要发现:

  • “找出来”很简单:只要模型稍微聪明一点,就能把参考文献从文章里“抓”出来,大家表现都很好。
  • “拆解开”是难点:这才是真正的瓶颈。面对脚注和乱码,老将 GROBID 经常出错,而聪明的年轻学者(大模型)表现更好,尤其是那些经过专门训练的模型。
  • 脚注是噩梦:当参考文献藏在脚注里时,所有系统都会变笨,但大模型比老将更抗造。
  • 多语言是加分项:在德语、意大利语混杂的文档里,大模型完胜。

🛠️ 两个“作弊”小技巧(提升策略)

为了让这些年轻学者表现更好,研究人员用了两个绝招:

  1. LoRA 微调(给模型“开小灶”)

    • 比喻:与其让学者去读整个图书馆的书,不如给他一本专门针对“脚注和乱码”的速成手册,让他专门练习怎么整理这种乱糟糟的引用。
    • 效果:哪怕只给很少的练习材料,模型在处理这种特殊任务时,准确率也会大幅提升,甚至超过老将。
  2. 分段处理(化整为零)

    • 比喻:如果让学者一次性读完一本 500 页的厚书并整理笔记,他很容易累晕(输出截断)。不如把书切成小段,每页整理一次,或者只让他看可能有引用的那一页。
    • 效果:虽然慢了一点,但准确率大大提升,而且不容易出错。

🚀 最终结论:混合双打才是王道

这篇论文并没有说“大模型赢了,传统工具该退休了”,而是提出了一个聪明的“路由”策略

  • 如果文档是标准的、英文的、排版整齐的(比如现代科学期刊),直接交给老将 GROBID。他速度快、便宜、稳定。
  • 如果文档是脚注满天飞、多语言混杂、排版混乱的(比如历史学、社会学论文),就把任务转交给经过“开小灶”训练的大模型

一句话总结
在处理学术引用时,不要试图用一把钥匙开所有的锁。最好的办法是建立一个智能调度员:遇到简单的活,让老专家干;遇到复杂的“烂摊子”,让经过特训的 AI 去搞定。这样既快又准,还能把整个人文社科的文献库整理得井井有条。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →