A Fine-Tuned BERT Classifier for Personal-Letter Titles in Late-Ming and Early-Qing Collected Works
本文介绍了 Lepton,这是一个基于三十三位晚明至清初文人手标五、四三八个标题进行微调的 BERT 分类器,该模型成功区分了个人书信与易混淆的序言,并已通过中国传记数据库部署,为明代书信平台识别了约五万五千封书信。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正漫步于一座宏伟的古老图书馆,馆内藏书数千。这些并非普通书籍,而是收录了16世纪末至18世纪初著名中国学者著作的合集。每本书都附有目录,列有长长的标题清单。其中有些标题属于诗歌,有些属于官方奏报,还有些则属于私人书信。
问题在于,图书馆规模过于庞大,任何人都不可能逐一阅读所有标题以找出其中的书信。你需要一位图书管理员,能够迅速浏览清单,并即刻指出:“这是一封书信”,或“这是其他内容”。
“形似”难题
这项工作中最困难的部分,并非识别那些显而易见的书信,而是将私人书信与赠别序言(即某人离城时发表的致辞)区分开来。
这就像试图区分一条“你好”的短信与一篇“再见”的致辞。
- 旧方法(正则表达式):历史学家曾使用一条简单规则:“若标题以‘书’字结尾,便是书信。”
- 缺陷:这好比说“若短信以句号结尾,便是情书”。这种方法会漏掉91%的真实书信,因为大多数古代书信标题并不以该特定字符结尾。它们常以“答”或“寄”等动词开头。
- 第二种旧方法:“若标题以‘答’等动词开头,便是书信。”
- 缺陷:这会引发过多误报。赠别序言同样以“答”或“寄”等动词开头。这好比一名保安拦住所有说“你好”的人,即便他们只是在向朋友道别。
解决方案:“Lepton”(智能图书管理员)
作者罗青(Queenie Luo)构建了一位名为Lepton的数字图书管理员。
Lepton 是一款基于BERT技术的计算机程序(可将其想象为一位超级聪明的学生,已阅读数百万现代汉语句子并掌握了词语搭配规律)。它不再仅仅寻找标题开头或结尾的某个特定字符,而是审视整体语境。
- 学习方式:作者向 Lepton 提供了一份训练手册,其中包含约5,400个经人工标注的标题。部分为书信,部分为赠别序言。Lepton 从中学习模式:“啊,当我看到‘答’后接人名时,这通常是书信;当我看到‘寄’后接‘序’时,这便是致辞。”
- 结果:Lepton 在这项特定任务上表现极为出色。测试中,它几乎完美无缺:它从未将致辞误判为书信(精确度达100%),且仅漏掉了极少数真实书信。
Lepton 能做什么与不能做什么
了解该工具的设计用途至关重要,正如知道锤子用于钉钉子,而非拧螺丝。
- 它能做的:审视目录中的标题,并判断:“这是私人书信还是赠别序言?”
- 它不能做的:
- 不阅读书信的实际内容(仅查看标题)。
- 不告知书信的收件人是谁,或写作时间。
- 对明清两代之前或之后的文本效果不佳(其训练专门针对该时代)。
- 无法区分官方公文与私人家书;它仅能识别它们属于“书信”类别。
现实世界的影响
作者已将 Lepton 应用于中国历代人物传记资料库(CBDB)。借助该工具,研究人员得以扫描数千部书籍,并自动找出约55,000封私人书信。
这有助于构建明代书信平台,这是一个数字资源,使历史学家能够绘制出500年前学者的社交网络图。如今,他们无需耗费数年逐字阅读标题,而是拥有了谁致信谁的完整图谱,这一切都归功于这位学会了区分“你好”与“再见”的数字图书管理员。
唯一的弱点
Lepton 并非魔法。在测试中,它在六个特定标题上失败了。这些标题非常简短、怪异,不符合常规规则(例如仅包含人名)。由于 Lepton 是从“正常”示例中学习,面对这些特例时它感到困惑,误将它们判断为致辞。这提醒我们,即便是智能计算机,在面对打破常规的事物时也可能束手无策。
简而言之:该论文描述了一种专用人工智能工具的构建过程,它如同一位受过高度训练的图书管理员,能够瞬间从数千个古代书籍标题中筛选出私人书信,解决了简单关键词搜索无法处理的难题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。