Targum - A Multilingual New Testament Translation Corpus
本文介绍了名为"Targum"的多语言新约翻译语料库,该语料库汇集了来自英语、法语、意大利语、波兰语和西班牙语五种语言的 651 个译本(含 334 个独特版本),通过标准化元数据标注解决了现有语料库重广度轻深度的问题,为翻译历史的定量研究提供了支持多层次分析的丰富资源。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇文章介绍了一个名为 Targum 的新项目,你可以把它想象成建造了一座巨大的“圣经翻译博物馆”。
在计算机语言处理(NLP)的早期,人们把《圣经》当作一种“万能胶水”,因为它的每一节经文在不同语言里都能对应上,非常适合用来训练机器翻译。但现在,随着超级强大的 AI 模型出现,普通的《圣经》文本量太小了,就像试图用一杯水去填满游泳池,已经不够用了。
于是,研究者们(来自波兰克拉科夫 AGH 理工大学)决定换个思路:不再把《圣经》当作训练 AI 的“饲料”,而是把它当作一个值得研究的“宝藏”。他们想看看,几百年来,不同国家的人是如何用不同的方式翻译同一本书的,这背后反映了怎样的文化和历史变迁。
为了做到这一点,他们创建了 Targum 语料库。以下是用通俗语言对这篇论文核心内容的解读:
1. 核心概念:从“广度”转向“深度”
以前的数据库就像超市的货架,为了展示多样性,每个国家只放一两瓶啤酒(翻译版本)。虽然种类多,但你看不到细节。
Targum 则像是一个“精酿啤酒厂”的档案室。他们只关注 5 种语言(英语、法语、意大利语、波兰语、西班牙语),但在每种语言里,他们收集了极其丰富的版本。
- 以前:英语可能只有 1 个版本。
- 现在:英语有 194 个独特的版本(总共收集了 390 个,因为有些网站重复收录了)。
- 比喻:这就像以前你只能看到“苹果”这个大类,现在你能看到“红富士”、“国光”、“青苹果”、“蛇果”等几百种具体的苹果,甚至能分辨出它们是哪一年、哪个果园、哪个批次生产的。
2. 他们是怎么做的?(像侦探一样工作)
收集这些文本并不简单,因为互联网上的数据很乱。
- 第一步:全网搜罗。他们像蜘蛛一样,从 12 个不同的在线圣经图书馆和 1 个旧数据库里“抓取”了 651 个新约译本。
- 第二步:去伪存真(核心难点)。这是最像侦探工作的部分。同一个翻译版本(比如著名的《钦定版圣经》KJV),在不同网站上可能有不同的名字,或者出版年份写错了。
- 研究者们没有依赖 AI 自动判断(因为 AI 经常搞混细微差别),而是人工像整理家族族谱一样,给每个版本贴上“身份证”。
- 他们确定了:这是哪个版本?是哪一年修订的?是公版(免费)还是受版权保护?
- 比喻:就像你在整理一堆老照片,虽然照片背面写的名字不一样,但通过比对细节,你确认它们其实是同一个人、同一天的同一张底片,于是把它们归为一类。
3. 这个博物馆有什么用?
有了这个深度数据库,研究人员可以做以前做不到的事情:
- 微观分析(像显微镜):
你可以专门研究“钦定版圣经”这个家族。看看从 1611 年到现在,它的语言是怎么一点点变动的?是变得更通俗了,还是更严肃了?这就像观察一棵树的年轮,记录历史的变迁。 - 宏观分析(像望远镜):
你可以把 5 种语言放在一起对比。比如,研究发现法语的翻译通常比波兰语的翻译要长一些。为什么?可能是因为法语习惯多用冠词和介词,而波兰语因为格变化丰富,用词更精简。这反映了语言本身的性格,而不仅仅是翻译者的喜好。 - 给新翻译“定位”:
如果今天有人翻译了一本新的《圣经》,我们可以把它放进这个数据库里,看看它和谁最像?是像传统的保守派,还是像现代的动态意译派?这就像给新来的学生做一个“性格测试”,看看他属于哪个班级。
4. 一些有趣的发现
- 时间分布:虽然他们收集了从 16 世纪宗教改革时期开始的古老版本,但最近 50 年的翻译版本最多。这说明人们对《圣经》的翻译热情从未减退,而且风格越来越多样。
- 相似性:同一个语言家族里的版本(比如都是英语的)彼此非常像(相似度 95% 以上),但不同语言之间(比如英语和波兰语)的相似度就低很多。这就像一家人说话口音很像,但和邻居说话就完全不一样了。
- 越来越“花哨”:研究发现,越现代的翻译,彼此之间的差异越大。以前的翻译大家比较守规矩,现在的翻译风格百花齐放,有的直译,有的意译,有的甚至像讲故事一样。
5. 伦理与版权
研究者非常尊重版权。
- 那些公版(版权过期)的文本,大家随便下载研究。
- 那些还在版权期内的文本,他们不会直接公开全文,但会公开“指纹”(比如数学向量、相似度分数)。如果你需要研究某个受版权保护的版本,可以联系作者申请。这就像你可以看博物馆的展品目录和高清照片,但如果想看真迹,需要走正规申请流程。
总结
Targum 不仅仅是一个数据库,它是一座连接语言、历史和神学的桥梁。它告诉我们,翻译不仅仅是把一种语言变成另一种语言,更是一场跨越几个世纪的对话。通过这个“深度”数据库,我们不仅能看到文字的变化,还能听到不同时代、不同文化背景下,人们内心对同一本书的不同回响。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。