Darshana Graph: A Parallel Commentary Corpus for Comparative Indian Philosophy, with Stylometric and Exploratory Graph Analyses
本文介绍了 Darshana Graph,这是一个包含超过 125,000 条记录的独特平行注释语料库,涵盖了印度教、佛教和耆那教传统,能够实现直接的跨注释者比较,并通过对论证风格的文体统计分析以及用于提取和验证哲学关系的受限大语言模型流水线,证明了其效用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一座宏伟而古老的图书馆,其中几本基础性的著作被反复阅读和争论了一千年。在这座图书馆里,不同的学者群体(印度教徒、佛教徒和耆那教徒)对完全相同的经文撰写了注释。通常情况下,如果你今天走进一个数字图书馆,你会拿起一本书并阅读一位学者的见解。你永远不会看到其他学者的论点与原文并排呈现。
Darshana Graph 是一个改变这一现状的新型数字项目。它就像是在构建一个巨大的、组织有序的电子表格,其中每一条古代文本的每一句经文都是一行,而列中则填满了来自十八位不同历史学者的不同解读。
以下是研究人员所做的工作及其发现的简单分解:
1. 大规模集合(语料库)
研究人员收集了超过 125,000 条文本记录。
- “房间里的大象”: 大部分记录(约 92%)来自佛教的巴利三藏(Pali Canon)。可以把这看作是这座建筑宏大的基石。
- “特别之处”: 真正的魔力在于剩余的 8,500 条记录。这些是印度教和耆那教的文本,其中同一段原始经文被排列在一起,并与不同学派(如非二元论 Advaita、二元论 Dvaita 和耆那教)的注释进行对比。
- 为什么这很重要: 这就像拥有一个辩论转录文本,每个人都在引用规则手册中的完全相同的句子,但对它的解释却截然不同。这种对齐工作在如此大规模的层面上是前所未有的。
2. 分析一:“写作风格”侦探工作
研究人员并没有使用复杂的 AI 来猜测含义。相反,他们使用了简单的数学方法来衡量学者们是如何争论的,而不只是争论什么。他们观察了诸如:
- 他们引用原始经典的次数?
- 他们说“我的对手是错误的”的频率?
- 他们的句子长度?
他们的发现:
- 权衡关系: 他们注意到一个模式:那些大量引用原始文本的学者,往往较少反驳对手。反之,那些频繁反驳对手的学者,引用文本的次数则较少。这就像是两种不同的策略:“我赢是因为书上这么写的” vs “我赢是因为你的观点有缺陷”。
- “反驳”趋势: 在一个特定的思想流派(Dvaita 学派)中,他们观察到了一个有趣的趋势。该学派的创始人写下的反驳对手的内容很少。但随着时间的推移,该脉络中的后期学者写下了更多的反驳内容。这看起来就像是随着世代的更迭,这场辩论变得越来越激烈且具有防御性。
- 佛教文本: 即便是在仅限佛教文本的范围内,他们也发现有些文集写得像短小精悍的口号(如《法句经》),而另一些则是长篇累牍的散文。
3. 分析二:AI “关系映射器”
在第二部分中,他们使用了一个小型且智能的计算机程序(大语言模型),扮演着试图绘制思想关系图的图书管理员角色。
- 规则: 为了防止 AI 产生幻觉(编造事实),他们给了它一个严格的、预先批准的关系类型列表,例如“等同于(IS THE SAME AS)”或“不同于(IS DIFFERENT FROM)”。如果 AI 尝试使用列表之外的词汇,系统会自动将其剔除。
- 结果: 他们构建了一个“知识图谱”(一个连接思想的网络)。
- 重大发现: AI 正确识别了印度哲学中最大的历史性争端:人类灵魂(Atman)是否等同于终极实在(Brahman)?
- 一个学派说:“是的,它们是同一的。”
- 另一个学派说:“不,它们完全不同。”
- AI 完美地映射了这些分歧,清晰地展示了各学派基于文本的具体分歧点。
4. 诚实的“细则”(局限性)
作者非常坦诚地说明了他们的项目目前并不完美的地方:
- AI 并非完美: 有时 AI 会感到困惑,并在不确定时过度使用一个通用的标签(“是一个合格的侧面/IS A QUALIFIED ASPECT OF”)。
- 缺失的部分: 他们无法在数据中区分耆那教的两个主要分支,并且没有足够的数据来使用他们的新 AI 方法去比较同一学派内的不同学者。
- 无“真理”保证: 他们没有雇佣人类团队来检查每一个 AI 结果。他们进行了快速的抽检,但承认在完全信任这个图谱之前,它还需要更多的人类验证。
核心结论
这篇论文介绍了一个名为 Darshana Graph 的宏大新工具,它让我们能够首次将古代哲学辩论并排呈现。他们利用简单的数学展示了不同学者如何争论,并使用受控的 AI 绘制出不同学派在哪里产生分歧。
他们并不是声称已经解决了印度哲学的所有奥秘。相反,他们是在说:“这是数据,这是我们的发现,这也是我们犯过的错误。我们希望这能帮助他人进行更深入的研究。”他们已经发布了所有的数据和代码供所有人使用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。