A Word-Level Digital Reader of the Prasthanatrayi with Sankara's Bhasya: Corpus, Method, and an Open, Offline Reading Aid for the Advaita Vedanta Canon
本文介绍了一种开放、全离线、单文件 HTML 数字阅读器,用于阅读《三立》(Prasthanatrayi)及商羯罗(Sankara)的注释书,该阅读器通过结合基于规则的分词、词典查询以及经人工审核的 LLM 辅助验证的混合流水线,提供了可点击的词级形态分析和索引检索功能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图阅读一本古老且极其晦涩难懂的书,它使用一种单词之间从未留有空格的语言编写。相反,单词像河流一样汇聚在一起,并根据相邻的词汇不断改变形状和形态。此外,作者经常将多个概念压缩进单个巨大的“词块”中(就像一个塞满了三套不同衣服的行李箱)。
这就是阅读吠檀多不二论(Advaita Vedānta)——一个主要的印度哲学学派——所面临的挑战。其核心文本(Prasthānatrayī)配有学者**商羯罗(Śaṅkara)**的大量注释。对于现代学生甚至资深专家来说,试图弄清楚一个词在哪里结束、下一个词从哪里开始,就像是在蒙着眼睛解开一团缠绕在一起的耳机线。如果你无法拆分单词,你就无法在字典中查阅它们,其含义也将隐匿不见。
Tamal Maharaj 开发了一个数字工具来解决这个问题。你可以将其想象成一把用于阅读这些古老文献的**“智能手电筒”**。以下是它的工作原理,通过简单的分解来解释:
1. 问题所在:“词语汤”(The "Word Soup")
在梵文中,单词会融合在一起。例如,两个单词可能会合并成一个长字符串。
- 旧方式: 你必须记忆复杂的规则,手动将字符串拆回单个单词,寻找每个词的词根,并搞清楚其语法。这需要多年的训练。
- 新工具: 你在电脑上打开一个单一文件(无需联网)。你点击文本中的任何一个词,一个弹出窗口会立即告诉你:
- 拆分情况: 这个融合词是如何拆解开的。
- 语法信息: 它是名词?动词?属于哪种格?
- 含义: 一个简单的英文定义。
2. “神奇字典”(索引/Concordance)
通常,如果你在计算机中搜索一个词,你必须输入与页面上完全一致的拼写。但在梵文中,页面上的单词往往是真实单词的“伪装版”。
- 类比: 想象你在图书馆里搜索“猫(Cat)”,但书里只列出了“小猫(Kitty)”、“猫科动物(Feline)”和“喵喵叫(Meow)”。普通的搜索将一无所获。
- 解决方案: 这个工具知道每一个单词的“真实名称”(即字典中的词头)。如果你搜索“自我(Self)”(即词根),该工具能找到这个词出现的每一次情形,即使它被伪装成“自我的”、“向着自我”或者隐藏在一个巨大的复合词之中。它将整本书变成了一张可搜索的地图。
3. 它是如何构建的:“侦探团队”
作者并没有仅仅让计算机去猜测。他建立了一个多步骤的“侦探团队”以确保准确性:
- 第一步:规则手册专家。 首先,系统会检查一个庞大的、预先编写好的已知词形列表(类似于一个拥有 927,000 个条目的字典)。如果该词在列表中,则会瞬间解决。
- 第二步:AI 侦探。 如果单词很棘手或未知,一个强大的 AI(大语言模型)就会介入进行最佳猜测。
- 第三步:怀疑论者。 精彩的部分在于:第二个 AI 被专门雇佣来与第一个 AI 进行辩论。它的唯一任务就是试图找出第一个 AI 猜测中的错误。如果第一个 AI 无法为自己的答案辩护,它就会被标记出来。
- 第四步:人类编辑。 被“标记”出的难题会被发送给真正的专家(一位梵文学者)。他们修正错误。
- “神奇叠加层”: 一旦人类修正了一个词,该修正就会被保存到一个特殊的层中。如果计算机重新构建该工具,它会再次应用人类的修正。这意味着随着更多学者使用它,该工具会变得越来越聪明、越来越准确,而且任何修正都不会丢失。
4. 为什么它很重要
- 对于学生: 它消除了准入门槛。你不需要成为语法大师就能阅读这些基础文本;你只需要点击即可。
- 对于学者: 它充当了“索引(Concordance)”。你不需要通读全书来寻找某个概念的所有提及,你只需搜索该概念的词根,即可瞬间看到它在数千页内容中的每一次出现。
- 易用性: 整个工具只是一个单一的文件。你不需要服务器、应用程序安装或互联网连接。你可以带着它上飞机,把它放在 USB 驱动器里,在任何地方使用它。
总结
这篇论文展示了古代智慧与现代技术之间的桥梁。它承认计算机可能会犯错,因此使用了一种“人类参与(human-in-the-loop)”的系统来确保最终产品的可靠性。它将曾经被复杂的语法之墙所阻隔的文本,转化为了一个开放的、交互式的、可供任何人点击学习的可搜索资源。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。