Creating and Evaluating Figurative Language Dataset for Sindhi
本文介绍了 SiNFluD,这是一个源自多样化资料并由母语者标注的用于信德语比喻语言分类的新颖基准数据集,并评估了多种预训练模型,其中 XLM-RoBERTa-XL 取得了最佳性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,信德语就像一座浩瀚而古老的图书馆,里面充满了动人的故事、诗歌和日常对话。长期以来,试图“阅读”这座图书馆的计算机(自然语言处理)只能理解那些平实、字面的事实。如果有人说“太阳在微笑”,计算机就会认为太阳真的长着一张嘴并且在咧嘴笑。它错过了重点:作者是在使用隐喻来描绘一个美好的早晨。
本文旨在构建一本特殊的“训练手册”,教导计算机如何理解信德语中的这些隐含意义。以下是他们如何做到的故事,简化如下:
1. 问题:计算机错过了“笑话”
人类语言充满了各种技巧。我们使用习语(如“倾盆大雨”)、谚语(蕴含智慧的古老格言)、隐喻和明喻(使用“像”或“如”进行的比较)。这些都不是字面意思。
对于像英语这样的语言,我们拥有庞大的此类技巧词典。但对于信德语——一种在巴基斯坦和印度由数百万人使用、拥有丰富诗歌和苏菲传统的语言——却几乎没有针对这些非字面表达的数字化地图。这就像试图教一个学生阅读一部复杂的小说,却不给他们一本难词的字典。
2. 解决方案:构建"SiNFluD"数据集
作者创建了一种名为SiNFluD(信德语非字面修辞语言数据集)的新资源。你可以把它想象成一套经过精心整理的大规模抽认卡。
- 收集卡片:他们并非凭空捏造。他们深入挖掘旧书籍、博客、社交媒体帖子以及像 Wikisource 这样的网站,寻找信德人使用这些修辞表达的真实例子。
- 人工介入:两位信德语母语者充当了“教师”。他们阅读了每一个句子并进行了标注:
- 字面 (0):“猫在垫子上。”(plain truth,plain truth)。
- 非字面 (1):“他有一颗石头般的心。”(并非真的是石头,而是指冷漠无情)。
- 他们还将非字面的例子分入了四个类别:习语、谚语、隐喻和明喻。
- 双重检查:为了确保他们意见一致,他们对比了各自的工作。他们的吻合度达到了 81%,这是一个非常高的分数,意味着这些“抽认卡”是可靠的。
- 清理:他们移除了重复项并修正了格式错误,最终得到了约 4,451 个干净的示例。
3. 测试:教导计算机
一旦拥有了抽认卡,他们就需要看看现代人工智能能否从中学习。他们将此视为一场计算机的“学校考试”。
- 学生:他们测试了四种不同的“学生”人工智能模型:
- mBERT:一名标准的跨语言学生。
- XLM-RoBERTa:一名更高级的学生,读过更多的书。
- XLM-RoBERTa-XL:“超级学生”,拥有巨大的大脑(更多参数),阅读过超过 100 种语言。
- SetFit:一名“速成学习者”,旨在用极少的样本(少样本学习)获得良好的结果。
- 考试:他们使用一种称为“交叉验证”的方法,将数据划分为训练集和测试集(就像模拟测验和期末考试),以确保结果不仅仅是运气。
4. 结果:谁通过了?
结果相当令人鼓舞:
- 获胜者:XLM-RoBERTa-XL 模型(超级学生)得分最高,正确识别非字面语言的比例约为 92.27%。
- 亚军:其他模型表现也非常出色,得分在 90% 到 91% 之间。
- 启示:这表明该数据集是高质量且平衡的。这也表明,更大、更先进的人工智能模型更能理解信德语中微妙的“含义层次”,但即使是高效的“速成学习者”(SetFit)的表现也令人惊讶地出色。
总结
简而言之,作者为信德语构建了第一套主要的“隐含意义词典”。他们证明,有了这一新工具,计算机终于开始明白:当信德人说一些富有诗意或习语的话时,他们并非在胡言乱语——他们是在用深度和文化进行表达。这为研究人员未来为信德语构建更好的翻译工具、聊天机器人和情感分析器奠定了坚实的基础。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。