← 最新论文
💻 computer science

Code-Mixed Corpora for Indian Social Media: Baselines and Insights for Hinglish Language Identification

本文介绍了一种用于词元级印地语-英语混合语(Hinglish)语言识别的轻量级字符级 TF-IDF 和逻辑回归基准模型,该模型在 COMI-LINGUA 数据集上实现了 95.92% 的准确率,比多语言模型高出约 7%,同时提供了关键的误差分析以及未来印度包容性语言技术的发展路线图。

原作者: Kavita Srivastava

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Kavita Srivastava

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一个巨大且繁忙的全球城市广场。在这个广场上,来自不同国家的人们正在聊天,但其中许多人说着一种独特的混合方言。在印度,这种方言被称为“Hinglish”,它是印地语和英语的一种生动混合,通常使用罗马字母(即我们用于英语的相同字母)进行打字。它是表情包、WhatsApp 群组和社交媒体评论中的语言。然而,教计算机理解这种混合语言,就像试图教机器人去分类一堆混杂在一起的乐高积木,其中一些积木上涂着印地语单词,一些是英语,还有许多积木因为不同人的拼写方式不同而显得模糊不清。这个研究领域被称为自然语言处理(NLP),而弄清楚一个句子中哪个词属于哪种语言的具体任务被称为语言识别(LID)。这很重要,因为如果计算机不能理解现实中人们是如何说话的,它们就无法为每个人构建有用的工具,比如翻译器或搜索引擎,尤其是在像印度这样语言多样化的地区。

这篇论文解决了教计算机识别 Hinglish 文本中印地语单词和英语单词之间差异这一棘手问题。研究人员注意到,目前大家都在使用的那些高级、庞大的 AI 模型(如 mBERT 和 XLM-R)实际上在处理这项特定任务时表现挣扎。这些大型模型主要是在干净的单语言书籍上训练的,它们会被社交媒体中那种拼写不断变化以及句子中途切换语言的混乱现实所迷惑。为了解决这个问题,作者并没有制造一个更大、更复杂的怪物;相反,他们构建了一个简单、轻量级的工具。他们使用了一个名为 COMI-LINGUA 的数据集,该数据集包含超过 10 万个经过专家标注的 Hinglish 示例,来训练一个直观的系统。这个系统观察微小的字母块(字符 n-gram),并使用一种基础的数学技术——逻辑回归,来猜测一个单词是印地语还是英语。

结果出人意料地有效。这个简单的模型在验证集上达到了 96.06% 的准确率,在测试集上达到了 95.92%,宏 F1 分数(macro-F1 score)为 0.9509。这比那些庞大、复杂的跨语言模型表现要高出约 7%。作者指出,对于这项特定的工作,并不需要“大锤”式的方法;一把精准、设计良好的手术刀反而效果更好。然而,他们也发现该系统并非完美无缺。通过误差分析,他们发现了仍然会让计算机感到困惑的三件事:在两种语言中看起来相同的短单词(如“is”或“me”)、同一个印地语单词有多种不同的拼写方式(如“acha”、“achha”或“achaa”),以及被借用到印地语句中的英语单词(如“party”或“school”),当周围文本是印地语时,这些单词会使系统感到困惑。论文总结道,虽然基于字符的简单模型是一个强大且可复现的起点,但未来的工作需要专注于理解整个句子的上下文,并处理这些混乱的拼写变化,以真正掌握 Hinglish。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →