← 最新论文
💬 NLP

PERCEPT: A Corpus for POS Tagging and Analysis of Persian-English Code-Mixing

本文介绍了 PERCEPT,这是首个带有通用依赖(Universal Dependencies)词性标注的大规模波斯语-英语代码混合语料库,并提出了一个由大语言模型辅助的标注框架,以及通过全面的语言学分析揭示了社交媒体中代码混合现象的平台特定模式。

原作者: Ghazal Kalhor, Zahra Jafari, Amirarsalan Shahbazi, Behnam Bahrak

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Ghazal Kalhor, Zahra Jafari, Amirarsalan Shahbazi, Behnam Bahrak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一个巨大的、混乱的游乐场,来自世界各地的人们同时在那里大声叫喊、低声耳语和聊天。在这个游乐场里,许多人并不只说一种语言;他们把语言混合在一起,就像在制作奶昔时混合各种原料一样。这被称为“代码混合”(code-mixing)。这就是当某人可能用母语开始一句话,然后突然加入一个英语单词,因为那样感觉更自然,或者因为那是他们才知道的关于某个新设备的词汇。对于计算机来说,这是一场噩梦。如果计算机试图理解一个句子,它期望单词遵循严格的规则。但当语言变得混杂时,计算机就会感到困惑,就像一位厨师试图遵循一份食谱,却在烘焙蛋糕的过程中突然从公制杯量切换到了英制盎司量。为了教计算机如何处理这种混乱而有趣的现实,科学家们需要一本特殊的字典和一套规则——一个被称为“语料库”(corpus)的东西,向它们展示这些混合词是如何运作的。

欢迎来到 PERCEPT,这是一个全新的项目,它像是一个为喜欢在帖子中混入英语的波斯语使用者建立的、组织有序的巨大图书馆。研究人员(来自伊朗的一支由语言学家和计算机科学家组成的团队)注意到,虽然我们已经有了其他混合语言对的地图,但波斯语-英语的混合仍然是一片黑暗、未被探索的森林。他们想要建造一把手电筒,去照亮那里正在发生的一切。于是,他们从三个热门数字场所——X(原名 Twitter)、Instagram 和 Digikala(一个大型在线购物网站)中收集了 6,800 条帖子。他们不仅仅是收集单词;他们还使用了一个名为 Gemini 的超智能 AI 助手来充当侦探,为每一个英语单词(或用波斯字母书写的英语单词)标记其在句子中的“职责”。在语法中,这个职责被称为“词性”(Part-of-Speech)。这个词是一个名词(事物)?动词(动作)?还是形容词(描述)?该团队还要求 AI 猜测帖子在讨论什么主题,比如“购物”、“政治”或“有趣的迷因”。

令人兴奋的部分在于:该团队不仅建立了这座图书馆;他们还走进其中并开始阅读书籍,以寻找可以发现的模式。他们发现,当波斯语使用者混入英语时,他们主要使用名词(事物)。这就像是他们借用了英语中的“物体”,但在保留了波斯的“动作”和“描述”。例如,他们可能会说,“I bought a new laptop”(我买了一个新的笔记本电脑),其中“laptop”是借用的名词,但句子的其余部分保持为波斯语。然而,这种混合的“风味”会根据你所处的地方而改变。在购物网站 Digikala 上,人们混合了大量的品牌名称和产品型号(这些是特殊的名称,即“专有名词”)。在 X 上,他们混合了更多的动词(动作);而在 Instagram 上,他们则倾向于使用形容词(描述)。

研究人员还观察了这些混合词在句子中的“隐藏位置”。他们发现了一个令人惊讶的一致性:无论你使用哪个平台,混合词往往出现在句子的开头或中间,很少出现在句子的末尾。这就像说话者通过在早期加入英语单词来设定场景,然后再用波斯语完成想法。但最有趣的发现是关于“触发”现象。在 Digikala 上,如果有人使用了一个英语单词,他们极有可能紧接着使用另一个。这就像一旦你开始谈论某个特定品牌或产品,英语单词就会源源不断地涌现。这种情况在 Instagram 或 X 上并不常见。

最后,他们检查了哪些话题引起了最多的混合。不出所料,“工业与商业”以及“品牌与业务”这两个话题的语码混合程度最高。当人们谈论购物、科技或商业时,他们简直无法抑制地撒入一些英语术语。团队通过让专家进行人工抽样复核,确认了 AI 的工作成果,人类几乎在所有情况下都与 AI 的判断一致,证明了他们的新图书馆是可靠的。

简而言之,这篇论文不仅为我们提供了一个新的数据集;它还为我们描绘了一幅清晰的图景,展示了波斯语使用者是如何自然地融合语言的。它表明,虽然他们借用的词汇类型会随平台而变化,但他们混合的方式遵循着一种稳定的节奏。这张地图现在已向所有人开放,有助于构建更好的翻译工具、更智能的聊天机器人,以及更深入地理解我们在语言不断共舞的世界中是如何交流的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →