← 最新论文
🤖 AI

Hate Speech Classification In Roman Urdu: A Comparative Study On Parameter Efficient Fine-Tuning And Prompt Engineering

本研究比较了在罗马乌尔都语(Roman Urdu)这一低资源、非正式语境下,零样本推理(zero-shot inference)、参数高效微调(LoRA)、提示词微调(prompt tuning)以及提示词工程(prompt engineering)在仇恨言论分类方面的有效性。

原作者: Toneema Zubair

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Toneema Zubair

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

互联网已成为一个巨大的全球性广场,来自各种文化的人们在这里分享他们的思想,但这个开放空间也使得有害言论以惊人的速度传播。检测这些被称为“仇恨言论”的有害信息对计算机来说是一项艰巨的任务,因为它不仅需要理解单词本身,还需要理解其背后的意图和语境。对于那些不遵循严格规则或缺乏大量预写示例供计算机学习的语言来说,情况尤其如此。罗马乌尔都语(Roman Urdu,一种使用拉丁字母书写乌尔都语的方式)就是一个典型的例子。它在巴基斯坦以及全球的乌尔都语使用者中广泛使用,但这种语言通常是非正式的,拼写和语法不一致,且会根据打字者的不同而变化。由于标准计算机程序难以应对这种缺乏结构性的情况,研究人员正在寻找新的、更轻量化的方法,教机器在这些混乱的现实世界文本中识别仇恨言论,而无需大量的数据或昂贵的超级计算机。

一位名叫 Toneema Zubair 的研究人员通过测试三种不同的方法来应对这一挑战,以观察哪种方法能最好地教计算机区分无害评论与仇恨评论。该研究针对一个包含从社交媒体收集的超过 72,000 条评论的特定数据集进行了研究,其中绝大多数是无害的,但有一小部分包含毒性语言。测试的第一种方法是仅仅要求一个大型预训练计算机模型在没有任何额外训练的情况下猜测答案,这种技术被称为“零样本提示”(zero-shot prompting)。第二种方法是在要求模型进行猜测之前,先给它一些需要寻找特征的示例,这被称为“少样本提示”(few-shot prompting)。第三种方法是一种被称为“参数高效微调”(parameter-efficient fine-tuning)的技术方法,研究人员通过对模型的内部设置进行非常微小且有针对性的调整,帮助它学习罗马乌尔都语仇恨言论的特定模式,而不是尝试从头开始重新训练整个模型。

结果显示,仅仅让计算机在没有任何帮助的情况下进行猜测往往是不可靠的。当模型在没有引导的情况下运行时,它们经常会将无害评论误标为有毒,或者完全漏掉实际的仇恨言论,这主要是因为该语言非常非正式,且数据集在非毒性评论方面存在严重的偏差。然而,当研究人员提供少量示例来引导模型时,性能得到了显著提升。虽然产生结果最一致且最可靠的方法是那种进行微小、精确调整的方法,但通过使用这些轻量级更新对模型进行微调,计算机能够比仅靠示例或没有任何帮助时更好地识别罗马乌尔都语的微妙细微差别。这种方法使模型达到了很高的准确度,能够平衡地正确识别毒性和非毒性评论,而其他方法则无法达到这种平衡。

研究还探索了向计算机提问的不同方式,例如使用特定的句子结构或添加不可见的、可学习的标记到提示词中。虽然这些变体显示出了潜力,并且在数据量较小时有时表现良好,但它们并未能持续超越调整模型内部设置的方法。研究表明,虽然基于少量示例向强大的计算机模型提问是一种快速且节省资源的选项,但它可能具有不可预测性。相比之下,对模型本身进行微小且高效的改变,能为检测像罗马乌尔都语这样的低资源语言中的仇恨言论提供更稳定且鲁棒的解决方案。这一发现非常重要,因为它为在数据稀缺和计算能力有限的地区进行在线内容审核提供了一条切实可行的路径,确保在不需要大规模、高能耗训练的情况下也能识别出有害言论。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →