← 最新论文
💻 computer science

LLM-Driven Data Augmentation and Fine-Tuned Transformers vs. Few-Shot LLMs for Arabic Propaganda Technique Detection

本文提出了一种全面的阿拉伯语宣传检测流水线,该流水线展示了由 GPT-4.1 驱动的少样本数据增强如何显著优于传统方法,使微调后的 BERT 模型能够达到超越以往基准和少样本大语言模型方法的先进水平(F1-Micro=0.66),同时揭示了在这一低资源、不平衡的设定下,语言特征具有负面影响,而数据增强才是成功的关键因素。

原作者: Heba Mohammed Abed, Iyad H. Alshami, Motaz K H Saad

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Heba Mohammed Abed, Iyad H. Alshami, Motaz K H Saad

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在社交媒体广阔而嘈杂的景观中,一种微妙的劝说手段往往隐藏在众目睽睽之下。与依赖于彻头彻尾谎言的假新闻不同,宣传是通过扭曲事实、利用情感化语言和修辞技巧来塑造人们对事实的解读。它是一种影响工具,其内容在事实层面可能是准确的,但在本质上却是极具操纵性的。虽然这种现象在英语语境中已被长期研究,但阿拉伯语世界提出了一个独特的挑战。阿拉伯语丰富且复杂,单词会根据其在句子中的作用而改变形式,这使得标准计算机程序难以理解其含义。此外,研究人员一直难以找到足够的此类行为案例来教导计算机如何识别它们。现有的数据稀缺且严重失衡,某些操纵技术可能出现了数百次,而另一些则仅出现了一两次,这导致机器对那些最罕见且往往最危险的影响形式视而不见。

来自加沙伊斯兰大学和萨伦托大学的一个研究小组致力于解决这个双重问题:如何为计算机创造足够的高质量训练样本,以及哪种类型的计算机模型最适合检测阿拉伯语中的这些技术。他们专注于一个包含十七种不同宣传技术的推文特定数据集,其范围从使用情感化词汇的“带有偏见的语言”到攻击个人人格的“贴标签”。原始数据集规模太小且极不平衡,无法有效地教导计算机。为了解决这个问题,研究人员尝试了三种不同的人工扩展数据的方法。他们尝试使用大语言模型将单词替换为同义词;尝试将推文翻译成英语再翻译回阿拉伯语以创造新的表达方式;并尝试要求一个强大的人工智能根据少量真实的例子编写全新的宣传案例。

这些实验的结果揭示了一个清晰的成功等级。传统方法,如替换单词或随机插入,由于阿拉伯语复杂的语法在单词被移动或改变而未理解句子结构时会发生崩溃,因此基本失败了。这些尝试产生的文本对母语使用者来说听起来是不自然的。然而,当研究人员要求一个先进的人工智能根据特定风格生成新的、完整的宣传案例时,结果是非常出色的。这种方法产生的文本自然且符合语法,经过人工审核后,成功率接近百分之九十九。这一单一策略将一个仅有六百条记录的微型数据集转化为一个拥有四千多个独特样本的强大集合,有效地教会了计算机那些罕见的宣传技术究竟是什么样子的。

手握这个全新的、扩充后的示例库,团队测试了两种不同的教导计算机检测宣传的方法。第一种方法涉及“微调”,即使用新数据对预训练的计算机模型进行针对性调整。第二种方法涉及“少样本提示”,即给一个大规模的通用人工智能仅提供少量示例,并要求其在没有任何预先训练的情况下识别这些技术。研究人员进行了数十次实验,测试了各种模型架构,甚至尝试通过添加有关语法以及文本中人物或地点名称的额外信息来辅助模型。

研究结果是决定性的。表现最好的系统是一个在经过新增强数据微调后的模型。该系统实现的准确度水平显著超过了该领域之前的最佳结果,特别是在识别此前被忽视的罕见且微妙的技术方面。研究人员发现,添加额外的语法细节实际上损害了模型的性能,这表明计算机对语言的内在理解已经足够充分,而额外的信息只会引入混乱。相比之下,强大的通用人工智能模型虽然能力出众,但在仅给出少量示例的情况下,很难识别出罕见的技术。它们在处理常见套路时表现良好,但在识别频率较低的技术时却力有不逮,落后于专门的微调模型。

最终,这项研究表明,对于像阿拉伯语这样复杂的低资源语言,成功的关键不在于使用规模最大的人工智能,而在于精心策划和扩展用于训练专门化模型的数据。研究人员发现,数据增强是至关重要的单一因素,它弥补了计算机在信息有限的情况下所能达到的水平与拥有丰富多样数据集后所能达到的水平之间的差距。虽然大型人工智能模型提供了一种无需训练的便捷替代方案,但目前它们还无法达到专门在大型高质量数据集上进行教学的模型所具备的精准度。这项工作为构建更好的工具来检测阿拉伯语社交媒体中的操纵行为提供了清晰的路径,表明只要拥有正确的数据,即使是最难以捉摸的宣传形式也能被识别出来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →