ZeroR@CHiPSAL 2026: Two-Stage Vision-Language Adaptation with Contrastive Learning for Nepali Meme Classification
ZeroR@CHiPSAL 2026 团队通过采用一种基于 Qwen3-VL-8B-Instruct、结合对比学习与 LoRA 微调的两阶段视觉-语言适配流水线,消除了对 OCR 的依赖,并有效地处理了低资源多模态仇恨言论与情感检测,从而在尼泊尔语迷因分类中取得了顶尖排名。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一个巨大、混乱的数字城镇广场,每个人都在那里大喊大叫、窃窃私语,并在墙上涂鸦。在这个城镇里,“迷因”(memes)是最流行的交流方式。它们就像是结合了有趣的图片与巧妙文字的内部笑话。但有时,这些笑话会变成武器,将仇恨言论或霸凌行为隐藏在笑声之中。棘手之处在于,一张图片看起来可能很无辜,但文字却让它变得意义极其恶劣,或者反之亦然。为了阻止这种情况,计算机需要学会如何同时“阅读”图像和文字,理解整个故事,而不仅仅是其中的碎片。这对计算机来说是一个巨大的挑战,尤其是当这些笑话是用计算机不太熟悉的语言(如尼泊利语)讲述时,因为这种语言的文字系统(称为天文德瓦那格里文,Devanagari)是直接绘制在图片上的。
科学家们一直试图构建更好的“数字侦探”来识别这些有害的迷因。通常,他们尝试构建一条长长的流水线:首先,一台机器从图片中读取文本(就像扫描仪一样),然后另一台机器进行翻译,最后第三台机器决定它是否有害。但这就像是通过拆解零件来解决拼图一样;你可能会丢失整体的画面。这篇论文介绍了一组新的侦探团队,他们不需要流水线。相反,他们使用了一个超级智能的全能大脑,这个大脑可以像人类一样同时观察图片并阅读文本。研究人员在尼泊利语迷因上测试了这个大脑,以观察它能否识别仇恨言论并判断情绪是快乐、悲伤还是中性。
论文的故事:两阶段侦探训练法
研究人员 Nitiz Khanal 及其团队参加了一场名为 CHiPSAL 2026 的比赛,目标是构建一个能够识别尼泊利语迷因中的仇恨并分析情感的最佳系统。他们并没有简单地把计算机投入到问题中;他们为他们的 AI 模型设计了一个聪明的两阶段训练营。
明星选手:Qwen3-VL
他们系统的核心是一个庞大的预训练 AI,名为 Qwen3-VL-8B-Instruct。可以将这个模型想象成一个天才学生,他已经读过数百万本书,也看过世界各地的数百万张图片。至关重要的是,这个学生已经学会了如何阅读尼泊利语使用的天文德瓦那格里文脚本,因此研究人员不需要从头教它如何阅读,也不需要使用单独的工具来扫描文本。它可以观察迷因并立即“看到”写在上面的文字。
第一阶段:创意作家
在第一阶段训练中,团队教会了 AI 扮演创意作家的角色。他们向它展示了数千个迷因,并要求它写下答案:“仇恨”或“安全”,或者“负面”、“中性”或“正面”。为了在不搞崩溃计算机的情况下完成这项工作,他们使用了一种叫做 LoRA(低秩自适应)的技术。想象一下,AI 是一个拥有数百万本书的巨大图书馆。为了教它关于尼泊利语迷因的知识,研究人员并没有重写每一本书,而是在书架上添加了一些便签(小型可训练层)。这使得 AI 能够快速且高效地学习新任务。
然而,他们拥有的数据很杂乱。出现“安全”迷因的数量远多于“仇恨”迷因,出现“中性”迷因的数量也远多于“正面”或“负面”迷因。这就像是在你只有一张老虎照片却有一千张猫的照片时,试图学习识别稀有动物一样。为了解决这个问题,团队使用了过采样(制作稀有迷因的额外副本)和图像增强(翻转、旋转和调整亮度),以便 AI 不仅仅是死记硬背图片,而是真正学习其中的模式。对于三分类情感任务,他们还使用了一种特殊的数学技巧——Focal Loss(焦点损失),这会告诉 AI 要格外关注那些它一直出错的困难案例。
第二阶段:严厉教练
第一阶段表现不错,但研究人员希望 AI 变得更加敏锐。在第二阶段,他们加入了一位“对比学习”教练。这就像是一场“找不同”的游戏。教练向 AI 展示两个都是“仇恨”类的迷文,并说:“这两个属于一类!”然后它展示一个“仇恨”迷文和一个“安全”迷文,并说:“这两个完全不同!把它们推开!”这帮助 AI 学习将相似的想法紧密地聚集在一起,并将不同的想法在脑海中推开。这个阶段不仅仅是要求一个答案,它还迫使 AI 理解数据的“形状”,使其决策更加稳健。
最终裁决:混合评分
当进行最终考试时,团队并没有只选择来自第一阶段或第二阶段的答案。他们创建了一个“团队集结”。他们提取了“创意作家”(第一阶段)的概率得分和“严厉教练”(第二阶段)的得分,并用一个特殊的权重将它们混合在一起。他们在练习集上测试了不同的混合比例,以找到能获得最高分的最完美平衡点。
他们的发现
结果令人印象深刻。该团队的系统在仇恨言论检测任务中获得了官方排行榜的第 2 名,得分(称为 Macro F1)为 0.797。这意味着即使在处理棘手的类别不平衡问题时,该系统也非常擅长识别有害内容。对于情感分析任务(判断迷文是积极、消极还是中性的任务),他们在排行榜上获得了第 4 名,得分为 0.518。
研究人员发现,两阶段方法是他们的“秘密武器”。如果他们只使用第一阶段(仅仅是写出答案),他们的得分会更低。加入第二阶段(对比学习)显著提升了他们的表现。他们还发现,这两项任务需要不同的训练风格。仇恨言论任务相对直接,但情感任务要难学得多,因为“中性”与“积极”或“消极”之间的界限往往很模糊,尤其是在幽默语境下。情感模型需要更严格的规则(正则化)来防止它产生困惑。
这为什么重要(以及它不具备什么)
这篇论文表明,对于像尼泊利语这样的低资源语言,使用一个强大的、全能的视觉语言模型(原生理解其脚本的模型)是一个游戏规则的改变者。它证明了你不需要一套复杂的工具链(比如单独的文本扫描器和翻译器)来理解迷文;一个单一的、聪明的模型就可以实现端到端的处理。
然而,作者谨慎地指出,他们的系统并非完美。他们承认 AI 有时会错过深层的文化背景。例如,一个迷文可能以一位历史人物或特定的文化笑话为特色,这在 AI 看来可能无害,但对尼泊利人来说实际上是冒犯性的。AI 很聪明,但它还没有具备那种文化的生存体验。他们还指出,由于数据集相对较小(每个任务大约 1,000 个迷文),存在模型可能只是记住了训练数据而非真正学习的风险,并且如果使用不同的随机种子重新开始,结果可能会有所不同。
最后,这项工作展示了一条充满希望的路径:教导大型、聪明的 AI 模型去理解那些在技术领域被遗忘的语言中,既混乱、有趣又有时危险的迷文世界。这是让数字城镇广场对每个人都更加安全、更加包容的一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。