← أحدث الأبحاث
💬 NLP

SwanNLP at SemEval-2026 Task 5: An LLM-based Framework for Plausibility Scoring in Narrative Word Sense Disambiguation

يقترح فريق SwanNLP إطار عمل يعتمد على النماذج اللغوية الكبيرة لمهمة SemEval-2026 Task 5، يستخدم الاستدلال المهيكل، والتحفيز القليل من الأمثلة الديناميكي، وتجميع النماذج للتنبؤ بفعالية بالمعقولية التي يدركها البشر لمعاني الكلمات في النصوص السردية، مما يثبت أن النماذج التجارية ذات المعلمات الكبيرة تحاكي أحكام البشر بدقة.

المؤلفون الأصليون: Deshan Sumanathilaka, Nicholas Micallef, Julian Hough, Saman Jayasinghe

نُشر 2026-04-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Deshan Sumanathilaka, Nicholas Micallef, Julian Hough, Saman Jayasinghe

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقرأ قصة قصيرة لصديق لك. فجأة، تصادف كلمة لها معنيان مختلفان تماماً، مثل كلمة "bat". قد تعني حيواناً طائراً (خفاش)، أو قد تعني أداة رياضية (مضرب).

في جملة بسيطة مثل "The bat flew out of the cave" (طار الخفاش من الكهف)، يكون الأمر واضحاً. ولكن في قصة معقدة، قد تكون القرائن خفية. ربدما تدور القصة حول مباراة بيسبول، لكن الشخصية ترتدي عباءة. هل الـ "bat" هنا هو الحيوان أم المضرب الرياضي؟ البشر بارعون جداً في تخمين المعنى الذي يبدو أكثر منطقية بناءً على القصة بأكملها.

هذه الورقة البحثية تتحدث عن تعليم الحواسيب القيام بهذا الأمر بالضبط: تخمين أي معنى للكلمة هو الأكثر منطقية في قصة ما.

إليك تفصيل لما قام به الباحثون في جامعة سوانزي (Swansea University)، باستخدام بعض التشبيهات من الحياة اليومية.

1. المشكلة: لغز "القصة الغامضة"

شارك الباحثون في مسابقة تسمى SemEval-2026 Task 5. فكر في هذا كمسابقة لألغاز ضخمة.

  • التحدي: تم إعطاؤهم قصصاً قصيرة تحتوي على كلمات مخادعة.
  • الهدف: بدلاً من مجرد اختيار إجابة واحدة (مثل اختبار الاختيار من متعدد)، كان عليهم إعطاء القصة "درجة معقولية" (Plevsibility Score) من 1 إلى 5.
    • 5: "أوه، هذا منطقي تماماً! الكلمة تعني (س) بالتأكيد هنا."
    • 1: "مستحيل. هذا المعنى يناسب القصة كما يناسب مسمار مربع ثقباً دائرياً."
  • التحول المفاجئ: كان عليهم محاكاة الحكم البشري. أحياناً يختلف البشر؛ فقد يرى شخص ما أن الـ "bat" هو حيوان (درجة 4)، بينما يراه آخر أداة رياضية (درجة 2). كان على الكمبيوتر أن يفهم لماذا قد يشعر البشر باختلاف في الرأي.

2. الحل: ثلاث استراتيجيات لـ "العقل"

جرب الفريق ثلاث طرق مختلفة لتعليم نماذج الكمبيوتر الخاصة بهم كيف تفكر مثل البشر.

الاستراتيجية (أ): "المتدرب" (ضبط النماذج الصغيرة)

تخيل أن لديك طالباً ذكياً ولكنه صغير السن (نموذج ذكاء اصطناعي صغير). أنت تريد منه أن يتعلم كيفية تقييم القصص.

  • الطريقة القديمة: تعرض عليه القصة فقط وتطلب منه درجة.
  • الطريقة الجديدة: تعمل أنت كمعلم صارم. تقول له: "أولاً، ابحث عن القرائن. هل القصة عن البيسبول أم عن كهف؟ هل من السهل معرفة ذلك، أم أنها خدعة؟ ثم أعطني درجة."
  • النتيجة: من خلال إجبار الكمبيوتر على "التفكير بصوت عالٍ" (عملية تسمى سلسلة الأفكال - Chain-of-Thought) والتحقق مما إذا كانت القصة "سهلة" أو "صعبة" أولاً، أصبح الطالب أفضل بكثير في تخمين الدرجة الصحيحة. كان الأمر يشبه تعليم الطالب استخدام قائمة تحقق قبل الإجابة.

الاستراتيجية (ب): "المستشار" (التعلم القليل الديناميكي)

بالنسبة لأجهزة الكمبيوتر الأكبر والأذكى (نماذج اللغات الكبيرة التجارية مثل GPT-4)، لم يحتاجوا لإعادة تدريبها من الصفر. بدلاً من ذلك، استخدموا "مكتبة مرجعية".

  • التشبيه: تخيل أنك حَكَم في مسابقة. قبل أن تتخذ قرارك، تنظر إلى بعض القضايا الماضية التي تشبه تماماً القضية التي تحكم بها الآن.
  • كيف عملت: تم إعطاء الكمبيوتر القصة، ثم عُرضت عليه حالة أو ثلاث حالات من قصص أخرى وكيف قيمها البشر.
  • النتيجة: كان هذا بمثابة إعطاء الكمبيوتر "ورقة غش" من "المواقف المشابهة". ساعد هذا الكمبيوتر على إدراك: "آه، هذه القصة تشبه تلك القصة الأخرى حيث كانت الدرجة مرتفة"، مما أدى إلى درجات أكثر دقة تشبه التقييم البشري.

الاستراتيجية (ج): "مجلس القضاة" (التجميع - Ensembling)

لاحظ الباحثون أنه في بعض الأحيان يرتكب كمبيوتر واحد خطأً، تماماً كما قد يمر إنسان بيوم سيء.

  • التشبيه: بد instead من سؤال شخص واحد لتقييم القصة، طلبوا من خمسة أجهزة كمبيوتر مختلفة تقييمها بشكل مستقل. ثم أخذوا متوسط درجات الخمسة جميعاً.
  • النتيجة: هذا يشبه لجنة من الحكام في برنامج مواهب. إذا كان أحد الحكام قاسياً جداً والآخر متساهلاً جداً، فإن المتوسط عادة ما يكون أكثر عدلاً وأقرب إلى ما فكر فيه الجمهور (البشر) بالفعل. هذه الطريقة كانت الأفضل بشكل عام.

3. النتائج الرئيسية

  • التفكير مهم: أجهزة الكمبيوتر التي أُجبرت على "الاستنتاج" من خلال القصة (التحقق من القرائن، والتحقق من الصعوبة) كانت أفضل بكثير من تلك التي اكتفت بالتخمين فقط.
  • السياق هو الملك: أجهزة الكمبيوتر الأكبر والأغلى ثمناً التي استطاعت النظر إلى "القصص الماضية المشابهة" (استراتيجية المستشار) كانت الأفضل في محاكاة الفروق الدقيقة البشرية.
  • العمل الجماعي يفوز: عندما جمعوا بين آراء نمارذج متعددة (استراتيجية المجلس)، كانت النتائج أقرب إلى التوافق البشري مما يمكن لأي نموذج منفرد تحقيقه بمفرده.

4. الحكم النهائي

أنهى الفريق المسابقة في المركز العاشر. ورغم أنهم لم يفوزوا بالمركز الأول، إلا أنهم أثبتوا أن أجهزة الكمبيوتر أصبحت جيدة جداً في فهم شعور و منطق القصة، وليس فقط قواعد اللغة.

باخت al المختصر: لقد علموا أجهزة الكمبيوتر التوقف عن مجرد قراءة الكلمات والبدء في قراءة ما بين السطور، باستخدام قوائم التحقق، والكتب المرجعية، والمناقشات الجماعية لمعرفة ما تحاول القصة قوله حقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →