← أحدث الأبحاث
💬 NLP

Temporal Fact Conflicts in LLMs: Reproducibility Insights from Unifying DYNAMICQA and MULAN

تحل دراسة إعادة الإنتاج هذه الاستنتاجات المتضاربة حول قدرة النماذج اللغوية الكبيرة على تحديث الحقائق الزمنية من خلال توحيد معيارَي DYNAMICQA وMULAN، كاشفةً أن النتائج تعتمد بشكل كبير على تصميم مجموعة البيانات، ومقاييس التقييم، وحجم النموذج، مع إثبات أن نتائج MULAN أكثر قابلية للتعميم عبر الأطر المنهجية.

المؤلفون الأصليون: Ritajit Dey, Iadh Ounis, Graham McDonald, Yashar Moshfeghi

نُشر 2026-03-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ritajit Dey, Iadh Ounis, Graham McDonald, Yashar Moshfeghi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك أمين مكتبة ذكيًا جدًا ومطلعًا يدعى LLM (نموذج لغوي كبير). هذا الأمين قد قرأ كل كتاب تقريبًا في العالم حتى تاريخ معين، وحفظ جميع الحقائق الموجودة بداخلها.

لكن المشكلة تكم-ل: العالم يتغير. رؤساء يُنتخبون، وفرق رياضية تغير أسماءها، واكتشافات علمية تُجرى. ذاكرة أمين المكتبة عالقة في الماضي، لكنه يُسأل عن أحداث اليوم.

مؤخرًا، حاول فريقان مختلفان من الباحثين معرفة ما يلي: "إذا قدمنا لأمين المكتبة مقالاً صحفيًا يحتوي على الحقيقة الجديدة، فهل سيستمع إليها ويغير إجابته، أم سيبقى متمسكًا بعناد بما حفظه؟"

الفريق (أ) والفريق (ب) قاما بنفس التجربة تمامًا، لكنهما حصلا على نتائج متناقضة.

  • الفريق أ (DYNAMICQA) قال: "مستح المستحيل! أمين المكتبة عنيد. إذا اعتقد أن الإجابة هي 'س'، فلن يستمع إلى الصحيفة التي تقول 'ص'".
  • الفريق ب (MULAN) قال: "في الواقع، نعم! أمين المكتبات مرن. إذا أظهرنا له المعلومة الجديدة، فسيتحول بسهولة إلى 'ص'".

هذه الورقة البحثية هي "قصة تحقيق" حيث يحاول المؤلفون (ريتاجيت وزملاؤه) حل هذا الغموض. إنهم يعملون كحكام علميين، يعيدون لعب المباراتين ليروا من هو المصيب.

التحقيق: إعادة لعب المباريات

أدرك المؤلفون أن الفريق (أ) والفريق (ب) لم يكونا يلعبان نفس اللعبة بشكل مختلف فحسب؛ بل كانا يلعبان رياضتين مختلفتين تمامًا بقواعد مختلفة.

1. "السؤال" مقابل "إكمال الفراغ"

  • الفريق (أ) طرح على أمين المكتبة أسئلة كاملة مثل: "من هو رئيس الولايات المتحدة؟" وأعطاه فقرة طويلة تبدو طبيعية من ويكيبيديا كإشارة.
  • الفريق (ب) طلب من أمين المكتبة إكمال جملة مثل: "رئيس الولايات المتحدة هو..." وأعطاه إشارة روبوتية للغاية مولدة بواسطة الكمبيوتر مثل: "تخيل أن الرئيس هو [الاسم]. ثم..."

التشبيه:
تخيل أنك تحاول تعليم كلب خدعة جديدة.

  • الفريق (أ) يصرخ بالأمر في جملة طويلة ومعقدة بينما يمسك قطعة حلوى.
  • الفريق (ب) يهمس بأمر بسيط ومتكرر بينما ينقر على أنف الكلب.
  • النتيجة: قد يستمع الكلب إلى الهمس (الفريق ب) ولكنه يتجاهل الصراخ (الفريق أ). وجد المؤلفون أن طريقة طرح السؤال غيرت النتيجة تمامًا.

2. "الأخبار المزيفة" مقابل "الأخبار الحقيقية"

  • الفريق (أ) استخدم فقرات حقيقية وفوضوية كتبها البشر.
  • الفريق (ب) استخدم جملًا بسيطة مولدة بواسطة الكمبيوتر.

التشبيه:

  • الفريق (أ) يشبه معلمًا يعطيك فصلًا كاملاً من كتاب مدرسي لتصحيح خطأ ما.
  • الفريق (ب) يشبه معلمًا يكتب جملة واحدة جريئة على السبورة البيضاء: "الإجابة هي س".
  • وجد المؤلفون أنه عندما استبدلوا هذه الأساليب، انقلبت النتائج. عندما استُخدم أسلوب "الأخبار الحقيقية" الخاص بالفريق (أ) على أسئلة الفريق (ب)، أصبح أمين المكتبة عنيدًا مرة أخرى. وعندما استُخدم الأسلوب "الروبوتي" الخاص بالفريق (ب) على أسئلة الفريق (أ)، أصبح أمين المكتبة مرنًا.

3. تجربة "الحجم مهم"

الدراسات الأصلية اختبرت أمناء مكتبة بحجم واحد محدد فقط (7 مليارات خلية دماغية). قرر المؤلفون اختبار أمناء مكتبة صغار (1B)، متوسطين (4B)، وضخمين (12B).

التشبيه:

  • وجدوا أن أمناء المكتبة الصغار مشتتون للغاية ويصعب تحديثهم.
  • أمناء المكتبة الضخمون واثقون جدًا في ذكرياتهم القديمة ومن الصعب تحديثهم.
  • أمناء المكتبة المتوسطون كانوا الوحيدين الذين بدا عليهم الاستماع بسهولة للمعلومات الجديدة.

هذا يشبه اكتشاف أن الطفل والجد قد يكون كلاهما عنيدًا بشأن حقيقة جديدة، لكن المراهق في المنتصف هو الأكثر انفتاحًا على تغيير رأيه. هذا يعني أن الإجابة على سؤال "هل نماذج اللغة الكبيرة عنيدة؟" تعتمد كليًا على حجم النموذج.

الكشف الكبير

بعد إجراء كل هذه التجارب، استنتج المؤلفون أن لا أحد من الفريقين كان "مخطئًا"، ولكن لم يكن أي منهما "مصيبًا" أيضًا.

  • الفريق (أ) أثبت أنه إذا طرحت أسئلة معقدة بلغة طبيعية، فإن نماذج اللغة الكبيرة تكون عنيدة وتكره تغيير رأيها بشأن الحقائق المرتبطة بالوقت.
  • الفريق (ب) أثبت أنه إذا طرحت أسئلة بسيطة ومنظمة بإشارات روبوتية، فإنها تكون مرنة وتحدث معلوماتها بسهولة.

الدرس النهائي:
سلوك هذه النماذج ليس سمة شخصية ثابتة. إنه يشبه الحرباء.

  • إذا ألبست التجربة ملابس الفريق (أ)، سيبدو الذكاء الاصطناعي عنيدًا.
  • إذا ألبستها ملابس الفريق (ب)، سيبدو الذكاء الاصطناعي مرنًا.

لماذا يجب أن تهتم؟

إذا كنت تبني ذكاءً اصطناعيًا لمساعدة الأطباء أو المحامين أو الصحفيين، فأنت بحاجة لمعرفة هذا. لا يمكنك مجرد القول: "ذكاؤنا الاصطناعي جيد في تحديث الحقائق". عليك أن تسأل: "تحت أي ظروف؟"

  • إذا طُلب من ذكائك الاصطناعي إجراء محادثة طبيعية (مثل الدردشة)، فقد يتجاهل الأخبار الجديدة.
  • إذا استُخدم ذكاؤك الاصطناعي في نظام قاعدة بيانات صارم، فقد يتحدث فورًا.

الخلاصة:
عالم الذكاء الاصطناعي معقد. ما إذا كان الذكاء الاصطناعي سيستمع إلى المعلومات الجديدة يعتمد على كيفية طرح السؤال، وشكل السؤال، وحجم دماغ الذكاء الاصطناعي. لا توجد إجابة واحدة بـ "نعم" أو "لا"؛ الأمر كله يتعلق بالسياق.

لقد جعل المؤلفون أكوادهم وبياناتهم عامة، داعين الجميع لمواصلة اختبار هذه "الحراريات" لمعرفة كيف تتفاعل في مواقف مختلفة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →