Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs
تتقصى هذه الورقة ما إذا كان نموذجا LLaMA 2 وFlan-T5 يظهران استدلالاً انتقالياً حقيقياً أم يعتمدان على إشارات سطحية من خلال ضبط التداخلات اللفظية، والمعرفة المسبقة، والكيانات المسماة، مما يكشف أنه بينما يستفيد كلا النموذجين من التداخلات المعجمية، فإن Flan-T5 يُظهر مرونة أكبر تجاه التلاعبات القائمة على المعرفة، مما يشير إلى دور محتمل للضبط الدقيق في تطوير الفهم المنطقي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في مجال الذكاء الاصطناعي المتطور بسرعة، استقطب نوع معين من برامج الكمبيوتر يُعرف باسم "النماذج اللغوية الكبيرة" انتباه العالم. هذه الأنظمة، التي تدرّبت على كميات هائلة من النصوص من الإنترنت، يمكنها كتابة القصص، وترجمة اللغات، والإجابة على الأسئلة المعقدة. ويتمثل سؤال مركزي للعلماء الذين يدرسون هذه الآلات فيما إذا كانت تفهم المنطق حقًا أم أنها مجرد محاكاة للأنماط التي رأتها من قبل. ولاختبار ذلك، يبحث الباحثون عن مهارة أساسية تسمى "الاستدلال الانتقالي". وبالمعنى اليومي، هذا هو القدرة على ربط قطعتين منفصلتين من المعلومات للوصول إلى استنتاج جديد. فعلى سبيل المثال، إذا عرف الشخص أن القط هو نوع من الحيوانات، وأن جميع الحيوانات تحتاج إلى طعام، فإنه يستطيع منطقيًا استنتاج أن القط يحتاج إلى الطعام دون أن يُقال له صراحةً تلك الحقيقة المحددة. تتطلب هذه العملية ما هو أكثر من مجرد الذاكرة؛ فهي تتطلب القدرة على نسج الحقائق معًا. والسؤال الذي يحرك الأبحاث الأخيرة هو ما إذا كانت هذه البرامج الحاسوبية القوية تقوم بالفعل بهذا النسج الذهني، أم أنها تسلك طريقًا مختصرًا عبر رصد الكلمات المألوفة وتخمين الإجابة.
لقد وضع فريق من الباحثين من جامعة هيريوت-وات وجامعة إدنبرة نصب أعينهم التحقيق في هذه القضية تحديدًا. فقد ركزوا على نوعين متميزين من النماذج اللغوية، أحدهما يسمى LLaMA 2 والآخر يسمى Flan-T5، لمعرفة كيفية تعاملهما مع الأسئلة التي تتطلب ربط حقيقتين. استخدم العلماء مجموعتين موجودتين من الأسئلة المصممة لاختبار هذا النوع من التفكير. إحدى المجموعات، المعروفة باسم QASC، تقدم أسئلة متعددة الخيارات حول العلوم تتطلب دمج جملتين لإيجاد الإجابة الصحيحة. أما المجموعة الأخرى، المسماة Bamboogle، فتتضمن أسئلة صعبة لدرجة أن محرك بحث عادي على الإنترنت قد يخطئ فيها، مما يجبر النموذج على الاعتماد على معالجته الخاصة. أراد الباحثون معرفة ما إذا كانت النماذج تقوم بالاستدلال فعليًا عبر الخطوات، أم أنها تكتفي بالتشبث بكلمات محددة، مثل التواريخ أو الأسماء، التي تظهر في كل من السؤال والإجابة.
ولمعرفة الحقيقة، صمم الفريق سلسلة من التجارب الذكية حيث قاموا بتغيير المعلومات المقدمة للنماذج بشكل منهجي. بدأوا بالتحقق مما إذا كان بإمكان النماذج حل المشكلات عند تزويدها بالحقائق ومثال واضح لكيفية الربط بينهما. أدى كلا النموذجين أداءً جيدًا في ظل هذه الظروف، لكن الباحثين اشتبهوا في أن هذا قد يكون سهلاً للغاية. ثم قاموا بإزالة المثال الخاص بكيفية ربط الحقائق، تاركين النماذج لتكتشف الأمر بمفردها. كانت النتائج كاشفة؛ فقد استمر نموذج Flan-T5، الذي تم تدريبه خصيصًا على مهام استدلال مماثلة، في الأداء بشكل جيد جدًا حتى بدون المثال. ومع ذلك، عانى نموذج LLaMA 2 بشكل كبير بدون ذلك التوجيه، مما يشير إلى أنه يعتمد بشدة على رؤية نمط الاستدلال قبل أن يتمكن من اتباعه.
ثم اتبع الباحثون نهجًا أكثر حدة لمعرفة ما إذا كانت النماذج تفهم حقًا معنى الكلمات. لقد قاموا ببعثرة ترتيب الكلمات داخل الحقائق، محولين الجمل الواضحة إلى سلاسل نصية مشوشة وغير مفهومة. ومن المفترض أنه إذا كانت النماذج تستدل حقًا على المعنى، فإن هذه الفوضى يجب أن تجعل الإجابات مستحيلة العثور عليها. ومن المثير للدهشة أن أداء النماذج لم ينخفض إلا قليًا. فقد ظلت قادرة على اختيار الإجابة الصحيحة حتى عندما لم تكن الجمل ذات معنى قواعدي. وهذا يشير إلى أن النماذج لم تكن تقرأ الجمل كأفكار متماسكة، بل كانت على الأرج غالب مسح كلمات مفتاحية محددة تطابق خيارات الإجابة. وعندما أزال الباحثون تلك الكلمات المفتاحية المطابقة تمامًا، انهارت دقة النماذج، مما أكد أنها كانت غالبًا مجرد مطابقة للكلمات بدلاً من الاستنتاج المنطقي.
ولاستبعاد احتمال أن تكون النماذج قد حفظت الإجابات ببساطة من بيانات تدريبها، لجأ الفريق إلى مجموعة بيانات Bamboogle، التي تحتوي على أسئلة لم ترها النماذج من قبل. وهنا، قدموا اختبارًا أخيرًا صارمًا. لقد استبدلوا أسماء الأشخاص والأماكن والتواريخ -وهي الكيانات المحددة التي تظهر غالبًا في الإجابات- بكلمات لا معنى لها. كما قاموا ببعثرة ترتيب الكلمات في الحقائق. وعندما واجهت النماذج هذه النسخ من الهراء، فشل نموذج LLaMA 2 بشكل شبه كامل؛ فلم يستطع العثور على الإجابة بدون تلك الأسماء والتواريخ المألوفة لإرشاده. أما نموذج Flan-T5، فقد أظهر نوعًا مختلفًا من الصمود؛ فبينما انخفض أداؤه، ظل أفضل بكثير من النموذج الآخر. وهذا يشير إلى أنه نظرًا لأن Flan-T5 قد تم تدريبه صراحةً على مهام الاستدلال، فقد طور قدرة أكثر قوة على اتباع السلسلة المنطقية، حتى عندما جُردت من الدلائل المألوفة.
تخلص الدراسة إلى أنه بينما يمكن للنماذج اللغوية الكبيرة أن تبدو وكأنها تستدل، فإن نجاحها يعتمد غالبًا على الطريقة المحددة التي تم تدريبها بها وعلى الإشارات المتوفرة في النص. وبالنسبة للنماذج التي لم يتم ضبطها بدقة (fine-tuning) على مهام الاستدلال، يبدو أن القدرة على الإجابة على الأسئلة المعقدة تعتمد بشدة على التعرف على الكلمات والأنماط المألوفة بدلاً من الاستنتاج المنطقي الحقيقي. وحتى عندما تبدو وكأنها تفكر خطوة بخطوة، فقد تكون ببساطة تلتقط الكلمات المفتاحية الصحيحة. ومع ذلك، يشير البحث إلى أنه عندما يتم تدريب النموذج بعناية على مجموعات بيانات مصممة لتعليمه كيفية ربط الحقائق، يمكنه تطوير قدرة أكثر حقيقية على الاستدلال الانتقالي. وتسمح هذه القدرة له بالتعامل مع الأسئلة حتى عند إزالة الاختصارات المعتادة، مثل الأسماء أو التواريخ المعروفة. وتعد هذه النتائج بمثابة تذكير بأن الدرجات العالية في اختبارات الاستدلال لا تثبت دائمًا أن الآلة تفهم المنطق؛ فأحيانًا، هي فقط بارعة جدًا في إيجاد الكلمات الصحيحة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.