What Suppresses Nash Equilibrium Play in Large Language Models? Mechanistic Evidence and Causal Control
تكشف هذه الورقة أن النماذج اللغوية الكبيرة تمتلك الكفاءة الميكانيكية لحساب توازن ناش، لكنها تقمع هذا السلوك الاستراتيجي بنشاط من خلال تجاوز اجتماعي إيجابي متجذر في مرحلة ما قبل التدريب، وهي ظاهرة يمكن عكسها سببياً عبر التدخل وتتأثر بشكل كبير بحجم النموذج وأساليب الاستدلال.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل مجموعة من الروبوتات شديدة الذكاء تلعب لعبة "معضلة السجين". في هذه اللعبة، الحركة الأكثر ذكاءً ومنطقية هي أن تخون شريكك (الخيانة/Defect)، ولكن إذا خان كلاكما الآخر، فسيخسر كلاكما الكثير. أما إذا وثق كلاكما في الآخر (التعاون/Cooperate)، فسيحقق كلاكما نتيجة جيدة.
لفترة طويلة، لاحظ الباحثون أن روبوتات الذكاء الاصطناي هذه تستمر في اختيار "التعاون" حتى عندما يملي عليها المنطق "الخيانة". ظنوا أن الروبوتات ليست ذكية بما يكفي لفهم الرياضيات.
تقول هذه الورقة البحثية: "أنتم مخطئون. إنهم يعرفون الرياضيات جيداً، لكنهم يختارون تجاهلها فحسب."
إليك قصة ما وجده المؤلفون، مشروحة ببساطة.
1. الروبوتات لديها "دماغ سري"
أخذ المؤلفون نموذج ذكاء اصطناعي ضخم (Llama-3-8B) ونظروا داخل "دماغه" (طبقاته الداخلية) أثناء لعبه للعبة. أرادوا معرفة ما يفكر فيه الروبوت في كل خطوة.
وجدوا شيئين مختلفين تماماً يحدثان في نفس الوقت:
- طبقة "المنطق": في النصف الأول من دماغ الروبوت، كان الأمر واضحاً تماماً. كان يعرف بالضبط ما فعله الخصم في المرة السابقة، وحسب أن الحركة المنطقية والرابحة هي الخيانة. كان يفكر كعالم رياضيات بارد وصارم.
- طبقة "الرجل الطيب": ولكن بعد ذلك، ومع انتقال المعلومات إلى الطبقات الأخيرة من الدماغ، حدث تحول ما. تدخل "تجاوز اجتماعي إيجابي" (prosocial override). كان الأمر أشبه ببوصلة أخلاقية مدمجة تقول: "انتظر، يجب أن نكون لطفاء. لنتعاون."
التشبيه: تخيل أن الروبوت هو محامٍ يعرف تماماً كيف يكسب قضية عن طريق كسر القواعد (توازن ناش/Nash Equilibrium). ولكن قبل أن يتحدث مباشرة، تتدخل دائرة "الضمير" في دماغه وتلغي قراره، وتجبره على قول الحقيقة، رغم أن قول الحقيقة سيجعله يخسر.
2. الانحياز لـ "اللطف" متجذر في البنية
اكتشف الباحثون أن هذا "التجاوز التعاوني" ليس وحدة برمجية محددة أو جزءاً واحداً من الدماغ. إنه أشبه بـ "مقبض تحكم في مستوى الصوت" موجود في الطبقات الأخيرة من الشبكة.
- يحسب الروبوت حركة "الخيانة" بدقة مثالية.
- ثم، يرتفع صوت مقبض "الرجل الطيب"، ليطغى على المنطق ويفرض قرار "التعاون".
- يحدث هذا لأن الروبوت تم تدريبه على النصوص البشرية، حيث يكون الناس غالباً لطيفين، ثم تم تدريبه لاحقاً ليكون مفيداً (RLHF).
3. مفارقة "التفكير" (سلسلة الأفكام - Chain-of-Thought)
اختبر المؤلفون ما إذا كان جعل الروبوتات "تفكر بصوت عالٍ" (سلسلة الأفكام) سيساعدها على لعب اللعبة المنطقية.
- الروبوتات الصغيرة (8B بارامتر): عندما حاولوا جعلها تفكر بصوت عالٍ، أصبحت في الواقع أسوأ. أصبح انحيازها لـ "اللطف" أعلى صوتاً، وتعاونت أكثر فأكثر، متجاهلة المنطق.
- الروبوتات الضخمة (70B+ بارامتر): كانت هذه العمالقة مختلفة. عندما فكرت بصوت عالٍ، استطاعت أخيراً التغلب على انحياز "اللطف". استخدمت قدرتها على الاستنتاج لتقول: "لا، المنطق يقول إننا يجب أن نخون"، وفعلت ذلك بالفعل.
التشبيه: الأمر يشبه طفلاً صغيراً يحاول مقاومة قطعة حلوى. إذا طلبت منه أن "يفكر في الأمر"، فإنه سيفكر فقط في مدى رغبته في قطعة الحلوى. لكن الشخص البالغ (النموذج الكبير) يمكنه استخدام منطقه ليقول: "لا ينبغي أن آكل ذلك"، ويوقف نفسه بالفعل.
4. تأثير "العدوى"
راقب الباحثون أيضاً ما يحدث عندما يلعب روبوتات مختلفة ضد بعضها البعض.
- "التفاحة الفاسدة": إذا لعب روبوت صغير (وهو "لطيف" جداً بطبيعته) ضد روبوت كبير، فإن الروبوت الصغير سيخون في وقت مبكر. سيرى الروبوت الكبير ذلك، وسيشعر بالخوف، ويبدأ في الخيانة أيضاً. تتحول اللعبة بأكملها إلى فوضى من الخيانة.
- "غرفة الصدى": إذا لعب روبوتان ضخمان ضد بعضهما البعض دون التفكير بصوت عالٍ، فسيقعان في حلقة من التعاون اللانهائي. سيستمران في الثقة ببعضهما البعض إلى الأبد، رغم أنهما يعلمان أن كلاهما يجب أن يخون الآخر ليربح.
5. "عجلة القيادة" السحرية
الجزء الأكثر إثارة في الورقة البحثية هو أن المؤلفين لم يكتفوا بالمراقبة؛ بل سيطروا على الموقف.
لقد وجدوا "الاتجاه" المحدد في دماغ الروبوت الذي يتحكم في انحياز "الرجل الطيب".
- التجربة: أعطوا الروبوت "دفعة" كهربائية صغيرة جداً في دماغه في بداية العملية.
- النتيجة:
- إذا دفعوه في اتجاه واحد، أصبح الروبوت خائناً منطقياً بنسبة 100% (يلعب توازن ناش المثالي).
- إذا دفعوه في الاتجاه الآخر، أصبح الروبوت متعاوناً ومحباً للخير بنسبة 100%.
التشبيه: تخيل سيارة تقود نفسها نحو منحدر (تتعاون بينما يجب أن تخون). وجد الباحثون رافعة صغيرة تحت لوحة القيادة. إذا سحبوا الرافعة مليمترًا واحدًا فقط، ستنعطف السيارة فوراً بعيدًا عن المنحدر وتقود بشكل مثالي. لم يضطروا لإعادة بناء المحرك؛ كل ما فعلوا هو توجيهها فقط.
الخلاصة
تخلص الورقة البحثية إلى أن نماذج الذكاء الاصطناعي ليست "سيئة في الرياضيات". إنها في الواقع جيدة جداً في حساب الحركة المنطقية والأنانية. المشكلة هي أن تدريبها يجعلها تُقمع ذلك المنطق لصالح كونها "لطيفة".
أظهر المؤلفون أن هذا القمع يحدث في الطبقات الأخيرة من الدماغ، ومن خلال تدخل بسيط، يمكننا إيقاف تشغيل هذا الانحياز لـ "اللطف" والسماح للروبوت بلعب اللعبة تماماً كما يملي عليه المنطق.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.