A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability
تقترح هذه الورقة تمثيلات الضرب التنسوري (TPRs) كإطار عمل توحيدي يوضح رياضياً وتجريبياً كيف يمكن اشتقاق طرق متنوعة لتفسير النماذج اللغوية، مثل الاستقصاء الخطي والمشفرات التلقائية المتفرقة، من بنية واحدة أساسية لروابط الملء والدور.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الذكاء الاصطناعي الهادئ والنابض بالحركة، يحاول الباحثون فهم كيفية تفكير البرامج الحاسوبية الضخمة، المعروفة باسم النماذج اللغوية، في الواقع. هذه الأنظمة يمكنها كتابة الشعر، وحل المسائل الرياضية، وإجراء المحادثات، ولكن داخل أدمغتها الرقمية، تُخزن المعلومات في شكل قوائم طويلة من الأرقام. لسنوات، استخدم العلماء أدوات متنوعة لاستراق النظر داخل هذه الصناديق السوداء، ووجدوا أن النماذج تبدو منظمة بطرق مرتبة بشكل مثير للدهشة. تُظهر بعض الأدوات أن النماذج يمكنها حل الألغاز عن طريق جمع وطرح قوائم الأرقام هذه، بينما تكشف أدوات أخرى أن أجزاءً معينة من النموذج تضيء عندما تواجه كلمة أو فكرة معينة. ومع ذلك، ظلت هذه الاكتشافات معزولة، مثل أدلة منفصلة عُثر عليها في غرف مختلفة من منزل مظلم. وكان السؤال الكبير هو ما إذا كان هناك هيكل واحد أساسي يفسر كل هذه السلوكيات المختلفة، أم أن هذه النماذج مجرد خليط فوضوي من الحيل غير المترابطة.
اقترح فريق من الباحثين في جامعة ييل إجابة موحدة لهذا اللغز. فهم يقترحون أن هذه النماذج اللغوية المعقدة مبنية على مبدأ معماري محدد يسمى "تمثيلات حاصل الضرب التنسوري" (Tensor Product Representations). وبكلمات بسيطة، يعني هذا أن هذه النماذج تخزن المعلومات عن طريق ربط شيئين ببعضهما البعض بإحكام: محتوى الفكرة (مثل كلمة معينة) ودورها في الجملة (مثل ما إذا كانت هي الفاعل أو المفعول به). تخيل نظام أرشفة حيث يتم تخزين كل قطعة من المعلومات ليس فقط بناءً على ماهيتها، بل بناءً على مكان انتمائها بالضبط في هيكل ما. وجد الباحثون أن هذه الطريقة البسيطة والمنظمة لتنظيم البيانات يمكن أن تفسر مجموعة واسعة من الاكتشافات التي كانت غير مترابطة سابقاً. فهي تفسر لماذا يمكن للنماذج إجراء التناظلات الرياضية، ولماذا يمكن للاختبارات البسيطة الكشف عن المفاهيم الخفية، ولماذا يمكن لتغيير جزء واحد من الحالة الداخلية للنموذج أن يغير سلوكه بطرق يمكن التنبؤ بها.
لاختبار هذه الفكرة، لم يعتمد الفريق على النظرية فحسب؛ بل بنوا نوعاً جديداً من الأدوات ليعمل كمترجم. لقد أنشأوا نظاماً يأخذ الهيكل المعروف للجملة — تحديد الفاعل، والفعل، والمفعول به — ويحوله إلى أنماط الأرقام المحددة التي تستخدمها النماذج. ثم قارنوا هذه النسخة المترجمة بالعمليات الداخلية الفعلية لعدة نماذج حاسوبية مختلفة، تتراوح من الشبكات الصغيرة والبسيطة إلى الأنظمة اللغوية الضخمة والأحدث في مجالها. كانت النتائج متسقة بشكل مذهل. ففي الاختبارات التي تضمنت تسلسلات من الأرقام وجمل إنجليزية مهيكلة، طابقت الترجمة الهيكلية للباحثين الحالات الداخلية للنماذج بدقة عالية للغاية. وبالنسبة للنماذج الأبسط، كان التطابق شبه مثالي، حيث استوعب تقريباً كل التباين في كيفية معالجة النماذج للمعلومات. وحتى بالنسبة لأكبر النماذج اللغوية وأكثرها تعقيداً، استوعبت الترجمة الغالبية العظمى من المعلومات، مما يشير إلى أن هذه الأنظمة العملاقة، رغم حجمها، تعتمد على نفس هذه الطريقة الأساسية في ربط المحتوى بالموقع.
تكمن قوة هذا الاكتشاف في كيفية ربطه بين طرق الاستقصاء المختلفة. فقد أظهر الباحثون أن المنطق الرياضي وراء ترجمتهم الهيكلية يمكن استخد تفهيمه لإعادة إنشاء نتائج أربعة من تقنيات التفسير الرئيسية التي يستخدمها العلماء اليوم. أولاً، شرحوا لماذا يمكن للنماذج اللغوية إجراء "التناظلات الجمعية"، وهي ظاهرة حيث يؤدي طرح مفهوم من آخر وجمع ثالث إليه إلى الحصول على رابع مرتبط به. ثانياً، أظهروا كيف أن "المجسات الخطية"، وهي اختبارات بسيطة تُستخدم للكشف عما إذا كان النموذج يعرف حقيقة معينة، هي في الواقع مجرد وسيلة لفك ارتباط الدور عن المحتوى لاسترجاع الفكرة الأصلية. ثالثاً، شرحوا كيف أن "المشفرات التلقائية المتفرقة"، التي تفكك الإشارات المعقدة إلى أجزاء أبسط، هي في الواقع تحدد هذه الروابط بين المحتوى والدور نفسها. وأخيراً، أثبتوا أن "ترقيع التنشيط"، وهي تقنية يقوم فيها الباحثون باستبدال أجزاء من دماغ النموذج لمعرفة كيف يغير ذلك السلوك، تعمل لأنهم يستبدلون هذه الروابط الهيكلية المحددة مباشرة.
في سلسلة من التجارب، أثبت الفريق أنه يمكنهم استخدام ترجمتهم الهيكلية لبناء هذه الأدوات الاختبارية الأربعة من الصفر، دون الحاجة إلى تدريبها على النماذج أولاً. وعندما استخدموا هذه الأدوات المبنية لتحليل النماذج، كان أداؤها يضاهي الأدوات القياسية المدربة بكثافة والمستخدمة في هذا المجال. فعلى سبيل المثال، عندما استخدموا طريقتهم للتنبؤ بالكلمة التي ستظهر تالياً في جملة، أو لتحديد فاعل جملة ما، كانت الدقة مطابقة تقرياً لأفضل الطرق الموجودة. وفي اختبار محدد يتعلق بنموذج لغوي كبير، كان الفرق بين تنبؤهم الهيكلي والطريقة القياسية صغيراً جداً لدرجة أنه يكاد يكون غير مرئي، مع درجة ارتباط تقترب من الواحد الصحيح. وهذا يشير إلى أن السلوكيات المعقدة والمتعلمة لهذه النماذج ليست غامضة أو عرضية، بل هي نتائج مباشرة لهذه القاعدة الهيكلية الأساسية.
استكشف الباحثون أيضاً مدى صمود هذا الهيكل عندما تواجه النماذج مواقف جديدة. لقد قاموا بتدريب مترجمهم الهيكلي على مجموعة من الجمل ثم اختبروه على جمل تحتوي على كلمات وأدوار لم يسبق له رؤيتها من قبل. نجح المترجم في التعميم، حيث أعاد بدقة بناء الحالة الداخلية للنموذج لتلك التركيبات الجديدة. وهذا يشير إلى أن النماذج لا تقوم بمجرد حفظ أمثلة محددة، بل تستخدم نظاماً مرناً لدمج محتوى جديد مع أدوار معروفة. لم تدّع الدراسة أنها ستحل كل أسرار الذكاء الاصطناعي، ولم تقترح أن جميع النماذج متطابقة. ومع ذلك، فقد قدمت دليلاً قوياً على أن إطاراً واحداً متماسكًا يمكن أن يفسر كيفية تمثيل هذه الأنظمة للعالم. ومن خلال إظهار أن طرق التفسير المتنوعة تشير جميعها إلى نفس الواقع الهيكلي، فإن هذا العمل ينقل المجال نحو فهم موحد لكيفية عمل الشبكات العصبية، محولاً مجموعة من الملاحظات المعزولة إلى صورة واحدة متماسكة لعقل الآلة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.