Position: Mechanistic Interpretability Must Disclose Identification Assumptions for Causal Claims
تجادل هذه الورقة بأن أبحاث التفسير الآلي غالباً ما تخلط بين مقاييس التحقق والتعريف السببي من خلال الفشل في التصريح صراحةً بالافتراضات الضرورية، وتقترح معيار إفصاح جديداً يتطلب من المؤلفين توضيح استراتيجيات التعريف الخاصة بهم ومدى متانة ادعاءاتهم السببية بشكل جلي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محقق يحاول اكتشاف سبب قيام آلة معقدة (ذكاء اصطناعي) بما تفعله. تشتبه في أن ترسًا معينًا (دائرة كهربائية أو "ميزة") هو السبب وراء فعل محدد. تقوم بسحب هذا الترس، فتتوقف الآلة عن العمل. تعلن قائلًا: "آها! هذا الترس كان هو السبب!"
تجادل هذه الورقة البحثية بأن الباحثين في مجال "التفسير الآلي" (Mechanistic Interpretability) للذكاء الاصطناعي يطلقون هذه التصريحات كثيرًا جدًا دون اتباع قواعد الأدلة. إنهم يدعون أنهم وجدوا السبب، لكنهم لم يشرحوا لماذا يثبت تجاربهم أنه هو السبب وليس مجرد مصادفة.
إليك تفصيل حجة الورقة البحثية باستخدام تشبيهات بسيطة:
1. المشكلة الجوهرية: "التحقق" ليس هو "التحديد"
تجعل الورقة تمييزًا حاسمًا بين شيئين:
- التحقق (ماذا): "سحبتُ الترس، فتوقفت الآلة." هذه حقيقة. إنه اختبار ناجح.
- التحديد (لماذا): "أنا أعلم يقينًا أن هذا الترس وحده هو الذي تسبب في توقف الآلة، وليس هناك ترس احتياطي مخفي أو أثر جانبي لعملية سحبي للترس."
التشبيه:
تخيل أنك طبيب. أعطيت مريضًا حبة دواء، فانخفضت حرارته.
- التحقق: "انخفضت الحرارة بعد تناول الحبة." (هذه حقيقة).
- التحديد: "الحبة هي التي سببت انخفاض الحرارة." (هذا يتطلب افتراضات).
ربما انخفضت الحرارة لأن هذا هو الوقت من اليوم الذي تنخفض فيه الحرارة طبيعيًا. ربما شرب المريض الماء في نفس الوقت. ربما لم تعمل الحبة، لكن الحرارة كانت في طريقها للزوال على أي حال.
في أبحاث الذكاء الاصطناعي، غالبًا ما تقول الأوراق البحثية: "لقد غيرنا هذا الجزء من الذكاء الاصطناعي، وتغير السلوك، لذا فإن هذا الجزء هو السبب". تجادل الورقة بأنهم يتخطون خطوة إثبات أنه لا يوجد تفسير آخر يمكن أن يكون قد تسبب في هذا التغيير. إنهم يعاملون "انخفاض الحرارة" (التحقق) كدليل على "عمل الحبة" (التحديد) دون التحقق مما إذا كان المريض يمر بدورة حرارية طبيعية.
2. فخ "الافتراضات الخفية"
كلما ادعى باحث أنه وجد سببًا، فإنه يقف على مجموعة من الافتراضات غير المرئية. تقول الورقة إن هذه الافتراضات حاليًا خفية.
التشبيه:
تخيل أن ساحرًا يدعي: "لقد جعلتُ الأرنب يختفي لأنني لوحتُ بعصاي."
- الافتراض الخفي: "الأرنب لم يقفز من الباب الخلفي."
- الافتراض الخفي: "الأرنب لم يكن مختفيًا بالفعل قبل أن ألوح بعصاي."
في أوراق الذكاء الاصطناعي، "الخدع السحرية" هي أشياء مثل:
- الترقيع النشط (Activation Patching): "لقد استبدلنا هذا الجزء من دماغ الذكاء الاصطناعي. تغير السلوك."
- الافتراض الخفي: "نحن لم نوقظ بالخطأ نظامًا احتياطيًا نائمًا يقوم أيضًا بهذه المهمة."
- المشفّرات التلقائية المتفرقة (Sparse Autoencoders - SAEs): "وجدنا 'ميزة' معينة في الذكاء الاصطناعي تمثل مفهوم 'الأمانة'."
- الافتراض الخفي: "هذه الميزة هي لب بناء فريد ومستقل، وليست مجرد مزيج فوضوي من أشياء أخرى تبدو وكأنها 'أمانة'."
راجعت الورقة 10 أوراق بحثية رئيسية (وتفحصت 30 أخرى) ووجدت أن صفرًا منها لديه قسم مخصص يسرد هذه الافتراضات الخفية. هم فقط يعرضون الخدعة السحرية (النتيجة) ويقولون "انظروا، إنها تعمل!" دون الاعتراف بالقواعد التي يفترضون أن الكون يتبعها.
3. خطأ "الاستبدال"
تسمي الورقة العادة الحالية بـ "استبدال مقياس التحقق" (Validation Metric Substitution).
التشبيه:
تخيل أن ميكانيكي سيارات يقول: "لقًت إصلاحتُ المحرك لأن السيارة اشتغلت."
- الخطأ: الميكانيكي يستبدل النتيجة (السيارة اشتغلت) بـ الدليل (أنا أعرف بالضبط أي جزء أصلحت وأنه لا يوجد شيء آخر يمكن أن يشغل السيارة).
- الواقع: قد تكون السيارة قد اشتغلت لأن البطارية شحنت نفسها، أو لأن الميكانيكي ضغط على المفتاح بالخطأ، أو أن المحرك كان سليمًا طوال الوقت.
في أوراق الذكاء الاصطناعي، يبلغ الباحثون عن مقاييس مثل "الإخلاص" (هل التفسير يطابق النموذج؟) أو "الاكتمال" (هل وجدنا جميع الأجزاء؟). تجادل الورقة بأن هذه مجرد لحظات "السيارة اشتغلت". هي جيدة لوجودها، لكنها ليست دليلًا على السببية ما لم تذكر الافتراضات التي تجعلها دليلًا.
4. الحل المقترح: "بروتوكول الإفصاح"
تقترح المؤلفة أن المجال يجب أن يستعير قاعدة من علم الاقتصاد القياسي (Econometrics) (دراسة البيانات الاقتصادية). في الاقتصاد، إذا ادعيت أن "س تسبب ص"، يجب عليك التصريح بوضوح بـ:
- ما تدعيه: "نحن ندعي أن س تسبب ص."
- الاستراتيجية: "نحن نستخدم الطريقة ز لإثبات ذلك."
- الافتراضات: "نحن نفترض أن [الشرط أ] و [الشرط ب] صحيحان."
- اختبار الضغط: "إذا كان [الشرط أ] خطأ، فإن استنتاجنا ينهار. إليكم كيف اختبرنا ما إذا كان ذلك صحيحًا."
التشبيه:
بدلاً من مجرد قول "الحبة نجحت"، يجب على الطبيب كتابة تقرير:
- "نحن ندعي أن الحبة خفضت الحرارة."
- "نحن نفترض أن المريض لم يتناول أدوية أخرى."
- "نحن نفترض أن الحرارة لم تكن تنتهي طبيعيًا."
- "إذا كان المريض قد تناول أدوية أخرى، فإن استنتاجنا خاطئ. إليكم البيانات التي تظهر أنهم لم يفعلوا ذلك."
5. ما وجدته المراجعة (Audit)
نظرت المؤلفة في 10 أوراق بحثية رئيسية في هذا المجال (تغطي طرقًا مختلفة مثل اكتشاف الدوائر والمشفّرات التلقائية) ثم فحصت 30 ورقة أخرى.
- النتيجة: 0 من أصل 30 ورقة بحثية كان لديها قسم مخصص يسرد افتراضات التحديد الخاصة بها.
- النتيجة: معظم الأوراق (حوالي 19 إلى 26 من أصل 30، اعتمادًا على مدى صرامتك) استخدمت "مقاييس التحقق" (مثل "تصرف الذكاء الاصطناعي كما هو متوقع") كبديل لإثبات صحة افتراضاتها.
- النتيجة: حتى الأوراق الأكثر دقة، والتي وجدت أخطاء في أعمال الآخرين، لم تدرج صراحةً الافتراضات التي كانت تستخدمها للعثور على تلك الأخطاء.
ملخص
هذه الورقة هي دعوة للأمانة والوضوح. هي لا تقول إن أبحاث الذكاء الاصطناعي خاطئة؛ بل تقول إن أبحاث الذكاء الاصطناعي غير مكتملة.
في الوقت الحالي، يقول الباحثون: "انظروا، لقد وجدنا السبب!"
تقول الورقة: "من فضلكم توقفوا وأخبرونا ما هي القواعد التي تفترضونها لجعل هذا الادعاء. إذا لم تخبرونا بالقواعد، فلن نعرف ما إذا كان 'السبب' الذي وجدتموه حقيقيًا أم مجرد تخمين محظوظ."
إنها تطلب من المجال الانتقال من "انظروا كم هي خدعتنا السحرية رائعة" إلى "إليكم بالضبط كيف تعمل الخدعة، وإليكم لماذا نعلم أنها ليست مجرد خدعة".
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.