VISIONLOGIC: From Neuron Activations to Causally Grounded Concept Rules for Vision Models
تُعد VisionLogic إطار عمل عصبي-رمزي مبتكر يولد تفسيرات هرمية وفية لنماذج الرؤية عبر تعلم عتبات التنشيط لتشكيل المحمولات، واستنتاج قواعد منطقية على مستوى الفئات، وتأصيل هذه القواعد في مفاهيم بصرية تم التحقق منها سببياً من خلال اختبار الاستئصال.
المؤلفون الأصليون:Chuqin Geng, Yuhe Jiang, Ziyu Zhao, Haolin Ye, Anqi Xing, Li Zhang, Xujie Si
تخيل أن لديك طباخاً عبقرياً ولكن غامضاً (الذكاء الاصطناعي) يمكنه طهي شريحة لحم مثالية في كل مرة. إذا سألته: "لماذا أضفت الملح؟"، قد يشير الطباخ إلى كومة من علب الملح على الطاولة ويقول: "لأن الملح يتواجد عادةً هنا عندما أطبخ الشريحة".
هكذا تعمل معظم أدوات التفسير الحالية للذكاء الاصطناعي. إنها تبحث عن الارتباطات (الأشياء التي تحدث معاً). ولكن ماذا لو كان وعاء الملح موضوعاً هناك فقط لأن الطباخ يطبخ دائماً بالقرب من نافذة مالحة، وليس لأن الملح مطلوب فعلياً للشريحة؟ قد يكون الطباخ "يهلوس" بسبب، ويكون هذا التفسير مضللاً.
إطار عمل VISIONLOGIC هو بمثابة محقق يبحث عن الأسباب الحقيقية التي تجعل الطباخ يطبخ بهذه الطريقة. فهو لا ينظر فقط إلى ما هو موجود على الطاولة؛ بل يختبر ما يحدث إذا قمت بإزالة مكون ما.
إليك كيف يعمل VISIONLOGK، مقسماً إلى ثلاث خطوات بسيطة:
1. ترجمة "مفتاح الضوء" (من العصبون إلى المسند المنطقي)
تتكون نماذج التعلم العميق من ملايين المفاتيح الصغيرة التي تسمى "عصبونات". عندما يعمل عصبون ما، فإنه يشبه تشغيل مفتاح ضوء.
الطريقة القديمة: حاول الباحثون تخمين ما يعنيه كل مفتاح ضوء من خلال النظر إلى الصور التي كان فيها المفتاح قيد التشغيل. كان الأمر يشبه تخمين ما يتحكم فيه مفتاح الضوء بمجرد رؤية الغرفة مضاءة.
طريقة VISIONLOGIC: قاموا بتعليم الذكاء الاصطناعي ترجمة هذه المفاتيح المعقدة إلى قواعد بسيطة من نوع نعم/لا (تسمى "المسندات المنطقية"). بدلاً من قول "العصبون 45 عند شدة 0.87"، تصبح الجملة: "هل ذيل السنجاب موجود؟ نعم". لقد حولوا رياضيات الذكاء الاصطناعي المعقدة إلى قائمة مراجعة بسيطة.
2. اختبار "ماذا لو؟" (التأسيس السببي)
هذا هو الجزء السحري. معظم الطرق تتوقف عند قائمة المراجعة، لكن VISIONLOGIC يذهب إلى أبعد من ذلك ليثبت أن عناصر القائمة هي التي تسبب القرار فعلياً.
التشبيه: تخيل أن الذكاء الاصطناعي يقول: "أعتقد أن هذا سنجاب لأنني أرى ذيلاً".
الاختبار: يأخذ VISIONLOGIC صورة السنجاب ويقوم رقمياً بـ مسح الذيل (استبداله بضوضاء ساكنة).
إذا قال الذكاء الاصطناعي فجأة: "لا أعرف ما هذا بعد الآن"، فإن الذيل مهم سببياً. أي أن الذكاء الاصطناعي احتاج إلى الذيل لاتخاذ قراره.
إذا ظل الذكاء الاصطناعي يقول: "هذا سنجاب!" حتى بدون الذيل، فإن الذيل لم يكن السبب الحقيقي. ربما كان الذكاء الاصطناعي ينظر فقط إلى الأشجار في الخلفية.
يقوم VISIONLOGIC بهذا الأمر مراراً وتكراراً، حيث يصغر المساحة الممسوحة حتى يجد المكان الدقيق جداً الذي يمثل بكسلات جوهرية. إنه يشبه النحات الذي ينحت في الحجر حتى يتبقى الشكل الأساسي فقط.
3. "كتاب القواعد" (القواعد المنطقية)
بمجرد أن يثبت VISIONLOGIC الميزات المهمة حقاً، فإنه يكتب كتاب قواعد بسيطاً للذكاء الاصطناعي.
بدلاً من "الصندوق الأسود"، تحصل على جملة واضحة مثل:
"إذا كان (ذيل السنجاب موجوداً) وَ (رأس السنجاب موجوداً) وَ (أذنا الكلب غير موجودين) إذن: إنه سنجاب."
لماذا يعد هذا أمراً بالغ الأهمية؟
يكشف "المخادعين": تخيل ذكاءً اصطناعياً يعتقد أن "الأبقار" هي مجرد "عشب أخضر". إذا عرضت عليه بقرة في صحراء، فسيفشل. الطرق القديمة ستقول: "الذكاء الاصطناعي يرى العشب، لذا يعتقد أنها بقرة". أما VISIONLOGIC فسيختبر هذا، ويدرك أن العشب ليس هو السبب في قرار البقرة، وسيقول: "لا، الذكاء الاصطناعي ينظر في الواقع إلى القرون والضرع". إنه يجد الحقيقة، وليس مجرد المصادفة.
يعمل على أي ذكاء اصطناعي: سواء كان الذكاء الاصطناعي دماغاً قديماً (CNN) أو نموذج محولات حديثاً (ViT)، يمكن لـ VISIONLOGIC ترجمة أفكاره إلى منطق مفهوم للبشر.
يجعل البشر يثقون به أكثر: في الاختبارات مع بشر حقيقيين، ساعد VISIONLOGIC البشر على فهم كيفية تفكير الذكاء الاصطناعي بشكل أفضل بكثير من الطرق السابقة. استطاع الناس بالفعل التنبؤ بما سيفعله الذكاء الاصطناዊ لاحقاً لأن القواعد كانت منطقية.
الخلاصة
VISIONLOGIC يشبه إعطاء الذكاء الاصطناعي مترجماً يتحدث "المنطق البشري" بدلاً من "الرياضيات". فهو لا يخمن فقط ما يفكر فيه الذكاء الاصطناعي، بل يثبت ذلك عبر اختبار قراراته، مما يضمن أن التفسيرات التي نحصل عليها مبنية على السبب والنتيجة الحقيقية، وليس مجرد تخمينات محظوظة. وهذا يجعل الذكاء الاصطناعي أكثر أماناً وموثوقية للوظائف الهامة، مثل تشخيص الأمراض أو قيادة السيارات.
إليك ملخص تقني مفصل لورقة البحث بعنوان "VISIONLOGIC: من تنشيطات العصبونات إلى قواعد المفاهيم ذات الأساس السببي لنماذج الرؤية."
1. بيان المشكلة
تعاني نماذج الرؤية في التعلم العميق (سواء كانت شبكات عصبيات تلافيفية CNN أو محولات الرؤية ViT) من طبيعة "الصندوق الأسود"، مما يعيق الثقة والانتشار في السيناريوهات عالية المخاطر. وبينما ساهمت طرق شرح المفاهيم (مثل TCAV وACE وCRAFT) في تحسين القابلية للتفسير عبر ربط التمثيلات الداخلية بمفاهيم دلالية رفيعة المستوى، إلا أنها تعاني من خلل جوهري:
الارتباط مقابل السببية: تعتمد الطرق الحالية بشكل شبه كلي على الارتباطات الإحصائية بين المفاهيم ومخرجات النموذج. وهي تفتقر إلى التحقق السببي، مما يعني أنها غالبًا ما تحدد ارتباطات زائفة (مثل ربط "المراعي" بـ "البقرة" بسبب ظهورهما معًا في بيانات التدريب) بدلاً من الميزات السببية الحقيقية.
الافتقار إلى المنطق الشامل: غالبًا ما توفر النهج الحالية مساهمات محلية أو درجات للمفاهيم، لكنها تفشل في توليد قواعد منطقية شاملة وقابلة للتفسير تشرح عملية اتخاذ القرار للنموذج ككل.
2. المنهجية: إطار عمل VISIONLOGIC
يعد VISIONLOGIC إطار عمل عصبي-رمزي يجسّر الفجوة بين التنشيطات العصبية والاستدلال الرمزي. وهو يعمل عبر ثلاث مراحل متميزة لإنتاج تفسيرات وفية وهرمية:
المرحلة الأولى: اشتقاق المحمولات (Predicates) من تنشيطات العصبونات
يقوم إطار العمل بتحويل تنشيطات العصبونات المستمرة إلى محمولات ثنائية منفصلة (ذرات منطقية).
تعلم العتبات: بدلاً من استخدام قواعد استدلالية ثابتة، يتعلم VISIONLOGIC عتبات التنشيط لكل قناة (Tj) ومعلمات الحدة (sj).
الوعي بالترتيب: للتعامل مع حقيقة أن أهمية العصبون تختلف باختلاف المدخلات، يعرّف الإطار المحمولات بناءً على كل من مقدار التنشيط وترتيب المساهمة. يكون المحمول pj,≤k(x) صحيحًا إذا كان مساهمة العصبون في لوغاريتم الفئة (class logit) ضمن أفضل-k من المساهمين، وتجاوز تنشيطه العتبة المحددة.
التعامل مع تعدد المعاني (Polysemanticity): يسمح الإطار لقناة واحدة بترميز ميزات متعددة (مثل الفروع الموجبة والسالبة لتنشيطات GELU) ويستخدم التشتت المهيكل (group lasso) لاختيار النافذة الأكثر قدرة تنبؤية للترتيب (k∈{1,2,3}) لكل قناة، وذلك لمنع تضخم المحمولات.
التقطير: يتم تدريب رأس خطي خفيف الوزن لمحاكاة تنبؤات النموذج الأساسي باستخدام هذه المحمولات، مما يضمن استقرار العتبات المتعلمة وقدرتها التنبؤية.
المرحلة الثانية: استنتاج القواعد المنطقية الشاملة
بمجرد تعريف المحمولات، يبني إطار العمل قواعد رمزية لتقريب منطق اتخاذ القرار على مستوى الفئة.
الصيغة الطبيعية العطفية (DNF): يقوم بتجميع أنماط المحمولات المرصودة في أمثلة التدريب المصنفة بشكل صحيح لتشكيل قاعدة DNF لكل فئة.
درجة الاستدلال القائمة على الترتيب: نظرًا لأن مطابقة DNF الدقيقة قد تكون هشة عند التعامل مع بيانات غير مرئية، يستخدم VISIONLOGIC ملف تعريف الترتيب. يقوم بحساب درجة تفسير S(x,c) للفئة c بناءً على متوسط ترتيب المحمولات النشطة لتلك الفئة. الفئة المتوقعة هي التي تمتلك أدنى درجة (أي الفئة التي تفسر ميزاتها النشطة محمولاتها المميزة بشكل أفضل).
القابلية للتفسير: ينتج عن ذلك قواعد موجزة وسهلة القراءة للبشر (على سبيل المثال: "إذا كان الميزة A موجودة وَ الميزة B موجودة، إذن الفئة X").
المرحلة الثالثة: التأسيس السببي عبر الاستئصال (Ablation)
هذا هو الميز التفريقي الجوهري. يقوم VISIONLOGIC بتأسيس المحمولات المجردة في مناطق بصرية محددة باستخدام الاختبارات السببية.
التحسين التكراري: بدءًا من صندوق إحاطة كبير (يتم استهدافه من خرائط الميزات للشبكات التلافيفية أو شبكات الرقع للـ ViTs)، يقوم الخوارزمي بتقليص المنطقة بشكل تكراري.
الاختبار السببي: يتم استبدال المنطقة بضجيج (استئصال). إذا توقف المحمول عن العمل (1→0) عند الاستئصال، تُعتبر المنطقة ضرورية سببيًا.
التحقق من الكفاية: يتحقق من أن المنطقة وحدها كافية لتفعيل المحمول عن طريق لصقها على لوحة ضجيج.
تحسين التجزئة: ليتوافق مع حدود الأجسام، يتم تقاطع الصندوق المحسن مع أقنعة التجزئة (مثل SAM أو Mask R-CNN) وإعادة التحقق منه.
تشكيل المفاهيم: يتم تجميع المناطق التي تم التحقق منها عبر صور متعددة لنفس الفئة لتشكيل مفاهيم بصرية متسقة وذات أساس سببي.
3. المساهمات الرئيسية
التحقق السببي: يعد VISIONLOGIC أول إطار عمل يتحقق بدقة من المفاهيم باستخدام اختبارات الاستئصال السببية، متجاوزًا مجرد الارتباط لضمان أن الميزات المكتشفة ضرورية لقرار النموذج.
التكامل العصبي-الرمزي: نجح في الربط بين التمثيلات العصبية والاستدلال الرمزي من خلال تعلم عتبات التنشيط لإنشاء مفردات محمولات قابلة لإعادة الاستخدام واستنتاج قواعد منطقية شاملة.
خوارزمية التحديد المكاني التكرارية: يقترح خوارزمية فعالة لتحديد مناطق الصور ذات الصلة سببيًا بدقة، حيث تجمع بين تحسين صندوق الإحاطة وتجزئة جاهزة لضمان دقة عالية.
القابلية للتوسع: تم إثبات منهجية العمل على بنيات حديثة واسعة النطاق (ResNet, ConvNeXt, ViT, Swin) مدربة على ImageNet-1k، وهو مقياس كان فيه استخراج القواعد الصريح غير ممكن سابقًا.
4. النتائج التجريبية
التقييم البشري (دراسة المنفعة)
الإعداد: أجريت دراسة واسعة النطاق مع 531 مشاركًا قارنت بين VISIONLOGIC والخطوط المرجعية (بدون تفسير)، وخرائط البروز (التحكم)، وأحدث طرق المفاهيم (ACE, CRAFT) عبر ثلاثة سيناريوهات: كشف الانحياز (Husky vs. Wolf)، تحديد الاستراتيجية الجديدة (Otter vs. Beaver)، وتحليل الفشل (Fox vs. Red Fox).
النتائج: حقق VISIONLOGIC درجات منفعة أعلى بكثير (قدرة المشاركين على التنبؤ بسلوك النموذج على صور غير مرئية) من جميع الطرق الأخرى.
في سيناريو كشف الانحياز، سجل VISIONLOGIC 1.25 (مقاسًا معياريًا)، متفوقًا بشكل ملحوظ على ACE (1.01) وCRAFT (0.89).
أكدت الاختبارات الإحصائية (Kruskal-Wallis وDunn's test) هذه التحسينات بأنها ذات دلالة إحصائية (p<0.05).
أداء النموذج والدقة (Fidelity)
القدرة التنبؤية: يحتفظ VISIONLOGIC إلى حد كبير بالقدرة التمييزية للنماذج الأساسية. في مجموعة التحقق من ImageNet، حقق دقة Top-5 أعلى من 90% للصور المغطاة عبر جميع البنيات (مثل ViT: 97.38%، ConvNeXt: 97.23%).
التغطية والدقة: يغطي 80-89% من الصور بشروحات صالحة ويحافظ على دقة عالية تترا-ون بين 76-88% في الصور المغطاة، مما يعني أن القواعد الرمزية تعكس قرارات الشبكة العصبية بدقة.
التحليل النوعي
اكتشاف المفاهيم: نجح النظام في تحديد مفاهيم ذات معنى دلالي (مثل "منقار الطائر"، "آذان الثعلب"، "قمم الكنائس") والتي تتماشى مع الحدس البشري.
تعدد المعاني (Polysemanticity): كشف النظام أن المحمول الواحد يمكن أن يرمز لمفاهيم متعددة (مثل محمول يكتشف كلاً من "آذان الثعلب" و"قمم الكنائس" بسبب الهندسة المثلثية المشتركة)، وبالعكس، يمكن لمفهوم واحد أن يُرمز به عبر محمولات متعددة.
الشامل مقابل المحلي: يميز الإطار بين المفاهيم النمطية المحلية والمحمولات الهيكلية الشاملة (مثل محمول يرمز للشكل الكامل للسنجاب).
5. الأهمية والأثر
الذكاء الاصطناعي الموثوق: من خلال تقديم تفسيرات ذات أساس سببي، يعالج VISIONLOGIC القصور الجوهري المتمثل في الارتباطات الزائفة في طرق التفسير الحالية، مما يوفر رؤى أكثر موثوقية للتطبيقات عالية المخاطر.
سد الفجوة: يوحد التمثيلات عالية الأبعاد والغامضة للشبكات العصبية العميقة مع المنطق الرمزي الذي يفهمه البشر، مما يجعل النماذج المعقدة أكثر شفافية.
الاتجاهات المستقبلية: يفتح هذا العمل آفاقًا لاستخدام هذه القواعد القابلة للتفسير لتحسين متانة النماذج، واكتشاف الانحيازات، ومن المحتمل تعزيز التعميم عبر الاستفادة من البنية السببية المكتشفة.
باختصار، يمثل VISIONLOGIC تحولًا جذريًا من "ما الذي ينظر إليه النموذج" (الارتباط) إلى "على ماذا يعتمد النموذج" (السببية)، مما يقدم تفسيرات ليست فقط قابلة للتفسير البشري، بل أيضًا رصينة من الناحية المنهجية.