← أحدث الأبحاث
🤖 AI

DAVE: Distribution-aware Attribution via ViT Gradient Decomposition

تقدم الورقة البحثية DAVE، وهي طريقة عزو ذات أساس رياضي لنماذج المحولات الرؤية (Vision Transformers)، والتي تعمل على تفكيك تدرجات المدخلات لعزل المكونات المستقرة والمتساوية التباين محلياً والقضاء على الآثار المعمارية، مما يتيح توليد تفسيرات عالية الدقة ومستقرة على مستوى البكسل.

المؤلفون الأصليون: Adam Wróbel, Siddhartha Gairola, Jacek Tabor, Bernt Schiele, Bartosz Zieliński, Dawid Rymarczyk

نُشر 2026-02-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Adam Wróbel, Siddhartha Gairola, Jacek Tabor, Bernt Schiele, Bartosz Zieliński, Dawid Rymarczyk

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك روبوتًا ذكيًا جدًا (محول رؤية - Vision Transformer) ينظر إلى صورة ويقول: "هذه كرة قدم!" ولكن إذا سألت الروبوت: "لماذا اعتقدت ذلك؟" يعطيك إجابة مربكة. قد يشير إلى الصورة بأكملها بشكل غامض، أو والأسوأ من ذلك، قد يشير إلى نمط شبكي غريب موجود فقط بسبب الطريقة التي بُني بها الروبوت، وليس بسبب الكرة نفسها.

تقدم هذه الورقة أداة جديدة تسمى DAVE (التفسير القائم على التوزيع عبر تفكيك تدرج محول الرؤية) لإصلاح هذا الارتباك. فكر في DAVE كـ كشاف عالي الدقة ومزود بخاصية إلغاء الضجيج يساعدنا على رؤية ما ينظر إليه الروبوت بالفعل بدقة.

إليك كيف يعمل، مقسمًا إلى مفاهيم بسيطة:

1. المشكلة: "الوشوشة" في الراديو

عندما تحاول نماذج الذكاء الاصطنا_الحالية شرح قراراتها، فإنها غالبًا ما تنتج "ضجيجًا" أو "آثارًا اصطناعية".

  • التشبيه: تخيل أنك تستمع إلى محطة راديو، ولكن هناك طنين مستمر ونمط شبكي غريب يتداخل مع الموسيقى. يمكنك سماع الأغنية (التنبؤ)، لكن الوشوشة (التفسير) تجعل من الصعب معرفة أي آلة تعزف أي نوتة.
  • الواقع: في محولات الرؤية (Vision Transformers)، الطريقة التي يعالج بها النموذج الصور (تقسيمها إلى قطع واستخدام "الانتباه") تخلق هذه الأنماط الاصطناعية. الطرق الحالية غالبًا ما تتشتت بهذا الضجيج، فتشير إلى خطوط الشبكة بدلًا من الكائن الفعلي.

2. الحل: فصل الإشارة عن الضجيج

يعمل DAVE عن طريق تفكيك "عملية التفكير" لدى الروبوت (التدرج/Gradient) رياضيًا إلى جزأين متميزين:

  • الجزء أ: الإشارة الحقيقية (التحول الفعال): هذا هو الجزء من دماغ الروبوت الذي يتغير فعليًا بناءً على ما يوجد في الصورة. إذا حركت كرة القدم، فهذا الجزء يتحرك معها. هذه هي المعلومات المفيدة.
  • الجزء ب: غرائب الروبوت (تباين المُشغل): هذا هو الجزء الذي يتغير لمجرد أن تروس الروبوت الداخلية تحركت قليلًا، حتى لو لم تتغير الصورة. هذا هو "الضجيج" أو "النمط الشبكي".

المجاز: تخيل طباخًا يتذوق حساءً.

  • الإشارة: يقول الطباخ: "إنه مالح بسبب الملح". (هذا هو السبب الحقيقي).
  • الضوضاء: يقول الطباخ: "إنه مالح لأن الملعقة التي أحملها تهتز". (هذا أثر ناتج عن الأداة، وليس من الحساء).
  • مهمة DAVE: يقوم DAVE بتصفية الملعقة المهتزة ويخبرك: "إنه بسبب الملح".

3. الخدعة السحرية: فلتر "اليد الثابتة"

بمجرد أن يفصل DAVE بين الإشارة الحقيقية وغرائب الروبوت، فإنه يقوم بحركة ذكية تسمى الترشيح المتماثل (Equivariant Filtering).

  • التشبيه: تخيل أنك تحاول العثور على وجه معين في حشد من الناس. إذا أملت رأسك قليلًا، يظل الوجه هو نفسه. إذا حركت عينيك قليلًا، يظل الوجه موجودًا.
  • كيف يستخدم DAVE هذا: يسأل DAVE النموذج: "إذا قمت بتدوير هذه الصورة قليلًا أو حركت بكسلات قليلة، هل يتغير تفسيرك؟"
    • إذا كان التفسير يقفز بشكل عشوائي، يعرف DAVE أن هذا "ضجيج" غير مستقر ويقوم بالتخلص منه.
    • إذا ظل التفسير ثابتًا (مثل بقاء الوجه كما هو)، يحتفظ به DAVE.
  • النتيجة: هذا يخلق خريطة سلسة ومستقرة تسلط الضوء على الكائن الفعلي (مثل كرة القدم) دون الآثار الشبكية المتعرجة.

4. اللمسة النهائية: تنعيم الحواف الخشنة

أخيرًا، يطبق DAVE "تغبيشًا" لطيفًا (ترشيح الترددات المنخفضة) على النتيجة.

  • التشبيه: فكر في النظر إلى صورة عالية الدقة من خلال نافذة ضبابية قليلًا. الضباب يزيل ذرات الغبار الصغيرة المشتتة (ضجيج الترددات العالية) ولكنه يبقي الصورة الأساسية واضحة.
  • النتيجة: الخريطة النهائية تكون سلسة، دقيقة، وتسلط الضوء بالضبط على البكسلات التي استخدمها النموذج لاتخاذ قراره.

ماذا وجدوا؟

اختبر المؤلفون DAVE على العديد من نماذج الذكاء الاصطناعي المختلفة (مثل DeiT و DINO) باستخدام قاعدة بيانات ضخمة من الصور (ImageNet).

  • دقة أفضل: عندما تحققوا مما إذا كان تفسير الذكاء الاصطناعي يشير بالفعل إلى الكائن، كان DAVE أفضل بكثير من الطرق السابقة. لقد وجد الكائن بشكل متكرر أكثر.
  • ضجيج أقل: الخرائط المرئية التي أنتجها DAVE لم تكن تحتوي على تلك الأنماط الشبكية المزعجة. لقد بدت كإضاءات طبيعية يمكن للبشر فهمها.
  • الاستقرار: إذا غيروا الصورة قليلًا (تدويرها أو إزاحتها)، ظل تفسير DAVE كما هو، مما يثبت أنه كان ينظر إلى الكائن، وليس إلى البكسلات.

باختصار: DAVE هو طريقة جديدة للاستماع إلى نماذج الذكاء الاصطناعي تقوم بتصفية "الوشوشة" الناتجة عن بنية النموذج نفسه، مما يمنحنا رؤية واضحة، مستقرة، ودقيقة لما يراه الذكاء الاصطناعي بالفعل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →