← أحدث الأبحاث
💻 computer science

Entropy Reveals Block Importance in Masked Self-Supervised Vision Transformers

تقدم هذه الورقة البحثية "Gardener"، وهي طريقة تقليم (pruning) أحادية الخطوة وخالية من البيانات، تستفيد من اعتلال المعلومات (information entropy) لأوزان الكتل مسبقة التدريب لتحديد وإزالة الكتل الزائدة في نماذج المحولات الرؤيوية ذات التعلم الذاتي المقنع (masked self-supervised vision transformers)، مما يحقق ضغطاً كبيراً للنموذج مع أدنى تأثير على الأداء في المهام اللاحقة.

المؤلفون الأصليون: Peihao Xiang, Kaida Wu, Ou Bai

نُشر 2026-02-05
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Peihao Xiang, Kaida Wu, Ou Bai

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك دماغاً آلياً ضخماً وذكياً للغاية (محول رؤية - Vision Transformer)، قضى سنوات في تعلم فهم العالم بمجرد النظر إلى ملايين مقاطع الفيديو غير المصنفة. هذا الدماغ ضخم، ويحتوي على 12 طبقة متميزة من كتل التفكير، وهو كبير لدرجة أنه يصعب وضعه في الأجهزة الصغيرة مثل الهواتف أو الطائرون بدون طيار.

السؤال الكبير الذي طرحه المؤلفون هو: هل نحتاج حقاً إلى كل هذه الكتل الاثنتي عشرة للقيام بعمل جيد؟ أم أن بعضها مجرد "وزن زائد" يمكننا التخلص منه؟

المشكلة: "العراف" بطيء جداً

عادةً، لمعرفة أي الكتل مهمة، يتعين عليك لعب لعبة "الإزالة والاختبار". تأخذ كتلة واحدة، تختبر الروبوت، تأخذ أخرى، تختبر مجدداً، وتكرر ذلك 12 مرة. هذا يشبه محاولة معرفة أفضل المكونات في حساء ضخم عن طريق تذوق الحساء بعد إزالة مكون واحد في كل مرة. إنها طريقة تعمل، لكنها تستغرق وقتاً طويلاً وتتطلب الكثير من القدرة الحوسبية (وغالباً، ستحتاج إلى مجموعة بيانات محددة للاختبار عليها).

الحل: طريقة "البستاني"

ابتكر المؤلفون، بيهاو شيانغ وفريقه، اختصاراً ذكياً يسمى Gardener (البستاني).

بدلاً من تذوق الحساء (اختبار النموذج باستخدام البيانات)، قرروا فقط النظر إلى الوصفة (الأوزان الداخلية للنموذج) وتخمين أي المكونات أساسية.

لقد اكتشفوا شفرة سرية مخبأة في رياضيات دماغ الروبوت: الاعتلاج (Entropy).

  • التشبيه: تخيل أن كل كتلة تفكير هي مكتبة من الكتب.
    • اعتلاج منخفض (الكتلة "المملة"): هذه المكتبة لا تحتوي إلا على نسخ من نفس الكتاب تماماً. إنها متكررة ورتيبة للغاية. وجد المؤلفون أن هذه الكتل تشبه "أمين المكتبة المكرر" – يمكنك فصلهم عن العمل، وستظل المكتبة تعمل بشكل جيد.
    • اعتلاج مرتفع (الكتلة "المزدحمة"): هذه المكتبة تحتوي على مزيج متنوع وضخم من كتب مختلفة، منتشرة في كل مكان على الرفوف. إنها فوضوية ومتنوعة. وجد المؤلفون أن هذه الكتل هي "أمناء المكتبة الخارقون" الذين يحملون المعرفة الأكثر تميزاً وأهمية.

كيف يعمل Gardener

  1. لا حاجة للبيانات: لا يحتاج Gardener لرؤية فيديو واحد أو صورة واحدة. إنه ينظر فقط إلى الأرقام الموجودة داخل النموذج المدرب مسبقاً.
  2. قرار بضربة واحدة: يقوم بحساب "درجة الفوضى" (الاعتلاج) لكل كتلة على حدة.
  3. التقليم: يحدد فوراً الكتل ذات "درجات الفوضى" الأدنى (الأكثر تكراراً) ويزيلها. يقوم بذلك في تمريرة واحدة، وبشكل فوري.

النتائج

اختبر الفريق طريقتهم على نموذج التعرف على الفيديو المسمى VideoMAE.

  • الصدمة: وجدوا أنه يمكنك استئصال ما يصل إلى 91.7% من الكتل (ترك جزء ضئيل جداً فقط) ولا يزال بإمكان الروبوت التعرف على الأفعال البشرية بشكل يقارب النسخة كاملة الحجم!
  • المقارنة: كانت طريقة "البستاني" الخاصة بهم بجودة طريقة "تذوق الحساء" البطيئة والمكلفة (التقليم القائم على الحساسية)، لكنها كانت أسرع بآلاف المرات لأنها لم تكن بحاجة إلى بيانات أو إعادة تدريب.

لماذا يهم هذا الأمر

تثبت هذه الورقة البحثية أن أدمغة الذكاء الاصطناعي العملاقة هذه مليئة بالزيادات. فهي ليست جميعها متساوية في الأهمية. ومن خلال استخدام قياس رياضي بسيط لمدى "اختلاط" الأرقام، يمكننا فوراً تقليم الدهون الزائدة من هذه النماذج الضخمة، مما يجعلها صغيرة بما يكفي للعمل على الأجهزة اليومية دون الحاجة إلى إعادة تدريبها أو الوصول إلى بيانات خاصة.

باختصار: لست بحاجة لتذوق الحساء لتعرف أي المكونات عديمة الفائدة؛ بل تحتاج فقط إلى النظر في كيفية تخزين تلك المكونات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →