← أحدث الأبحاث
💻 computer science

Reg4Pru: Regularisation Through Random Token Routing for Token Pruning

تقدم الورقة البحثية Reg4Pru، وهي تقنية تنظيم تخفف من فقدان الأداء في عملية تقليم الرموز (token pruning) لنماذج المحولات الرؤيوية (vision transformers)، محققةً تحسناً مطلقاً بنسبة 46% في متوسط الدقة وتسريعاً بنسبة 29% في مجموعة بيانات FIVES لتجزئة الأوعية الدموية.

المؤلفون الأصليون: Julian Wyatt, Ronald Clark, Irina Voiculescu

نُشر 2026-02-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Julian Wyatt, Ronald Clark, Irina Voiculescu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة Reg4Pru باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة الكبرى: "الحفلة المزدحمة"

تخيل أن "محول الرؤية" (Vision Transformer) -وهو العقل الاصطناعي وراء التعرف الحديث على الصور- عبارة عن حفلة ضخمة وعالية المخاطر. "الضيوف" في هذه الحفلة هم الرموز (Tokens)، وهي قطع صغيرة من الصورة التي يحللها الذكاء الاصطناعي.

في الإعداد القياسي، يتحدث كل ضيف مع كل الضيوف الآخرين لمعرفة ماهية الصورة. هذا يعمل بشكل رائع من حيث الدقة، لكنه بطيء للغاية. إذا ضاعفت عدد الضيوف، فإن كمية المحادثات المطلوبة تتضاعف أربع مرات. الأمر يشبه محاولة إجراء محادثة هادفة في ملعب مليء بالناس؛ الأمر يستغرق وقتاً طويلاً جداً.

ولحل هذه المشكلة، اخترع الباحثون تقنية "تقليم الرموز" (Token Pruning). هذا يشبه وجود حارس أمن عند الباب يقوم بطرد "الضيوف المملين" (الأجزاء الزائدة عن الحاجة في الصورة) حتى تسير الحفلة بشكل أسرع.

الخلل: تأثير "فقدان الذاكرة"

تحدد الورقة مشكلة رئيسية في استراتيجية حارس الأمن هذه:

  1. أثناء التدريب: يتعلم الذكاء الاصطناعي من خلال النظر إلى الحفلة بأكملها، ثم يقوم أحياناً بطرد بعض الأشخاص لممارسة الكفاءة.
  2. أثناء الاختبار (Inference): يقوم الذكاء الاصطناعي بطرد الأشخاص نهائياً لتوف توفير الوقت. لكن هنا تكمن المشكلة: عندما يحتاج لاتخاذ قرار نهائي (مثل رسم خريطة مفصلة للأوعية الدموية)، يجب عليه إعادة الضيوف الذين طُردوا لملء التفاصيل المفقودة.

المشكلة: يصاب الذكاء الاصطناعي بالارتباك. فالضيوف "المطرودون" كانوا جالسين في الظلام (يتخطون الطبقات) بينما كان الضيوف "المتبقون" يحتفلون ويتعلمون. عندما يحاول الذكاء الاصطناعي إعادة هؤلاء الضيوف إلى الضوء، لا يعودون متناسبين مع المجموعة. لقد أصيبوا بـ "فقدان الذاكرة" عما حدث أثناء غيابهم. هذا يتسبب في انهيار أداء الذكاء الاصطناعي، خاصة في الطبقات الأعمق والأكثر تعقيداً من الشبكة. الأمر يشبه محاولة إنهاء لغز (بازل) معقد بقطع نسيت كيف يبدو شكل الصورة في منتصف الطريق.

الحل: Reg4Pru (الـ "بروفة العشوائية")

يقترح المؤلفون تقنية تدريب جديدة تسمى Reg4Pru (التنظيم عبر التوجيه العشوائي للرموز).

فكر في هذا كأنه لعبة بروفة (تدريب) للذكاء الاصطناعي قبل العرض الحقيقي.

بدلاً من مجرد طرد الناس والأمل في الحصول على أفضل نتيجة، يلعب الذكاء الاصطناعي لعبة أثناء التدريب حيث يخبر مجموعات مختلفة من الضيوف عشوائياً بأن "يتخطوا" أجزاء مختلفة من الحفلة لفترات زمنية عشوائية.

  • العشوائية هي المفتاح: أحياناً يتخطى الضيف (أ) غرفتين؛ وأحياناً يتخطى الضيف (ب) 5 غرف. "منطقة التخطي" تتغير في كل مرة.
  • النتيجة: لأن الضيوف يُطلب منهم باستمرار تخطي أقسام عشوائية ثم العودة مجدداً، فإنهم يتعلمون أن يكونوا متكيفين. يتعلمون أنه بغض النظر عن المكان الذي يدخلون منه إلى الحفلة أو المدة التي غابوها، يمكنهم دائماً الاندماج والمساهمة في الصورة النهائية.

هذه "البروفة العشوائية" تعمل كمثبت. فهي تعلم الذكاء الاصطناعي أن إعادة الضيوف من "الظلام" أمر آمن، مما يمنع الارتباك وهبوط الأداء الذي شهدته الطرق السابقة.

النتائج: أسرع وأذكى

اختبر الفريق طريقتهم على مجموعة بيانات طبية تسمى FIVES، والتي تتضمن العثين على الأوعية الدموية في صور العين (وهي مهمة تتطلب دقة عالية).

  • المقارنة: قارنوا طريقتهم مع "حارس الأمن" القياسي (التقليم بدون هذه الطريقة الجديدة) ومع خط الأساس "بدون تقليم".
  • الانتصار:
    • الدقة: كانت طريقة التقليم القياسية سيئة للغاية في المرحلة النهائية (حيث انخفضت الدقة بشكل كبير). نجحت Reg4Pru في حل ذلك، حيث حسنت متوسط الدقة بنسبة هائلة بلغت 46% مقارنة بطريقة التقليم القياسية.
    • السرعة: حققوا هذه الدقة العالية مع كونهم أسرع بنسبة 29% من النسخة البطيئة غير المقلمة.
    • المرئيات: تظهر الورقة خرائط حرارية حيث تنتج طريقة التقليم القياسية نتائج ضبابية وغير واضحة، بينما تنتج Reg4Pru صوراً حادة وواضحة للأوعي الدموية، تكاد تكون بجودة النسخة البطيئة غير المقلمة.

الملخص

Reg4Pru هي خدعة تدريب تمنع الذكاء الاصطناعي من الارتباك عندما يحاول تسريع العمل عبر تجاهل أجزاء من الصورة. من خلال ممارسة "التخطي" و"الالتحاق مجدداً" بشكل عشوائي أثناء التدريب، يتعلم الذكاء الاصطناعي البقاء مستقراً ودقيقاً، مما يسمح له بمعالجة الصور الطبية عالية الدقة بشكل أسرع بكثير دون فقدان التفاصيل الدقيقة التي يحتاجها الأطباء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →