Elastic Attention Cores for Scalable Vision Transformers
تقدم هذه الورقة بحثًا حول VECA (انتباه النواة المرن البصري)، وهي بنية محول رؤية (Vision Transformer) تحقق تعقيدًا حسابيًا خطيًا ومعالجة عالية الدقة وقابلة للتوسع عبر استبدال الانتباه الذاتي الشامل التربيعي بهيكل نواة-محيط فعال حيث تتواصل رموز الرقع (patch tokens) حصريًا من خلال مجموعة صغيرة متعلمة من تضمينات النواة.
المؤلفون الأصليون:Alan Z. Song, Yinjie Chen, Mu Nan, Rui Zhang, Jiahang Cao, Weijian Mai, Muquan Yu, Hossein Adeli, Deva Ramanan, Michael J. Tarr, Andrew F. Luo
المؤلفون الأصليون: Alan Z. Song, Yinjie Chen, Mu Nan, Rui Zhang, Jiahang Cao, Weijian Mai, Muquan Yu, Hossein Adeli, Deva Ramanan, Michael J. Tarr, Andrew F. Luo
تخيل أنك تحاول تنظيم حفلة ضخمة بآلاف الضيوف (البيكسلات في صورة ما).
الطريقة القديمة: حفلة "الكل يتحدث مع الجميع"
تعمل نماذج الذكاء الاصطناğı التقليدية، والتي تُسمى "محولات الرؤية" (Vision Transformers - ViTs)، مثل حفلة فوضوية حيث يجب على كل ضيف من الضيوف تقديم نفسه لكل ضيف آخر لفهم ما يدور في الغرفة.
المشكلة: إذا كان لديك 100 ضيف، فهذا يعني 10,000 مصافحة. وإذا كان لديك 1,000 ضيف (صورة عالية الدقة)، فهذا يعني 1,000,000 مصافحة. الوقت المستغرق لتنظيم هذا ينمو بشكل انفجاري (تربيعي). إنه بطيء ومكلف للغاية لدرجة أن هذه النماذج تعاني مع الصور عالية الدقة.
الافتراض: افترضت النماذج القديمة أنه لكي "يرى" الكمبيوتر جسماً ما، يجب أن يتحدث كل بيكسل مباشرة مع كل بيكسل آخر.
الطريقة الجديدة: VECA (حفلة "النواة المتميزة")
يقول مؤلفو هذه الورقة البحثية، آلان سونغ وزملاؤه: "مهلاً لحظة. هل نحتاج حقاً لأن يتحدث الجميع مع الجميع؟" لقد اقترحوا نظاماً جديداً يسمى VECA (انتباه النواة البصرية المرنة - Visual Elastic Core Attention).
فكر في VECA كحفلة تتكون من مجموعة نواة متميزة (VIP) وقائمة ضيوف عامة.
نوى الـ VIP: بدلاً من آلاف الضيوف الذين يتحدثون مع بعضهم البعض، ينشئ النموذج مجموعة صغيرة وثابتة من "الشخصيات الهامة" (تسمى Core Tokens أو رموز النواة). لنقل مثلاً أن هناك 64 شخصية VIP فقط.
قاعدة التواصل:
الضيوف (أجزاء الصورة) يتحدثون فقط إلى الـ VIPs. هم لا يتحدثون مع بعضهم البعض مباشرة.
الـ VIPs يتحدثون إلى الجميع (جميع الضيوف والـ VIPs الآخرين).
النتيجة: تتدفق المعلومات من الضيف ← إلى الـ VIP ← ثم إلى الضيف. لا يحتاج الضيوف أبداً للمصافحة فيما بينهم.
مكاسب الكفاءة:
في الطريقة القديمة، مضاعفة عدد الضيوف كانت تؤدي إلى أربعة أضعاف العمل.
في VECA، مضاعفة عدد الضيوف تضاعف العمل فقط (نمو خطي). الأمر يشبه وجود فريق صغير وفعال من المديرين (الـ VIPs) لإدارة الفوضى، بدلاً من إجبار كل موظف على إدارة كل موظف آخر.
القوة الخارقة لـ "المرونة" (Elastic)
الجزء الأروع في VECA هو أنه مرن (قابل للتمدد).
التدريب: أثناء التدريب، يتعلم النموذج ترتيب شخصيات الـ VIP الخاصة به. بعض الـ VIPs هم "كبار الشخصيات" الذين يعرفون الأشياء الأكثر أهمية (مثل "يوجد كلب هنا")، بينما الآخرون هم "شخصيات VIP ناشئة" الذين يعرفون التفاصيل الدقيقة (مثل "الكلب لديه أذن متدلية").
الاستدلال (الحفلة أثناء العمل):
هل تحتاج للسرعة؟ يمكنك إخبار النموذج: "استخدم فقط أفضل 8 من الـ VIPs". سيعمل النموذج فوراً بشكل أسرع لأنه يتجاهل الموظفين المبتدئين. قد يكون أقل تفصيلاً، لكنه سريع جداً.
هل تحتاج للجودة العالية؟ يمكنك القول: "استخدم جميع الـ 64 من الـ VIPs". سيصبح النموذج أبطأ قليلاً ولكنه سيعطيك إجابة فائقة الدقة والتفصيل.
لا حاجة لإعادة التدريب: لا تحتاج لبناء نموذج جديد من أجل السرعة أو الجودة. يمكنك فقط تمديد أو تقليص عدد الـ VIPs أثناء التشغيل.
ماذا وجدوا؟
اختبر المؤلفون هذا على مجموعة متنوعة من المهام، مثل التعرف على ما يوجد في الصورة (التصنيف) ورسم الخطوط المحيطة بالأجسام (التجزئة).
الأداء: حتى مع استخدام "الاختصار" المتمثل في عدم السماح للبيكسلات بالتحدث مباشرة، قدم VECA أداءً يقارب أفضل النماذج المكلفة المتاحة حالياً (مثل DINOv3).
الاكتشاف السحري: لاحظ أن الـ VIPs (رموز النواة) تعلموا بشكل طبيعي كيف يعملون كـ كواشف للأجسام. دون أن يُطلب منهم ذلك صراحة، بدأت رموز الـ VIP بالتجمع لتمثيل أشياء محددة، مثل "بيض في وعاء" أو "عجلة سيارة". لقد تطوروا من مجرد كتل غامضة من المعلومات إلى مجموعات دلالية محددة.
الدقة (Resolution): يعمل النموذج بشكل رائع على الصور الصغيرة ويتوسع ليشمل الصور الضخمة عالية الدقة دون أن ينهار أو يصبح بطيئاً جداً، على عكس النماذج القديمة.
الخلا الخلاصة
تزعم الورقة البحثية أننا لسنا بحاجة إلى طريقة "الكل يتحدث مع الجميع" المكلفة والتربيعية لبناء ذكاء اصطناعي بصري ذكي. من خلال استخدام فريق صغير وذكي من رموز "النواة" لوساطة التواصل، يمكننا بناء نماذج تكون:
أسرع وأرخص (خاصة للصور عالية الدقة).
مرنة (يمكنك المقايضة بين السرعة والدقة في أي وقت).
ذكية تماماً مثل عمالقة التكنولوجيا الحالية.
إنه حجر بناء جديد لمستقبل الرؤية الحاسوبية يجعل الذكاء الاصطناعي عالي الدقة أمراً واقعياً وفعالاً.
حققت نماذج المحولات الرؤيوية (ViTs) توسعاً قوياً مدفوعاً بالبيانات من خلال الاستفضاء بآلية "الانتباه من الكل إلى الكل" (all-to-all self-attention)، مما يسمح بمجالات استقبال عالمية وتمثيلات مرنة. ومع ذلك، فإن هذه المرونة تترتب عليها تكلفة حوسبية تتناسب تربيعياً (O(N2)) مع دقة الصورة، حيث N هو عدد رقع الصور (patches). هذا التوسع التربيعي يصبح عائقاً في المجالات ذات الدقة العالية، مما يحد من إمكانية تطبيق نماذج ViT القياسية.
الافتراض السائد في تصميم ViT هو أن التفاعلات الكثيفة بين كل زوج من الرموز (tokens) ضرورية لتعلم تمثيلات بصرية-دلالية غنية. تتحدى هذه الورقة هذا الافتراض، وتفترض أن التمثيلات البصرية الفعالة يمكن تعلمها دون الحاجة إلى تفاعلات مباشرة بين الرقع (patch-to-patch).
المنهجية: VECA (انتباه النواة والطرف المرئي)
تقترح المؤلفة VECA، وهي بنية محول رؤيوي تستبدل الانتباه الذاتي الكثيف القياسي بآلية انتباه النواة والطرف ذات الفراغات المتفرقة (block-sparse core-periphery attention).
البنية الأساسية
بنية النواة والطرف (Core-Periphery Structure): تقدم البنية مجموعة صغيرة متعلمة من C من رموز "النواة" (core tokens) التي تعمل كواجهة اتصال. تشكل رقع الصورة "الطرف" (periphery).
آلية التفاعل:
رموز النواة: تشكل مجموعة متصلة بالكامل (clique)، حيث تنتبه إلى جميع رموز النواة الأخرى وإلى جميع رموز الرقع.
رموز الرقع: تنتبه فقط إلى رموز النواة النشطة. هي لا تنتبه مباشرة إلى رموز الرقع الأخرى.
تدفق المعلومات: يتم توجيه جميع عمليات تبادل المعلومات بين الرقع حصرياً عبر رموز النواة.
التعقيد: تم تقليل تكلفة الانتباه من O(N2) إلى O(2NC+C2). بالنسبة لعدد محدد مسبقاً من النوى C (حيث C≪N)، يتوسع التعقيد خطياً (O(N)) مع دقة الصورة.
الديناميكيات المكانية: يتم تهيئة رموز النواة بإحداثيات ثنائية الأبعاد (2D) قابلة للتعلم، ويتم تحديثها عبر الطبقات بواسطة رأس إحداثيات خفيف الوزن. وهي تستخدم ترميز الموضع الدوراني (RoPE) المحوري ثنائي الأبعاد، مما يسمح لها بالحفاظ على كل من التمثيلات الدلالية والمواقع المكانية المتطورة.
التدريب والاستدلال المرن
الإسقاط المتداخل (Nested Dropout): أثناء التدريب، يستخدم النموذج إسقاطاً متداخلاً على مجموعة رموز النواة المرتبة. يتم تدريب النموذج بميزانية متغيرة من النوى النشطة (C)، يتم أخذ عينات منها من توزيع معين.
التصنيف الضمني: تقوم هذه العملية بتصنيف رموز النواة ضمنياً حسب الأهمية. النوى المبكرة تكون نشطة عبر جميع الميزانيات وتتعلم تشفير المعلومات البصرية الأكثر جوهرية وفائدة على نطاق واسع. أما النوى اللاحقة فتتخصص في التفاصيل المكانية الأدق أو المفاهيم الدلالية المحددة.
المرونة عند الاستدلال: في وقت الاختبار، يمكن تعديل عدد النوى النشطة دون إعادة تدريب. يتيح هذا توازناً مرناً بين التكلفة الحوسبية (السرعة) والدقة. يؤدي تقليل C إلى خرائط انتباه أكثر خشونة ولكن مع تقليل كبير في العمليات الحسابية (FLOPs).
هدف التدريب
يتم تدريب النموذج باستخدام تقطير الميزات (feature distillation) من معلم DINOv3 مجمد. تقوم دالة الخسارة بمحاذاة كل من التمثيلات الصورية العالمية (من رمز النواة الأول) والتمثيلات الكثيفة للرقع مع أهداف المعلم، باستخدام صور Objects365 غير المصنفة.
المساهمات الرئيسية
بنية VECA: عمود فقري بصري يستبدل الانتباه الذاتي التربيعي بانتباه النواة والطرف الذي يعمل في زمن خطي في كل طبقة، مما يجبر تفاعلات الرموز على المرور عبر عنق زجاجة ثابت الدقة.
الأداء مقابل التكلفة: تُظهر التقييمات في مهام التصنيف والتنبؤ المكاني الكثيف أن VECA تحقق أداءً منافساً للنماذج التأسيسية الحديثة (تحديداً DINOv3) مع تقليل التكلفة الحوسبية بشكل كبير.
التصنيف: في حجم ViT-Base، تحقق VECA دقة 81.93% (Top-1) على ImageNet-1k، وهي ضمن حوالي 1.6% من DINOv3 (83.56%)، رغم استخدام جزء ضئيل فقط من تفاعلات الانتباه.
التنبؤ الكثيف: في معيار تقسيم PASCAL Context، تحقق VECA نسبة 57.46 mIoU مقارنة بـ 57.74 mIoU لنموذج DINOv3، رغم امتلاكها 87.1% أقل من تفاعلات الانتباه لكل طبقة.
السلوكيات الناشئة: حدد المؤلفون أن رموز النواة تطور تمثيلات متمحورة حول الأشياء (object-centric)، وتتطور من توزيعات متماثلة المناحي (isotropic/spherical) في الطبقات الأولى إلى هياكل متكتلة دلالياً في الطبقات الأعمق، رغم عدم وجود إشراف صريح لهذا السلوك.
النتائج
القابلية للتوسع: تحافظ VECA على أداء مستقر عبر دقات مدخلات متنوعة (من 256px إلى 1024px)، بينما تعاني نماذج ViT القياسية من نمو تربيعي في العمليات الحسابية (FLOPs). تُظهر VECA توسعاً خطياً في العمليات الحوسبية وزمن التأخير مع زيادة الدقة.
المرونة: يمكن للنموذج مقايضة الدقة بالسرعة بمرونة. على سبيل المثال، تقليل ميزانية النوى من C=64 إلى C=8 يحافظ على أداء كبير (على سبيل المثال، >96% من أداء النموذج الكامل في التصنيف) مع قطع التكلفة الحوسبية بشكل جذري.
الميزات الكثيفة: تؤكد عمليات التصور (UMAP) أن VECA تنتج ميزات كثيفة مستقرة وعالية الجودة تظل قوية عند الدقات العالية، بما يضاهب DINOv3.
الأهمية والادعاءات
تدعي الورقة أن الانتباه الذاتي المباشر بين الرقع ليس ضرورياً بشكل صارم لتعلم تمثيلات بصرية كثيفة عالية الجودة. من خلال توجيه المعلومات عبر مجموعة مدمجة من رموز النواة المتعلمة، تؤسس VECA انتباه النواة والطرف المرن كبنة بناء بديلة وقابلة للتوسع لنماذج المحولات الرؤيوية.
يشير العمل إلى أن مرونة الانتباه من الكل إلى الكل يمكن استبدالها بواجهة مهيكلة تعمل في زمن خطي وتحافظ على المحاذاة المكانية وجودة الميزات الكثيفة. يوفر هذا مساراً واعداً لنشر المحولات الرؤيوية في المجالات ذات الدقة العالية حيث تكون الكفاءة الحوسبية أمراً حاسماً، مما يمكن النماذج من تكييف تكلفة الاستدلال ديناميكياً بناءً على الموارد المتاحة أو متطلبات المهمة.