← أحدث الأبحاث
🤖 machine learning

Elastic Attention Cores for Scalable Vision Transformers

تقدم هذه الورقة بحثًا حول VECA (انتباه النواة المرن البصري)، وهي بنية محول رؤية (Vision Transformer) تحقق تعقيدًا حسابيًا خطيًا ومعالجة عالية الدقة وقابلة للتوسع عبر استبدال الانتباه الذاتي الشامل التربيعي بهيكل نواة-محيط فعال حيث تتواصل رموز الرقع (patch tokens) حصريًا من خلال مجموعة صغيرة متعلمة من تضمينات النواة.

المؤلفون الأصليون: Alan Z. Song, Yinjie Chen, Mu Nan, Rui Zhang, Jiahang Cao, Weijian Mai, Muquan Yu, Hossein Adeli, Deva Ramanan, Michael J. Tarr, Andrew F. Luo

نُشر 2026-05-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Alan Z. Song, Yinjie Chen, Mu Nan, Rui Zhang, Jiahang Cao, Weijian Mai, Muquan Yu, Hossein Adeli, Deva Ramanan, Michael J. Tarr, Andrew F. Luo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تنظيم حفلة ضخمة بآلاف الضيوف (البيكسلات في صورة ما).

الطريقة القديمة: حفلة "الكل يتحدث مع الجميع"

تعمل نماذج الذكاء الاصطناğı التقليدية، والتي تُسمى "محولات الرؤية" (Vision Transformers - ViTs)، مثل حفلة فوضوية حيث يجب على كل ضيف من الضيوف تقديم نفسه لكل ضيف آخر لفهم ما يدور في الغرفة.

  • المشكلة: إذا كان لديك 100 ضيف، فهذا يعني 10,000 مصافحة. وإذا كان لديك 1,000 ضيف (صورة عالية الدقة)، فهذا يعني 1,000,000 مصافحة. الوقت المستغرق لتنظيم هذا ينمو بشكل انفجاري (تربيعي). إنه بطيء ومكلف للغاية لدرجة أن هذه النماذج تعاني مع الصور عالية الدقة.
  • الافتراض: افترضت النماذج القديمة أنه لكي "يرى" الكمبيوتر جسماً ما، يجب أن يتحدث كل بيكسل مباشرة مع كل بيكسل آخر.

الطريقة الجديدة: VECA (حفلة "النواة المتميزة")

يقول مؤلفو هذه الورقة البحثية، آلان سونغ وزملاؤه: "مهلاً لحظة. هل نحتاج حقاً لأن يتحدث الجميع مع الجميع؟" لقد اقترحوا نظاماً جديداً يسمى VECA (انتباه النواة البصرية المرنة - Visual Elastic Core Attention).

فكر في VECA كحفلة تتكون من مجموعة نواة متميزة (VIP) وقائمة ضيوف عامة.

  1. نوى الـ VIP: بدلاً من آلاف الضيوف الذين يتحدثون مع بعضهم البعض، ينشئ النموذج مجموعة صغيرة وثابتة من "الشخصيات الهامة" (تسمى Core Tokens أو رموز النواة). لنقل مثلاً أن هناك 64 شخصية VIP فقط.
  2. قاعدة التواصل:
    • الضيوف (أجزاء الصورة) يتحدثون فقط إلى الـ VIPs. هم لا يتحدثون مع بعضهم البعض مباشرة.
    • الـ VIPs يتحدثون إلى الجميع (جميع الضيوف والـ VIPs الآخرين).
    • النتيجة: تتدفق المعلومات من الضيف ← إلى الـ VIP ← ثم إلى الضيف. لا يحتاج الضيوف أبداً للمصافحة فيما بينهم.
  3. مكاسب الكفاءة:
    • في الطريقة القديمة، مضاعفة عدد الضيوف كانت تؤدي إلى أربعة أضعاف العمل.
    • في VECA، مضاعفة عدد الضيوف تضاعف العمل فقط (نمو خطي). الأمر يشبه وجود فريق صغير وفعال من المديرين (الـ VIPs) لإدارة الفوضى، بدلاً من إجبار كل موظف على إدارة كل موظف آخر.

القوة الخارقة لـ "المرونة" (Elastic)

الجزء الأروع في VECA هو أنه مرن (قابل للتمدد).

  • التدريب: أثناء التدريب، يتعلم النموذج ترتيب شخصيات الـ VIP الخاصة به. بعض الـ VIPs هم "كبار الشخصيات" الذين يعرفون الأشياء الأكثر أهمية (مثل "يوجد كلب هنا")، بينما الآخرون هم "شخصيات VIP ناشئة" الذين يعرفون التفاصيل الدقيقة (مثل "الكلب لديه أذن متدلية").
  • الاستدلال (الحفلة أثناء العمل):
    • هل تحتاج للسرعة؟ يمكنك إخبار النموذج: "استخدم فقط أفضل 8 من الـ VIPs". سيعمل النموذج فوراً بشكل أسرع لأنه يتجاهل الموظفين المبتدئين. قد يكون أقل تفصيلاً، لكنه سريع جداً.
    • هل تحتاج للجودة العالية؟ يمكنك القول: "استخدم جميع الـ 64 من الـ VIPs". سيصبح النموذج أبطأ قليلاً ولكنه سيعطيك إجابة فائقة الدقة والتفصيل.
    • لا حاجة لإعادة التدريب: لا تحتاج لبناء نموذج جديد من أجل السرعة أو الجودة. يمكنك فقط تمديد أو تقليص عدد الـ VIPs أثناء التشغيل.

ماذا وجدوا؟

اختبر المؤلفون هذا على مجموعة متنوعة من المهام، مثل التعرف على ما يوجد في الصورة (التصنيف) ورسم الخطوط المحيطة بالأجسام (التجزئة).

  • الأداء: حتى مع استخدام "الاختصار" المتمثل في عدم السماح للبيكسلات بالتحدث مباشرة، قدم VECA أداءً يقارب أفضل النماذج المكلفة المتاحة حالياً (مثل DINOv3).
  • الاكتشاف السحري: لاحظ أن الـ VIPs (رموز النواة) تعلموا بشكل طبيعي كيف يعملون كـ كواشف للأجسام. دون أن يُطلب منهم ذلك صراحة، بدأت رموز الـ VIP بالتجمع لتمثيل أشياء محددة، مثل "بيض في وعاء" أو "عجلة سيارة". لقد تطوروا من مجرد كتل غامضة من المعلومات إلى مجموعات دلالية محددة.
  • الدقة (Resolution): يعمل النموذج بشكل رائع على الصور الصغيرة ويتوسع ليشمل الصور الضخمة عالية الدقة دون أن ينهار أو يصبح بطيئاً جداً، على عكس النماذج القديمة.

الخلا الخلاصة

تزعم الورقة البحثية أننا لسنا بحاجة إلى طريقة "الكل يتحدث مع الجميع" المكلفة والتربيعية لبناء ذكاء اصطناعي بصري ذكي. من خلال استخدام فريق صغير وذكي من رموز "النواة" لوساطة التواصل، يمكننا بناء نماذج تكون:

  1. أسرع وأرخص (خاصة للصور عالية الدقة).
  2. مرنة (يمكنك المقايضة بين السرعة والدقة في أي وقت).
  3. ذكية تماماً مثل عمالقة التكنولوجيا الحالية.

إنه حجر بناء جديد لمستقبل الرؤية الحاسوبية يجعل الذكاء الاصطناعي عالي الدقة أمراً واقعياً وفعالاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →