← أحدث الأبحاث
💻 computer science

What-Where Transformer: A Slot-Centric Visual Backbone for Concurrent Representation and Localization

يقدم محول "ماذا-أين" (WWT) بنية محولة رؤية قائمة على الفتحات (slot-based) مبتكرة تفصل صراحةً بين مظهر الكائن وموقعه المكاني إلى تدفقات متزامنة من الرموز (tokens) وخرائط الانتباه، مما يُمكّن من اكتشاف الكائنات بأسلوب التعلم الصفري (zero-shot) والتقطيع المعتمد على الإشراف الضعيف ببراعة من خلال قدرات التحديد الناشئة دون الحاجة إلى معالجة لاحقة إضافية.

المؤلفون الأصليون: Ryota Yoshihashi, Masahiro Kada, Satoshi Ikehata, Rei Kawakami, Ikuro Sato

نُشر 2026-05-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ryota Yoshihashi, Masahiro Kada, Satoshi Ikehata, Rei Kawakami, Ikuro Sato

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تنظر إلى مشهد شارع مزدحم. يقوم دماغك فوراً بعمل شيئين: يحدد ما هي الأشياء (حافلة حمراء، كلب، شخص) وأين تقع في الصورة.

لفترة طويلة، كانت نماذج الرؤية الحاسوبية (مثل نموذج "Vision Transformer" الشهير أو ViT) بارعة في الإجابة على سؤال "ما هذا؟" ولكنها واجهت صعوبة في تحديد "أين هو بالضبط؟". لقد كانت تميل إلى خلط هذين المفهومين معاً، مما جعل من الصعب تحديد مواقع أشياء معينة دون خطوات إضافية معقدة.

تقدم هذه الورقة البحثية نموذجاً جديداً يسمى What-Where Transformer (WWT). فكر في الأمر كطريقة أذكى لكي "ترى" الحاسوب الصورة، مصممة من الأساس للحفاظ على فصل "ما هو الشيء" عن "أين هو"، مع جعلهما يعملان معاً في آن واحد.

إليك كيف يعمل، باستخدام تشبيهات بسيطة:

1. الطريقة القديمة: "السكين السويسري" للرموز (Token)

في النماذج التقليدية (مثل ViT)، يتم تقطيع الصورة إلى مربعات صغيرة تسمى "رقع" (patches). وتصبح كل رقعة "رمزاً" (token) (أي ملاحظة رقمية). تتواصل هذه الرموز مع بعضها البعض لفهم الصورة بأكملها.

  • المشكلة: الأمر يشبه إعطاء كل شخص في غرفة مزدحمة ملاحظة واحدة تحتوي على اسمه وموقعه معاً. عندما يحاولون مشاركة المعلومات، تختلط الأسماء بالمواقع. وإذا أردت استخراج جزء "الموقع" فقط لاحقاً، ستكون العملية فوضوية وتتطلب الكثير من العمل الإضافي لفك الاشتباك.

2. الطريقة الجديدة: فريق "ماذا وأين"

يقوم نموذج WWT بتغيير قواعد اللعبة عبر تقسيم الفريق إلى مجموعتين متخصصتين تعملان جنباً إلى جنب:

  • فريق "ماذا" (الفتحات/Slots): هؤلاء يشبهون المحققين. هم يحملون هوية الأشياء (مثلاً: "هذا كلب"). هم لا يهتمون بالإحداثيات الدقيقة؛ كل ما يهمهم هو معرفة "ماذا" يشاهدون.
  • فريق "أين" (الأقنعة/Masks): هؤلاء يشبهون مشغلي الأضواء الكاشفة. هم يحملون معلومات الموقع (مثلاً: "الكلب موجود في الزاوية العلوية اليسرى"). هم لا يهتمون بالاسم؛ كل ما يهمهم هو معرفة "أين" يجب أن يسلطوا الضوء.

3. كيف يتحدثون: رقصة "الانتباه المتبادل" (Mutual Attention)

في النماذج القديمة، كانت الملاحظات تتحدث مع كل الملاحظات الأخرى. أما في WWT، فإن المحققين ومشغلي الأضواء يتحدثون مع بعضهم البعض في رقصة محددة:

  • المحققون يسألون مشغلي الأضواء: "مهلاً، أين تسلط ضوءك؟ سأخبرك بما أراه هناك."
  • مشغلو الأضواء يسألون المحققين: "مهلاً، ماذا ترى؟ سأخبرك أين توجه ضوءك."
  • يفعلون ذلك مراراً وتكراراً أثناء معالجة الصورة. هذا يضمن بقاء "ماذا" نقية وبقاء "أين" دقيقة.

4. النتيجة السحرية: "الاكتشاف الناشئ" (Emergent Discovery)

الجزء الأكثر إثارة في هذه الورقة هو ما يحدث عندما تدرب النموذج فقط على تحديد الأشياء (مثل قول "هذا كلب") دون تعليمه كيفية رسم مربعات حولها.

  • المفاجأة: على الرغم من أننا طلبنا من النموذج فقط قول "كلب"، إلا أن "مشغلي الأضواء" (الأقنعة) تعلموا بشكل طبيعي رسم خط خارجي مثالي حول الكلب.
  • التشبيه: الأمر يشبه توظيف طاهٍ لصنع كعكة. أنت تخبره فقط بالوصفة ("ماذا")، ولكن بسبب طريقة تصميم مطبخه، يتعلم بالصدفة أيضاً كيفية تقطيع الكعكة بدقة مثالية ("أين") دون أن يُطلب منه ذلك أبداً.
  • لماذا يهم هذا؟ عادةً، لتحديد مواقع الأشياء، تحتاج إلى آلة ثانية معقدة (مُفسّر/decoder) لتفسير النتائج. أما WWT فيقوم بذلك تلقائياً. يمكنك النظر إلى خريطة "الضوء الكاشف"، وستظهر لك حرفياً مكان الأشياء.

5. ماذا اختبروا؟

اختبر الباحثون هذا النموذج على مجموعة ضخمة من الصور (ImageNet) ووجدوا أن:

  • الدقة: هو جيد تماماً في تحديد الأشياء مثل أفضل النماذج الحالية.
  • تحديد الموقع (Localization): هو أفضل بكثير في إظهار أين توجد الأشياء، حتى بدون تدريب إضافي.
  • تعدد الاستخدامات: لأن معلومات "أين" مدمجة فيه، يمكن استخدام هذا النموذج بسهولة لمهام مثل رسم مربعات حول السيارات أو قص الأشخاص من الخلفيات، وذلك ببساطة عبر إضافة "رأس" صغير (إضافة بسيطة) للنموذج.

ملخص

إن What-Where Transformer هو نوع جديد من أنظمة الرؤية بالذكاء الاصطناعي التي تتوقف عن خلط "ما هو الشيء" مع "أين هو". ومن خلال معاملة هذين الأمرين كفريقين منفصلين ومتعاونين، يتعلم النموذج بشكل طبيعي تحديد مواقع الأشياء في الصورة بمجرد تعلم تسميتها. إنها طريقة أبسط وأكثر كفاءة لتعليم الحواسيب رؤية العالم، مما يسهل استخدامها في مهام مثل العثور على الأشياء المفقودة، أو قيادة السيارات، أو تحليل الصور الطبية (رغم أن الورقة تركز على الاكتشاف العام للأشياء، وليس تطبيقات طبية محددة).

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →