← أحدث الأبحاث
💻 computer science

Steerable Visual Representations

تقدم هذه الورقة البحثية "التمثيلات البصرية القابلة للتوجيه"، وهي نهج مبتكر يقوم بحقن مطالبات اللغة الطبيعية مباشرة في طبقات نماذج "Vision Transformer" سابقة التدريب عبر الدمج المبكر، مما يتيح توجيه الميزات البصرية نحو مفاهيم محددة مع الحفاظ على أداء عالٍ في المهام البصرية العامة وتحقيق تعميم صفري القدرات.

المؤلفون الأصليون: Jona Ruthardt, Manu Gaur, Deva Ramanan, Makarand Tapaswi, Yuki M. Asano

نُشر 2026-04-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jona Ruthardt, Manu Gaur, Deva Ramanan, Makarand Tapaswi, Yuki M. Asano

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك حارس أمن ذكي للغاية وشديد الملاحظة يدعى DINO. إن DINO مدرب على النظر إلى غرفة ما والصراخ فوراً بأكثر شيء واضح يراه. إذا عرضت عليه صورة لغرفة معيشة بها قطة نائمة على أريكة، ورف كتب في الزاوية، وجهاز تحكم عن بعد على الطاولة، فإن DINO سيهتم فقط بـ القطة. سيتجاهل كل شيء آخر لأنه يعتبر القطة هي "نجمة العرض".

هكذا تعمل معظم نماذج الرؤية الحاسوبية الحالية. فهي بارعة في رؤية الموضوع الرئيسي، لكنها سيئة جداً في الاستجابة لطلب مثل: "في الواقع، تجاهل القطة؛ أريد معرفة المزيد عن رف الكتب".

إليك SteerViT (التمثيلات البصرية القابلة للتوجيه).

لقد ابتكر الباحثون وراء هذه الورقة البحثية نظاماً يحول DINO إلى مرشد سياحي مطيع. الآن، يمكنك الهمس بأمر له، مثل "انظر إلى رف الكتب"، وفجأة يتغير تركيز الذكاء الاصطناعي بالكامل. يتوقف عن الاهتمام بالقطة ويبدأ في تحليل رف الكتب بالتفصيل. إذا قلت له بعد ذلك "انظر إلى جهاز التحكم"، فإنه يتحول فوراً مرة أخرى.

إليك كيف فعلوا ذلك، باستخدام بعض التشبيهات البسيطة:

1. المشكلة: الكاميرا "العنيدة"

فكر في نماذج الرؤية بالذكاء الاصطناعي القياسية ككاميرا ذات تركيز ثابت ولزج. بغض النظر عما تطلب منها النظر إليه، فإنها تركز دائماً على أكبر أو أسطع أو أكثر الأشياء ألواناً في الإطار. إنها مثل كاميرا ترفض التركيز على أي شيء آخر سوى الممثل الرئيسي في الفيلم، حتى لو صرخ المخرج: "ركز على قطعة الديكور في الخلفية!".

2. الحل: "جهاز التحكم باللغة"

لقد صنع المؤلفون جهاز تحكم عن بعد لعقل الذكاء الاصطعي.

  • الطريقة القديمة (الدمج المتأخر - Late Fusion): تخيل أنك تحاول تغيير تركيز الكاميرا بعد أن التقطت الصورة بالفعل. يمكنك إضافة مرشح (فلتر) أو كتابة ملاحظة على الصورة، لكن الصورة نفسها ستكون ضبابية فيما يتعلق بالخلفية. هذه هي طريقة عمل النماذج القديمة (مثل CLIP)؛ فهي تنظر إلى الصورة، ثم تنظر إلى النص، وتحاول دمجهما معاً في النهاية فقط.
  • الطريقة الجديدة (SteerViT / الدمج المبكر - Early Fusion): بدلاً من ذلك، يضع SteerViT جهاز التحكم عن بعد داخل عدسة الكاميرا نفسها. بينما تقوم الكاميرا بالتقاط الصورة، أنت تهمس بالتعليمات في أذنها. "ركز على رف الكتب". تقوم الكاميرا بتعديل تروسها الداخلية أثناء رؤيتها للضوء، مما يضمن أن يكون رف الكتب حاداً والقطة ضبابية.

3. كيف يعمل: "المحول خفيف الوزن"

قد تعتقد: "لجعل كاميرا بهذا الذكاء، ربما تحتاج إلى إعادة بناء المحرك بالكامل مع محرك جديد ضخم".

  • الواقع: لم يقم الباحثون بإعادة بناء المحرك. لقد أخذوا محركاً عالي الأداء ومعداً مسبقاً (ذكاء اصطناعي قوي يسمى DINOv2) وثبّتوا داخله "محولاً" (Adapter) صغيراً مكوناً من 21 مليون معلمة (بحجم تطبيق صغير).
  • الآلية: لقد أضافوا طبقة "انتباه متقاطع محكوم" (gated cross-attention). فكر في هذا كـ شرطي مرور داخل عقل الذكاء الاصطناعي. عندما يعالج الذكاء الاصطناعي صورة ما، يستمع شرطي المرور إلى نصك. إذا قلت "رف الكتب"، يوجه الشرطي انتباه الذكاء الاصطناعي إلى بكسلات رف الكتب ويخبر بكسلات القطة بأن "تتراجع".

4. لماذا يعد أمراً هاماً: تأثير "السكين السويسري"

عادة في مجال الذكاء الاصطناعي، عليك الاختيار بين أن تكون ذكياً أو مرناً.

  • النماذج المتخصصة: بعض النماذج بارعة في إيجاد أشياء محددة (مثل جهاز كشف المعادن الذي يجد عملة معدنية) ولكنها عديمة الفائدة لأي شيء آخر.
  • النماذج العامة: بعض النماذج بارعة في المهام العامة ولكن لا يمكن توجيهها لما يجب أن تبحث عنه.
  • SteerViT: هذا هو السكين السويسري. فهو يحتفظ بالرؤية فائقة الذكاء للنموذج الأصلي (لا يزال بارعاً في التعرف على القطط والسيارات والأنسجة) ولكنه يضيف القدرة على التوجيه بواسطة النص. إنه يحصل على أفضل ما في العالمين دون الحاجة إلى إعادة تدريبه من الصفر.

5. السحر في العالم الحقيقي: التعميم "صفر التدريب" (Zero-Shot Generalization)

الجزء الأكثر روعة هو أن هذا يعمل على أشياء لم يرها الذكاء الاصطناعي من قبل، دون أي تدريب إضافي.

  • مثال: تخيل أنك تدرب الذكاء الاصطناعي على البحث عن "العيوب" (anomalies) في قطع المصنع. تقول له، "ابحث عن الخدش في هذه الصمولة المعدنية".
  • النتيجة: حتى لو لم يسبق للذكاء الاصطناعي رؤية صمولة معدنية من قبل، ولأنه يفهم مفهوم "الخدش" و"المعدن" من نصك، يمكنه العثور على العيب فوراً. الأمر يشبه إعطاء طباخ وصفة لطبق لم يصنعه من قبل، وبطريقة ما يصنعه بشكل مثالي لأنه يفهم مبادئ الطبخ.

الملخص

SteerViT يشبه إعطاء كاميرا فائقة الذكيل لكنها عنيدة أمراً صوتياً. بدلاً من أن تقرر الكاميرا ما هو المهم، أنت من يقرر. يمكنك إخبارها بتجاهل الموضوع الرئيسي والتركيز على التفاصيل الصغيرة، أو تجميع الأشياء حسب اللون أو الشكل أو الملمس، وكل ذلك بمجرد كتابة جملة. إنه يجعل رؤية الذكاء الاصطناعي تشبه إلى حد كبير الرؤية البشرية، حيث يمكننا اختيار التركيز على ما نريد، بدلاً من مجرد التحديق في أعلى شيء صاخب في الغرفة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →