← أحدث الأبحاث
🤖 AI

Show or Tell? Effectively prompting Vision-Language Models for semantic segmentation

تتقصى هذه الورقة مدى فعالية التلقين النصي مقابل التلقين البصري في التجزئة الدلالية في نماذج الرؤية واللغة، كاشفةً عن فجوة أدائية كبيرة بينهما مقارنة بالنماذج المتخصصة، وطبيعة التكامل بين هذين النمطين، مما يحفز اقتراح PromptMatcher، وهو طريقة خالية من التدريب تجمع بين كلا التلقينين لتحقيق نتائج رائدة.

المؤلفون الأصليون: Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Filip Janicki, Cristiano Malossi, Konrad Schindler, Roy Assaf

نُشر 2026-02-09
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Filip Janicki, Cristiano Malossi, Konrad Schindler, Roy Assaf

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً فائق الذكاء، قد قرأ كل كتاب تقريباً على الإنترنت وشاهد مليارات الصور. تريد أن تطلب من هذا الروبوت رسم خط حول أشياء محددة في صورة جديدة، مثل "ابحث عن جميع الطائرات" أو "حدد القطط". هذا ما يسمى بـ التجزئة الدلالية (Semantic Segmentation).

يسأل البحث سؤالاً بسيطاً ولكنه صعب: ما هي أفضل طريقة لإخبار هذا الروبوت بما يجب فعله؟ هل تعطيه تعليمات مكتوبة (مطالبة نصية)، أم تريه صورة لما تريده (مطالبة بصرية)؟

إليك قصة اكتشافهم، مشروحة ببساطة:

1. معضلة "العرض" مقابل "الإخبار"

اختبر الباحثون طريقتين للتحدث مع هذه النماذج الآلية العملاقة:

  • طريقة "الإخبار" (المطالبات النصية): تكتب "جزئ جميع القطط". الأمر يشبه إعطاء أمر لفظي.
  • طريقة "العرض" (المطالبات البصرية): تريني صورة لقطة مع دائرة حمراء حولها، وتقول "افعل مثل هذا". الأمر يشبه الإشارة والقول "مثل هذا تماماً".

وجدوا أن كلتا الطريقتين بهما عيوب.

  • النصوص صعبة لأن اللغة فوضوية. الكلمات قد تكون مربكة. إذا طلبت من الروبوت البحث عن "fjord" (نوع من المداخل البحرية العميقة)، فقد يرتبك لأن الكلمة نادرة. وإذا طلبت "ملابس علوية"، فقد لا يعرف ما إذا كنت تقصد قميصاً، أو سترة، أو قبعة. أحياناً يخمن الروبوت بشكل خاطئ أو "يهلوس" (يختلق أشياءً من عنده) لأن الكلمات لم تكن واضحة بما يكفي.
  • الصور صعبة لأنها محددة للغاية. إذا عرضت عليه صورة لقطة معينة، فقد يركز الروبوت بشدة على نمط فرو تلك القطة تحديداً ويفقد القطط الأخرى التي تبدو مختلفة قليلاً.

2. المفاجأة الكبرى: الروبوت ليس مثالياً بعد

قارن المؤلفون بين هذه الروبوتات "العامة" (التي تحاول فعل كل شيء) وبين الروبوتات "المتخصصة" (التي تدربت فقط على إيجاد القطط، أو فقط على إيجاد الطائرات).

النتيجة؟ لا تزال الروبوتات العامة أسوأ بنسبة 30% من المتخصصين. على الرغم من أن هذه النماذج العملاقة مشهورة بذكائها، إلا أنها ليست مستعدة تماماً بعد لتحل محل الخبراء عندما يتعلق الأمر برسم خطوط دقيقة حول الأشياء في مواقف جديدة وغريبة.

3. سر "العراف" (The Oracle)

لاحظ الباحثون شيئاً رائعاً: المطالبات النصية والبصرية هما صديقان مقربان.

  • عندما تفشل المطالبة النصية (مثلاً، عندما يرتبك الروبوت بسبب كلمة "fjord")، فإن المطالبة البصرية غالباً ما تنجح.
  • عندما تفشل المطالبة البصرية (مثلاً، عندما يرتبك الروبوت بسبب زاوية غريبة)، فإن المطالبة النصية غالداً ما تنجح.

تخيلوا وجود "عراف سحري" يمكنه النظر إلى كل صورة ومعرفة فوراً: "لهذه الصورة المحددة، يجب أن أستخدم التعليمات النصية. ولتلك الصورة، يجب أن أستخدم الصورة".

إذا استطاع هذا العراف السحري التبديل بين الطريقتين بشكل مثالي، فإن أداء الروبوت سيقفز بنسبة 11%. لقد أثبت ذلك أن الطريقتين تكملان بعضهما البعض بشكل مثالي؛ فهما تغطيان نقاط الضعف لدى كل منهما.

4. الحل: PromptMatcher

بما أننا لا نستطيع امتلاك "عراف سحري"، فقد بنى المؤلفون أداة بسيطة ومجانية تسمى PromptMatcher.

فكر في الأمر كأنه فريق مكون من شخصين يراجع كل منهما عمل الآخر:

  1. خبير النصوص (LISA): يقرأ التعليمات ويرسم قناعاً (mask).
  2. الخبير البصري (SoftMatcher+): ينظر إلى الصورة المثال ويرسم قناعاً.
  3. الحكم (المدقق/The Verifier): هذا هو الجزء الذكي. يعمل الخبير البصري كـ "ناقد" لخبير النصوص. إذا رسم خبير النصوص قناعاً يبدو غريباً أو لا يتطابق مع الصورة المثال، يقول الحكم: "لا، هذا خطأ"، ويستبعده.
  4. النتيجة النهائية: يدمجون الأقنعة "المعتمدة" من كلا الخبيرين في رسم واحد مثالي.

الخلاصة

من خلال الجمع بين "العرض" و"الإخبار"، وجعل أحدهما يراجع عمل الآخر، أنشأوا نظاماً هو أفضل من أفضل روبوت يعتمد على النص فقط، وأفضل من أفضل روبوت يعتمد على البصر فقط.

لم يحتاجوا إلى إعادة تدريب الروبوت أو تعليمه أشياء جديدة؛ بل اكتشفوا فقط كيفية طرح الأسئلة الصحيحة بالطريقة الصحيحة. إنه تذكير بأنه في بعض الأحيان، أفضل طريقة لجعل ذكاء اصطناعي ذكي يقوم بمهمة ما ليست مجرد التحدث إليه، بل أن تريه ما تعنيه، ثم تجعله يراجع عمله الخاص.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →