← أحدث الأبحاث
💻 computer science

Are foundation models for computer vision good conformal predictors?

تُظهر هذه الورقة أن النماذج التأسيسية للرؤية واللغة-الرؤية مناسبة تمامًا للتنبؤ المطابق، حيث تكشف أنه في حين يعمل التكيف بلقطات قليلة على تحسين درجات المطابقة ويضمن مقياس APS تغطية قوية، فإن معايرة ثقة النموذج يمكن أن تؤدي للمفارقة إلى تدهور كفاءة المجموعات المطابقة التكيفية.

المؤلفون الأصليون: Leo Fillioux, Julio Silva-Rodríguez, Ismail Ben Ayed, Paul-Henry Cournède, Maria Vakalopoulou, Stergios Christodoulidis, Jose Dolz

نُشر 2026-02-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Leo Fillioux, Julio Silva-Rodríguez, Ismail Ben Ayed, Paul-Henry Cournède, Maria Vakalopoulou, Stergios Christodoulidis, Jose Dolz

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طباخاً آلياً فائق الذكاء (نموذج تأسيسي - Foundation Model) قد تذوق ملايين الأطباق ويمكنه تحديد المكونات بدقة مذهلة. أنت تريد توظيف هذا الطباخ للعمل في مطبخ عالي المخاطر، مثل مقصف مستشفى أو محطة فضاء، حيث يمكن أن يؤدي أي خطأ إلى كارثة.

قبل توظيفه، تسأله: "ما مدى تأكدك من إجاباتك؟"

هذه الورقة البحثية تشبه عملية تفتيش سلامة صارمة لهؤلاء الطهاة الآليين. إنها تختبرهم باستخدام أداة خاصة تسمى التنبؤ المتسق (Conformal Prediction - CP).

المفهوم الجوهري: سلة "شبكة الأمان"

عادةً، عندما يضع النموذج تخميناً، فإنه يقول: "أنا متأكد بنسبة 90% أن هذا قط". ولكن ماذا لو كان مخطئاً؟

التنبؤ المتسق (CP) يغير قواعد اللعبة. فبدلاً من إعطائك تخميناً واحداً، فإنه يعطيك سلة من الاحتمالات.

  • القاعدة: "أعدك بأنني في 9% من الحالات، ستكون الإجابة الحقيقية داخل هذه السلة".
  • المقايضة: إذا كان النموذج غير متأكد جداً، تصبح السلة أكبر (مثلاً: "إنه قط، أو كلب، أو ثعلب"). وإذا كان متأكداً جداً، تصبح السلة صغيرة جداً (مثلاً: "إنه بالتأكيد قط").

الهدف هو إبقاء السلة أصغر ما يمكن (من أجل الكفاءة) مع عدم كسر الوعد أبداً بأن الإجابة الحقيقية ستكون بداخلها (من أجل السلامة).

السؤال الكبير

سأل المؤلفون: "هل هذه النماذج التأسيسية الجديدة والقوية جداً (مثل DINOv2 أو CLIP) جيدة حقاً في استخدام شبكة الأمان هذه؟"

لقد اختبروا 17 "طباخاً" مختلفاً (نماذج) عبر سيناريوهات متنوعة. وإليكم ما وجدوه، مشروحاً بالتشبيهات:

1. طهاة "محولات الرؤية" (Vision Transformers) هم الأفضل

  • النتيجة: النماذج المبنية باستخدام "محولات الرؤية" (مثل DINO و CLIP) أفضل بكثير في إنشاء سلال سلامة ضيقة وفعالة مقارنة بالنماذج القديمة القائمة على الشبكات العصبية الالتفافية (CNNs).
  • التشبيه: فكر في النماذج القديمة كأنها محققون من الطراز القديم يعتمدون على النظر إلى الأدلة الفردية (الحواف، الأنسجة) واحداً تلو الآخر؛ فهم يرتبكون بسهولة. أما نماذج "المحولات" الجديدة فهي مثل المحققين المعاصرين الذين ينظرون إلى الصورة الكاملة دفعة واحدة. إنهم يفهمون السياق بشكل أفضل، لذا يعرفون بالضبط عدد المشتبه بهم الذين يجب وضعهم في "سلة السلامة" دون جعلها كبيرة جداً.

2. فخ "معايرة الثقة" (Confidence Calibration)

  • النتيجة: غالباً ما يحاول الناس "معايرة" هذه النماذج لجعل درجات ثقتها أكثر صدقاً (على سبيل المثال، إذا قال 80%، فيجب أن يكون محقاً في 80% من الحالات). وجدت الورقة أن معايرة هذه النماذج تجعل سلال السلامة أكبر وأقل كفاءة.
  • التشبيه: تخيل خبير أرصاد جوية يكون واثقاً جداً في العادة. تطلب منه أن يكون أكثر "صدقاً" بشأن عدم تأكده. سيبدأ بالقول: "حسناً، قد تمطر، أو قد لا تمطر، أو قد تثلج..." فقط ليكون في أمان.
    • النتيجة: ستصبح "سلة السلامة" الخاصة به للاحتمالات الجوية ضخمة جداً. ورغم أنهم تقنياً أكثر "صدقاً" (معايرة)، إلا أنهم يصبحون أقل فائدة لأن السلة كبيرة جداً بحيث لا يمكن اتخاذ إجراء بناءً عليها. تشير الورقة إلى أنه بالنسبة لهذه النماذج تحديداً، فإن كون النموذج "مفرط الثقة" قليلاً هو أمر أفضل للحفاظ على صغر حجم سلة السلامة.

3. تأثير "الحرباء" (تغير النطاق/Domain Shifts)

  • النتيجة: عندما تتغير البيانات (على سبيل المثال، إذا استُخدم الطباخ في مطبخ مشمس وفجأة وجد نفسه يطبخ في مطبخ مظلم وممطر)، فإن شبكة الأمان عادة ما تنكسر. ومع ذلك، كانت هناك طريقة تسمى APS (مجموعات التنبؤ التكيفية) قوية للغاية. لقد حافظت على وعدها حتى عندما تغيرت البيئة، وإن كانت السلال قد أصبحت أكبر قليلاً.
  • التشبيه: معظم شبكات الأمان تشبه الزجاج: تعمل بشكل رائع في غرفة محكومة ولكنها تتحطم عند أخذها إلى الخارج. أما طريقة APS فهي مثل حبل البانجي (Bungee Cord). عندما تصبح البيئة غريبة (تغير النطاق)، يتمدد الحبل (تصبح السلة أكبر) ليمسك بالجسم الساقط، مما يضمن الوفاء بوعد السلامة، حتى لو كان ذلك أقل دقة.

4. تعلم بعض الحيل الجديدة (التعلم من أمثلة قليلة - Few-Shot Learning)

  • النتيجة: عندما تعلم هذه النماذج بعض الأشياء الجديدة باستخدام عدد قليل فقط من الأمثلة (Few-shot)، فإنها تصبح في الواقع أفضل في استخدام شبكة الأمان مقارنة بمحاولتها التخمين بدون أي مساعدة (Zero-shot).
  • التشبيه: إذا طلبت من طباخ تخمين وصفة سرية بدون أي تلميحات (Zero-Shot)، فقد يرمي عليك سلة ضخمة من المكونات تحسباً لأي شيء. لكن إذا أعطيته ثلاثة تلميحات (Few-Shot)، فسيقوم بتضييق الاحتمالات فوراً. ستصبح سلة السلامة أصغر بكثير وأكثر فائدة.

الحكم النهائي

تخلص الورقة إلى أن النماذج التأسيسية (Foundation Models) هي مرشحات ممتازة للتطبيقات الحرجة التي تتطلب السلامة، بشرط استخدام الأدوات الصحيحة.

  • الأداة الأفضل: استخدم APS (مجموعات التنبؤ التكيفية). إنها "شبكة الأمان" الأكثر موثوقية والتي لن تنكسر عندما تصبح الأمور غريبة، حتى لو جعلت السلة أكبر قليلاً أحياناً.
  • الطباخ الأفضل: استخدم النماذج المبنية على محولات الرؤية (Vision Transformers) (مثل DINO أو CLIP). فهي تفهم العالم بشكل طبيعي أفضل من النماذج القديمة.
  • تجنب: لا تتعب نفسك في "معايرة" هذه النماذج لتكون صادقة تماماً بشأن ثقتها؛ فهذا يجعل سلال السلامة كبيرة جداً لدرجة تجعلها غير مفيدة.

باختاً: هذه النماذج الذكية من الذكاء الاصطناعي ذكية بما يكفي لتعرف متى تكون غير متأكدة، ولكن عليك تزويدها بنوع شبكة الأمان الصحيح (APS) ليمسك بها عندما تتعثر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →