← أحدث الأبحاث
🤖 machine learning

PWLR: Pairwise Witness Local Rejection for Boundary-Aware Out-of-Distribution Detection

تقدم الورقة البحثية طريقة "الرفض المحلي للشهود الثنائي" (PWLR)، وهي طريقة تستفيد من نموذج لغوي بصري كبير (MLLM) لتوليد وفحص أدلة بصرية محلية موثوقة كأدلة حدودية صريحة بين الفئات المتنافسة داخل التوزيع، مما يحسن بشكل كبير من أداء الكشف عن البيانات خارج التوزيع القريبة (near-OOD) عبر الجمع بين التحقق المحلي الثنائي ودرجات الفئات العالمية.

المؤلفون الأصليون: Chengyao Jia, Ruixuan Wang

نُشر 2026-08-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chengyao Jia, Ruixuan Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل حاسوباً يمكنه النظر إلى صورة فوتوغرافية وإخبارك بدقة بما يراه. هذه القدرة، المعروفة باسم التعرف على الصور، أصبحت جيدة للغاية في تحديد الأشياء التي تم تدريبها عليها، مثل سلالة معينة من الكلاب أو نوع من الزهور. ومع ذلك، تواجه هذه الأنظمة مشكلة معقدة عندما تواجه شيئاً لم تره من قبل. في عالم الذكاء الاصطناعي، يُسمى هذا "عينة خارج التوزيع". إذا كان النظام مدرباً فقط على صور الكلاب والقطط، ورأى صورة لمحمص خبز (توستر)، فقد يحاول مع ذلك فرض تسمية ما، معلناً بثقة أنها "قطة غريبة جداً". هذا أمر خطير في التطبيقات الواقعية، مثل السيارات ذاتية القيادة أو التشخيص الطبي، حيث يمكن أن تكون الأخطاء الواثقة ذات عواقب وخيمة. الهدف الذي يسعى إليه الباحثون في هذا المجال هو تعليم هذه الأنظمة قول "لا أعرف" عندما ترى شيئاً غير مألوف، بدلاً من التخمين.

يصبح التحدي أكثر صعوبة عندما يكون الشيء المجهول يشبه كثيراً الأشياء المعروفة. إذا كان النظام مدرباً على التمييز بين نوعين متشابهين من الطيور، فقد يكافح للتمييز بينهما وبين طائر ثالث لم يره من قبل، لأنها جميعاً تشترك في أشكال وألوان متشابهة. تعتمد الطرق التقليدية غالباً على النظر إلى الصورة بأكملها ككتلة واحدة، محاولةً مطابقتها مع فئة عامة. ولكن عندما تكون الاختلافات دقيقة ومخفية في تفاصيل صغيرة، فإن النظر إلى الصورة ككل لا يكفي. يحتاج النظام إلى طريقة للنظر عن كثب، لإيجاد الأدلة الصغيرة والمحددة التي تثبت أن شيئاً ما ليس شيئاً آخر.

لقد طور فريق من الباحثين في جامعة "سون يات سين" نهجاً جديداً لحل هذه المشكلة، أطلقوا عليه اسم "الرفض المحلي للشهود الزوجي" (Pairwise Witness Local Rejection). بدلاً من مطالبة الحاسوب بتخمين ما قد يكون عليه الكائن المجهول، يعلمونه أن يتصرف كمراقب دقيق يقارن بين مرشحين محددين. تعمل الطريقة من خلال تحديد المرشحين الأكثر احتمالاً لما قد تكون عليه الصورة أولاً. ثم، بدلاً من مجرد قبول المطابقة الأفضل، يطرح النظام سؤالاً محدداً: "هل تمتلك هذه الصورة السمات المحلية الصغيرة التي تثبت أنها هذا الطائر المحدد، وليست ذلك الطائر المنافس الشبيه به؟"

للقيام بذلك، استخدم الباحثون نوعاً قوياً من الذكاء الاصطناعي يُعرف بالنموذج اللغوي الكبير متعدد الوسائط. يمكن لهذا النموذج فهم كل من النصوص والصور. وقبل أن يرى النظام أي صورة اختبار حقيقية، يستخدمه الباحثون "دون اتصال" (offline) لإنشاء قائمة من العبارات الوصفية المحددة. تعمل هذه العبارات كـ "شهود". على سبيل المثال، إذا كان النظام يحاول التمييز بين نوعين من الطيور، فقد يولد النموذج عبارة مثل "قشرة ذهبية متفتتة" أو "نمط ذيل مميز" تصف تفصيلاً بصرياً فريداً لطائر واحد وليس للآخر. هذه العبارات ليست مجرد أوصاف عشوائية؛ بل هي مختارة بعناية لتسليط الضوء على الاختلافات الدقيقة التي تفصل بين فئة وأخرى من أقرب منافسيها.

بمجرد إنشاء عبارات الشهود هذه، يختبر النظام هذه العبارات مقابل آلاف الصور المعروفة لضمان موثوقيتها. فهو يتحقق مما إذا كانت العبارة تظهر باستمرار في صور الطائر المستهدف ونادراً في صور الطائر المنافس. إذا كانت العبارة غامضة للغاية أو يمكن أن تنطبق على أشياء كثيرة، يتم استبعادها. هذه العملية تخلق مكتبة موثوقة من الأدلة البصرية. وعند وصول صورة جديدة، يختار النظام أولاً بضعة مرشحين محتملين. ثم، لكل مرشح، يتحقق مما إذا كانت الصورة تحتوي على الأدلة المحلية المحددة التي تدعم ذلك المرشح على حساب منافسه الأكثر إرباكاً. إنه يبحث في قطع صغيرة من الصورة، باحثاً عن سمات "الشهود".

يتم اتخاذ القرار النهائي من خلال الجمع بين نوعين من المعلومات. الأول هو شعور عام وشامل لما تبدو عليه الصورة. والثاني هو الأدلة التفصيلية المحلية التي جمعتها عبارات الشهود. لا يقبل النظام التصنيف إلا إذا كانت الصورة منطقية عالمياً ومدعومة أيضاً بأدلة محلية قوية ضد منافسيها الأقرب. إذا فشلت الصورة في إظهار الأدلة المحددة التي تميزها عن منافسها الشبيه، فإن النظام يرفضها باعتبارها مجهولة.

في اختباراتهم، طبق الباحثون هذه الطريقة على مجموعة واسعة من مجموعات البيانات الصورية، بما في ذلك المعايير القياسية والسيناريوهات الأكثر صعوبة وواقعية حيث تكون الكائنات المجهولة مشابهة جداً للفئات المعروفة. وجدوا أن هذا النهج يحسن باستمرار قدرة الأنظمة الحالية على اكتشاف المدخلات المجهولة. في الاختبارات القياسية، قلل هذا الأسلوب الجديد من معدل الإنذارات الكاذبة بشكل كبير، حيث حدد الصور المجهولة بشكل صحيح في كثير من الأحيان أكثر من التقنيات السابقة. كان التحسن واضحاً بشكل خاص في الحالات التي تكون فيها الكائنات المجهولة قريبة بصرياً من الفئات المعروفة، مما يثبت أن البحث عن الاختلافات المحلية المحددة أكثر فعالية من الاعتماد على الانطباعات العامة.

كما اختبر الباحثون طريقتهم على أنواع مختلفة من نماذج الرؤية الحاسوبية لضمان عملها على نطاق واسع، وليس مع إعداد محدد فقط. أظهرت النتائج أن هذا النهج قوي ويمكن إضافته إلى مختلف الأنظمة القائمة لجعلها أكثر أماناً وموثوقية. ومن خلال تحويل المشكلة المجردة المتمثلة في "هل هذا مجهول؟" إلى مهمة ملموسة تتمثل في "هل تمتلك هذه الصورة السمات المحددة التي تثبت أنها هذا وليست ذاك؟"، قدم الباحثون مساراً أوضح للذكاء الاصطناعي ليعرف حدوده الخاصة. يشير هذا العمل إلى أن مفتاح السلامة الأفضل في الذكاء الاصطناعي ليس فقط في معرفة المزيد، بل في معرفة كيفية البحث عن التفاصيل الدقيقة التي تفصل بين المألوف والغريب.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →