← أحدث الأبحاث
💻 computer science

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

تقترح الورقة البحثية DetPO، وهي طريقة تحسين وقت الاختبار تعتمد على الصندوق الأسود وخالية من التدرج، تعمل على صقل المطالبات النصية فقط لتحسين أداء اكتشاف الأشياء بأسلوب التعلم من أمثلة قليلة في النماذج اللغوية الكبيرة متعددة الوسائط بشكل كبير، وذلك عبر الاستفادة من الأمثلة التدريبية المرئية للتغلب على قيود التعميم.

المؤلفون الأصليون: Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

نُشر 2026-03-25
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة البحث "DetPO: التعلم في السياق باستخدام النماذج اللغوية الكبيرة متعددة الوسائط للكشف عن الأشياء بلقطات قليلة" باستخدام لغة بسيطة وتشبيهات إبداعية.

الصورة الكبيرة: تعليم عبقري مهارات جديدة

تخيل أن لديك ناقد فن عالمي بارع (النموذج اللغوي الكبير متعدد الوسائط - Multi-Modal LLM) قد رأى ملايين اللوحات. يمكنه تحديد "كلب" أو "سيارة" أو "شجرة" فوراً لأنه رآها في كل مكان.

ومع ذلك، إذا عرضت عليه صورة لـ فطر نادر ومتوهج لم يره من قبل، أو صفيحة سمكة معيبة في مصنع، فسيصاب بالارتباك. قد يقول: "لا أعرف ما هذا"، أو الأسوأ من ذلك، قد يخمن بشكل عشوائي ويقول: "هذا كلب!".

أراد الباحثون تعليم هذا العبقري كيفية رصد هذه الأشياء الجديدة والغريبة باستخدام عدد قليل فقط من الأمثلة (مثل عرض 5 صور للفطر). لكنهم اصطدموا بعائق: مجرد عرض الصور لم يكن يعمل بشكل جيد. كان الذكاء الاصطناعي جامداً للغاية.

إليك DetPO (تحسين مطالبة الكشف). فكر في DetPO ليس كمعلم يعرض صوراً، بل كمحرر ذكي جداً يعيد كتابة دليل التعليمات الخاص بالذكاء الاصطناعي حتى "يفهم" الأمر أخيراً.


المشكلة: لماذا فشلت مجرد عرض الصور؟

عادةً، عندما نريد تعليم الذكاء الاصطناعي مفهوماً جديداً، نستخدم التعلم في السياق (In-Context Learning). هذا يشبه تسليم طالب ورقة اختبار بها بضعة أمثلة في الأعلى وقول: "هذا هو شكل الفطر. الآن ابحث عن كل الفطر".

حاول الباحثون القيام بذلك، لكن الأمر جاء بنتائج عكسية.

  • التشبيه: تخيل أنك تطلب من طاهٍ طبخ طبق جديد. تعطي له صورة للطبق وتقول له: "اصنع هذا". قد يرتبك الطاهي بسبب إضاءة الصورة، أو الزاوية، أو الطبق.
  • النتيجة: تشتت الذكاء الاصطناعي بسبب الضوضاء البصرية في الأمثلة، وبالفعل أدى أداءً أسوأ مما لو كنت قد أعطيته وصفاً نصياً بسيطاً مثل "ابحث عن الفطر".

الحل: DetPO (نهج "المحرر")

بدلاً من إجبار الذكاء الاصطناعي على النظر إلى الصور أثناء الاختبار الفعلي، يستخدم DetPO تلك الصور لـ إعادة كتابة التعليمات قبل بدء الاختبار.

إليك كيف يعمل DetPO، خطوة بخطوة:

1. مرحلة "المسودة" (المطالبة الأولية)

يأخذ النظام بضع صور للشيء الجديد (مثل الفطر المتوهج) ويسأل الذكاء الاصطناعي: "صف هذا الشيء بالتفصيل".

  • التشبيه: يكتب الذكنا الاصطناعي مسودة أولى لـ "ملصق مطلوب" (Wanted Poster) للفطر.

2. مرحلة "التحرير" (التحسين التبايني)

هذا هو الجزء السحري. يقوم النظام بتشغيل تعليمات الذكاء الاصطناعي الجديدة على صور التدريب.

  • إذا فاته الفطر (خطأ سلبي - False Negative): يقول النظام: "مهلاً، لقد فاتك هذا! انظر إلى الصورة. ما الذي فاتك؟ هل هو التوهج؟ الشكل؟" يقوم الذكاء الاصطناعي بعد ذلك بتحديث "ملصق المطلوب" ليشمل تلك التفاصيل المفقودة.
  • إذا اعتقد أن صخرة هي فطر (خطأ إيجابي - False Positive): يقول النظام: "توقف! هذه صخرة وليست فطراً. ما الذي يجعل الصخرة مختلفة؟ إنها صلبة ورمادية." يقوم الذكاء الاصطناعي بتحديث الملصق ليقول: "يجب أن يكون ناعماً ومتوهجاً"، لتجنب الخلط بين الصخور والفطر.

التشبيه: تخيل محققاً (الذكأ الاصطناعي) يحاول القبض على مجرم معين.

  • الجولة الأولى: يعتقل المحقق رجلاً عشوائياً لأنه يبدو "يشبه نوعاً ما" المجرم.
  • المحرر (DetPO): "لا، ليس هو! انظر إلى صورة المجرم الحقيقي. المجرم الحقيقي لديه ندبة على خده الأيسر. الرجل الذي قبضت عليه لا يملك ذلك. حدّث وصفك!"
  • الجولة الثانية: يفوته المجرم الحقيقي لأنه كان يبحث عن ندبة على الخد الأيمن.
  • المحرر: "لقد فاتك! الصورة تظهر أن الندبة على اليسار. حدّث وصفك!"

يكرر النظام هذه الحلقة، ويقوم بتنقيح الوصف النصي مراراً وتكراراً حتى يتمكن الذكاء الاصطناعي من التمييز تماماً بين الهدف وكل ما عداه.

3. "فحص الثقة" (درجة VQA)

أحياناً، حتى مع التعليمات المثالية، قد يصبح الذكاء الاصطناعي مفرط الثقة. قد يقول: "أنا متأكد بنسبة 99% أن هذه الصخرة هي فطر!"

  • الحل: يضيف DetPO خطوة ثانية. يأخذ تخمين الذكاء الاصطناعي ويسأله سؤالاً بسيطاً بنعم أو لا: "هل هذا فطر حقاً؟"
  • التشبيه: يشبه الأمر مديراً يدقق في تقرير عامل. إذا قال العامل: "لقد وجدت فطراً!" ينظر المدير إلى المكان ويسأل: "هل أنت متأكد؟" إذا لم يكن المدير متأكداً، تنخفض درجة الثقة، ويتم تجاهل الإنذار الخاطئ.

لماذا يهم هذا؟

  • لا مجهود شاق: عادةً، لتعليم الذكاء الاصطناعي مهمة جديدة، عليك القيام بـ "الضبط الدقيق" (Fine-tuning). هذا يشبه إرسال الذكاء الاصطناعي إلى معسكر تدريبي لمدة 6 أشهر. إنه أمر مكلف، بطيء، ويتطلب أجهزة كمبيوتر قوية.
  • DetPO هو طريق مختصر: DetPO يشبه إعطاء الذكاء الاصطناعي ورقة غش مكتوبة بلغة بسيطة. إنه لا يغير "دماغ" الذكاء الاصطناعي؛ بل يعطيه تعليمات أفضل فقط.
  • صديق للنماذج "الصندوق الأسود": العديد من أفضل نماذج الذكاء الاصطناعي (مثل Gemini أو Qwen) هي "صناديق سوداء" — لا يمكنك رؤية ما بداخلها أو تغيير كودها البرمجي. يعمل DetPO بشكل مثالي مع هذه النماذج لأنه يغير فقط الكلمات التي تكتبها لها، وليس الكود نفسه.

النتائج

اختبر الباحثون هذا النظام على 20 مجموعة بيانات مختلفة وصعبة (مثل صور الأشعة السينية، وصور الطائرات بدون طيار الجوية، والمشاهد تحت الماء).

  • قبل DetPO: كان الذكاء الاصطناعي مرتبكاً ويرتكب الكثير من الأخطاء.
  • بعد DetPO: أصبح الذكاء الاصطناعي محققاً ماهراً، حيث وجد الأشياء التي لم يسبق له رؤيتها بدقة أعلى بك Die. وفي بعض الحالات، تفوق على نماذج ذكاء اصطناعي متخصصة تم بناؤها خصيصاً لتلك المهام.

الملخص

DetPO هو خدعة ذكية تحول بضع صور أمثلة إلى دليل تعليمات مكتوب بشكل مثالي. بدلاً من إجبار الذكاء الاصطناعي على حفظ الصور، فإنه يستخدم الصور لإصلاح تعليمات الذكاء الاصطناعي، مما يعلمه بالضبط ما يجب أن يبحث عنه وما يجب أن يتجاهله. إنها طريقة رخيصة وسريعة وفعالة لتعليم الذكاء الاصطناعي الفائق مهارات جديدة دون الحاجة إلى إعادة تدريبه من الصفر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →