← أحدث الأبحاث
💻 computer science

DAPL: Integration of Positive and Negative Descriptions in Text-Based Person Search

تقترح الورقة البحثية إطار عمل DAPL، وهو إطار عمل مبتكر للبحث عن الأشخاص القائم على النصوص يدمج كلاً من الأوصاف الإيجابية والسلبية من خلال تعلم محفز السمات المزدوج، وتعلم تباين الصورة والسمة المزدوج، والمطابقة الحساسة بين الصورة والسمة، وفقدان التشابه الديناميكي لكل رمز (Token) لتحسين دقة الاسترجاع والمتانة بشكل كبير.

المؤلفون الأصليون: Yuchuan Deng, Zhanpeng Hu, Zijie Xin, Chuang Deng, Qijun Zhao

نُشر 2026-05-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuchuan Deng, Zhanpeng Hu, Zijie Xin, Chuang Deng, Qijun Zhao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول العثور على شخص معين في غرفة مزدحمة تضم الآلاف من الناس، لكنك لا تستطيع رؤيته. بدلاً من ذلك، عليك وصفه لرجل أمن سيقوم بعد ذلك بالإشارة إلى الشخص الصحيح.

المشكلة: خطأ "التقارب من الصواب"
عادةً، عندما نصف شخصاً ما، نركز على ما يمتلكه بالفعل. نقول: "هو يرتدي قبعة زرقاء وسترة رمادية".

كانت أنظمة الكمبيوتر القديمة ("رجال الأمن") بارعة في العثور على أشخاص يرتدون قبعة زرقاء وسترة رمادية. لكن كان لديها نقطة عمياء: لم تكن تستمع جيداً لما لا يمتلكه الأشخاص.

إذا قلت: "هو يرتدي قبعة زرقاء، وسترة رمادية، ولا يرتدي نظارات"، فقد يظل النظام القديم يظهر لك رجلاً يرتدي قبعة زرقاء وسترة رمادية ولكنه يرتدي نظارات بالفعل. لقد رأى "القبعة الزرقاء" و"السترة الرمادية" وظن: "هذا قريب بما يكفي!". لقد فشل في إدراك أن جزء "لا يرتدي نظارات" كان حاسماً. أدى هذا إلى إظهار الشخص الخطأ لك (إيجابية كاذبة).

الحل: DAPL (المحقق الذي يعرف "نعم" و"لا")
ابتكر مؤلفو هذه الورقة نظاماً جديداً يسمى DAPL (تعلم التلقين بالسمات المزدوجة). فكر في DAPL كمحقق ذكي جداً يستمع إلى قائمة الـ "نعم" وقائمة الـ "لا" معاً.

  1. قائمة الـ "نعم" والـ "لا":
    بدلاً من مجرد البحث عن القبعة الزرقاء (الإيجاب)، يبحث DAPL بنشاط عن غياب النظارات (السلب). إنه يعامل "لا يرتدي نظارات" بنفس أهمية "قبعة زرقاء". يساعد هذا النظام على استبعاد الأشخاص الذين يبدون متشابهين ولكن ينقصهم شيء أساسي.

  2. "المشط ذو الأسنان الدقيقة" (فقدان DTS):
    تخيل محاولة مطابقة قطعة من أحجية (Puzzle). كانت الطرق القديمة تنظر إلى الصورة الكاملة وتقول: "تبدو متشابهة". يستخدم DAPL أداة "التشابه الديناميكي لكل رمز" (Dynamic Token-wise Similarity). هذا يشبه استخدام عدسة مكبرة للتحقق من كل كلمة في وصفك مقابل كل جزء من الصورة.

  • إذا كانت الصورة تحتوي على قميص أحمر بينما يقول نصك "قميص أزرق"، فإن العدسة المكبرة ستكشف هذا التضارب المحدد فوراً.
  • إذا كانت الصورة تحتوي على حقيبة ظهر بينما يقول نصك "لا توجد حقيبة ظهر"، فسيتم رصد ذلك أيضاً.
    يضمن هذا أن الكمبيوتر لا يكتفي بالتخمين بناءً على "الانطباع العام" للصورة؛ بل يتحقق من التفاصيل المحددة.
  1. "الميزان المتوازن" (SIAM و DIAC):
    أحياناً، يحتوي الوصف على الكثير من الكلمات الشائعة (مثل "يرتدي قميصاً") وبعض الكلمات النادرة والمهمة (مثل "يرتدي شارة محددة"). قد تنجرف الأنظمة القديمة خلف الكلمات الشائعة.
    يستخدم DAPL عملية توازن خاصة. فهو يضمن أن التفاصيل النادرة والحاسمة (الدلائل "السلبية" مثل "لا يرتدي نظارات") تحصل على الاهتمام الذي تستحقه، حتى لا تطغى عليها الأشياء الشائعة.

كيف اختبروه
علم الباحثون هذا النظام الجديد باستخدام خدعة خاصة: أخذوا أوصافاً عادية وأنشأوا تلقائياً نسخاً "سلبية" منها ليدرسها الكمبيوتر.

  • الأصل: "هو يرتدي قميصاً أحمر."
  • النسخة السلبية للتدريب: "هو لا يرتدي قبعة" أو "هو لا يحمل حقيبة".

من خلال تدريب الكمبيوتر على التعرف على جمل "لا" هذه، تعلم كيفية تضييق نطاق البحث. فبدلاً من مجرد العثق على كل من يرتدي قميصاً أحمر، يمكنه العثيد على الشخص الواحد الذي يرتدي قميصاً أحمر وهو أيضاً لا يرتدي قبعة.

النتائج
عندما اختبروا DAPL على ثلاث قواعد بيانات مختلفة للأشخاص، كان أداؤه أفضل من أي طريقة سابقة في العثيد على الشخص الصحيح.

  • كان أكثر دقة (وجد الشخص الصحيح في كثير من الأحيان).
  • كان أكثر متانة (لم يرتبك أمام الأشخاص الذين يشبهون الهدف ولكن بينهم اختلاف واحد رئيسي).

العائق (القيود)
تشير الورقة إلى قيدين رئيسيين:

  1. كتاب القواعد: لإنشاء تلك الأمثلة التدريبية "السلبية"، يعتمد النظام حالياً على قائمة معدة مسبقاً من السمات الشائعة (مثل "قبعة"، "حقيبة ظهر"، "نظارات"). لا يمكنه ابتكار أوصاف سلبية جديدة من تلقاء نفسه إذا لم تكن القائمة تغطيها.
  2. التعقيد: نظرًا لاستخدامه العديد من "طبقات" التحليل للتحقق من كل من قوائم "نعم" و"لا"، فإن النظام أكثر تعقيداً ويتطلب قوة حوسبة أكبر من النماذج الأبسط.

باختصار
DAPL يشبه ترقية محرك بحث من "ابحث عن أي شيء بقبعة زرقاء" إلى "ابحث عن الشخص الذي يرتدي قبعة زرقاء، وسترة رمادية، وبالتأكيد لا يرتدي نظارات". من خلال الانتباه إلى ما هو مفقود، يجد الشخص الصحيح بشكل أسرع وأكثر دقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →