← أحدث الأبحاث
💻 computer science

QTrack: Query-Driven Reasoning for Multi-modal MOT

تقدم هذه الورقة البحثية QTrack، وهو إطار عمل للتتبع متعدد الوسائط مدفوع بالاستعلامات يصيغ تتبع الكائنات كمهمة استدلال مكاني زمني موجهة باللغة الطبيعية، مدعوماً بمعيار مرجعي جديد واسع النطاق (RMOT26) واستراتيجية تحسين مدركة للإدراك الزمني لتحقيق تحديد موقع وتتبع الأهداف بدقة وقوة بتوجيه لغوي.

المؤلفون الأصليون: Tajamul Ashraf, Tavaheed Tariq, Sonia Yadav, Abrar Ul Riyaz, Wasif Tak, Moloud Abdar, Janibul Bashir

نُشر 2026-03-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tajamul Ashraf, Tavaheed Tariq, Sonia Yadav, Abrar Ul Riyaz, Wasif Tak, Moloud Abdar, Janibul Bashir

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تشاهد مشهد شارع مزدحم عبر كاميرا مراقبة. هناك العشرات من الناس يمشون، يركضون، ويتقاطع مساراتهم.

الطريقة القديمة (التتبع التقليدي):
تخيل حارس أمن قيل له: "راقب الجميع". فيقوم الحارس بوضع نقطة حمراء على كل شخص في الفيديو، بغضًا عن هويتهم. إذا سألت: "أين الشخص الذي يرتدي سترة حمراء؟" سيتعين على الحارس البحث في قائمة تضم 50 نقطة حمراء والتخمين أي واحدة تقصد. إنه يتتبع الجميع بالتساوي، حتى لو كنت تهتم بشخص واحد فقط. هكذا يعمل تتبع الأجسام المتعددة (MOT) التقليدي: فهو يجد "كل الأشخاص" ولكنه لا يفهم حقًا من الذي تسأل عنه.

الطريقة الجديدة (QTrack):
الآن، تخيل محققًا فائق الذكاء لا يكتفي بمراقبة الجميع فحسب. أنت تعطيه ملاحظة تقول: "ابحث عن الشخص الذي يرتدي سترة حمراء ويحمل حقيبة زرقاء، وتابعه هو تحديدًا."

هذا المحقق لا يضيع وقته في تتبع الشخص الذي يرتدي بدلة سوداء أو الشخص الذي يرتدي سترة خضراء. هو يتجاهل الجميع فورًا ويركز تمامًا على "السترة الحمراء". حتى لو اختفى الشخص خلف شجرة (انسداد الرؤية) أو غير اتجاهه، يظل هذا المحقق ممسكًا بعينيه على ذلك الشخص تحديدًا، متذكرًا بدقة من هو.

هذا هو QTrack. إنه نوع جديد من أنظمة تتبع الفيديو التي تستمع إلى تعليماتك باللغة الطبيعية لتقرر من تتبع، وليس فقط أين تتحرك الأشياء.

المشكلات الثلاث الكبرى التي يحلها QTrack

1. "مَن" مقابل "أين":

  • الطريقة القديمة: "أين السيارات؟" (يتتبع جميع السيارات).
  • QTrack: "أين السيارة الزرقاء التي انعطفت لليسار للتو؟" (يتتبع السيارة الزرقاء فقط).
  • التشبيه: إنه الفرق بين كاميرا تسجل الغرفة بأكملة وبين كشاف ضوئي يتبع الممثل الذي تطلبه أنت فقط.

2. مشكلة "الذاكرة" (الاستنتاج):

  • أحيانًا، الشخص الذي تتبعه قد يحجبه حشد من الناس. الكاميرا العادية قد تفقده وتختار شخصًا آخر يبدو مشابهًا له.
  • يستخدم QTrack "الاستنتاج". الأمر يشبه محققًا يتذكر: "آه، السترة الحمراء كانت تمشي باتجاه مقهى القهوة، وليس باتجاه محطة الحافلات." حتى لو اختفى الشخص لثانية، يستخدم QTrack المنطق والسياق لتخمين أين ظهر مجددًا، مما يحافظ على ثبات هويته.

3. مشكلة "الانحراف":

  • في الأنظمة القديمة، إذا ارتبك المتتبع، فقد يبدأ الصندوق المحيط بالشخص في "الانحراف" أو القفز بشكل عشوائي.
  • يستخدم QTrack طريقة تدريب خاصة (تسمى TAPO) تعمل مثل مدرب صارم. إذا بدأ المتتبع في التحرك بطريقة غريبة أو غير طبيعية (مثل الانتقال الآني)، يصرخ المدرب: "لا! ليس هكذا يمشي البشر!" هذا يجبر النظام على تعلم كيف تتحرك الأجسام فعليًا عبر الزمن، مما يجعل التتبع سلسًا وواقعيًا.

الملعب الجديد: RMOT26

لتعليم هذا المحقق الجديد، بنى الباحثون صالة ألعاب رياضية ضخمة وشديدة التحدي تسمى RMOT26.

  • بدلاً من مجرد عرض مقاطع فيديو، كتبوا "مهامًا" محددة للذكاء الاصطناعي.
  • مثال لمهمة: "تتبع الراقصة التي ترتدي قميصًا قصيرًا أسود مع خطوط صفراء، ولكن تجاهل تلك التي ترتدي قميصًا أبيض."
  • هذه المجموعة من البيانات مليئة بالمواقف الصعبة: غرف مزدحمة، أشخاص يختبئون خلف بعضهم البعض، وأشخاص يتشابهون كثيرًا في المظهر. إنها تجبر الذكاء الاصطناعي على تعلم كيفية الاستنتاج، وليس مجرد التخمين.

كيف يعمل (السر الخفي)

لم يعلم الباحثون الذكاء الاصطناعي "النظر" إلى الصور فحسب؛ بل علموه أن يفكر قبل أن يتحرك.

  1. سلسلة الأفكـ (Chain of Thought): قبل أن يرسم الذكاء الاصطناعي صندوقًا حول شخص ما، يكتب ملاحظة صغيرة لنفسه: "حسنًا، أرى حشدًا. الاستعلام يطلب سترة حمراء. أرى ثلاث سترات حمراء. التي على اليسار تحمل حقيبة زرقاء. هذه هي المطلوبة."
  2. التعلم التعزيزي (Reinforcement Learning): يلعب الذكاء الاصطناعي لعبة حيث يحصل على نقاط لكونه دقيقًا، ويخسر نقاطًا بسبب "الانحراف" أو فقدان الهدف. بمرور الوقت، يتعلم أفضل استراتيجية للحفاظ على تركيزه على الهدف المنشود.

لماذا يهم هذا؟

هذا ليس مجرد جعل الفيديوهات أكثر روعة. هذه التكنولوجيا هي قفزة هائلة للتطبات في العالم الحقيقي:

  • المراقبة: بدلاً من أن يراقب ضابط 50 شاشة، يمكنه قول: "تتبع المشتبه به في السترة الحمراء"، وسيقوم النظام بذلك تلقائيًا.
  • الروبوتات: يمكن إخبار روبوت نادل: "اتبع الزبون الذي يرتدي قميصًا أزرق إلى الطاولة"، دون أن يرتبك بوجود زبائن آخرين.
  • تحليل الرياضة: يمكن للمدرب أن يسأل: "أرني مسار اللاعب الذي سجل الهدف"، وسيقوم النظام بعزل حركة ذلك اللاعب تحديدًا.

باختصار: يحول QTrack الكاميرا من مسجل سلبي يشاهد كل شيء إلى مساعد ذكي ونشط يستمع إلى تعليماتك ويتبع بالضبط ما يهمك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →