← أحدث الأبحاث
💻 computer science

EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence

يُعد EagleVision إطار عمل ثنائي المراحل يعزز الاستدلال المكاني القائم على الفيديو من خلال الجمع بين آلية اختيار الإطارات الرئيسية المدركة للهندسة وعملية سلسلة أفكار نشطة ومستندة إلى منظور عين الطائر، والتي تسترجع وجهات نظر جديدة بشكل تكراري للتحقق من الفرضيات، محققاً بذلك أداءً رائدًا دون الحاجة إلى مسارات استدلال مُعنونة بشريًا.

المؤلفون الأصليون: Jiaxu Wan, Xu Wang, Mengwei Xie, Hang Zhang, Mu Xu, Yang Han, Hong Zhang, Ding Yuan, Yifan Yang

نُشر 2026-03-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiaxu Wan, Xu Wang, Mengwei Xie, Hang Zhang, Mu Xu, Yang Han, Hong Zhang, Ding Yuan, Yifan Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز في مستودع ضخم ومظلم. لديك بث من كاميرا أمنية، لكنه فيديو طويل حيث تدور الكاميرا حول نفسها بشكل عشوائي. يتعين عليك الإجابة على سؤال صعب: "أي جسم هو الأقرب إلى السرير: الكرسي أم الأريكة؟"

إذا سألت ذكاءً اصطناعيًا قياسيًا (نموذج لغوي كبير متعدد الوسائط)، فإنه عادة ما يرتكب أحد خطأين:

  1. لعبة التخمين: ينظر إلى بعض الإطارات العشوائية، ويخمن "الأريكة"، ويمضي قدمًا. إنه لا يتحقق فعليًا مما إذا كان الكرسي موجودًا في الغرفة حتى.
  2. المفكر النصي فقط: يحاول التفكير في عقله، قائلاً: "همم، لا يمكنني العثور على الكرسي في الصور التي لدي، لكني سأخمن الأريكة على أي حال". إنه يفتقر إلى القدرة على "الذهاب للبحث" عن الدليل المفقود.

EagleVision يشبه محققًا ذكيًا للغاية يرفض التخمين حتى يمتلك جميع الحقائق. إنه يستخدم عملية من خطوتين لحل الألغاز المكانية في الفيديوهات، وهو يفعل ذلك عبر "التفكير بالمساحة".

إليك كيف يعمل EagleVision، مشروحًا بتشبيهات بسيطة:

المرحلة 1: "اللقطة الذكية" (الإدراك الكلي - Macro Perception)

تخيل أن لديك فيديو لمدة 10 دقائق لغرفة، ولكن يمكنك فقط النظر إلى 5 لقطات لأن عقلك (أو ذاكرة الكمبيوتر) لديه حد أقصى لما يمكنه معالجته في وقت واحد.

  • المشكلة: إذا أخذت 5 لقطات عشوائية فقط، فقد تحصل على 5 صور لنفس الجدار. ستفقد السرير، والكرسي، والأريكة تمامًا.
  • حل EagleVision: يستخدم EagleVision خوارزمية خاصة تسمى SPF-DPP. فكر في هذا كـ "مشغل كاميرا ذكي".
    • ينظر إلى الفيديو بأكمله ويسأل سؤالين لكل إطار:
      1. هل هذه الصورة ذات صلة بالسؤال؟ (الارتباط الدلالي: "هل أرى سريرًا؟")
      2. هل هذه الصورة من زاوية مختلفة؟ (التنوع الهندسي: "هل رأيت هذا الزاوية بالفعل؟")
    • يختار اللقطات الخمس المثالية التي تظهر لك أكبر قدر ممكن من أجزاء مختلفة من الغرفة مع البقاء ذات صلة بسؤالك. إنه يضمن أن يكون لديك "خريطة ثلاثية الأبعاد" للغرفة في ذهنك قبل أن تبدأ في التفكير فعليًا.

المرحلة 2: "المحقق النشط" (التحقق الجزئي - Micro Verification)

الآن بعد أن حصلت على لقطاتك الخمس، بدأت في التفكير. ولكن ماذا لو لم تكن متأكدًا بعد؟ ربم يكون الكرسي مختبئًا خلف ستارة في لقطاتك.

  • المشكلة: نماذج الذكاء الاصطناعي العادية عالقة باللقطات الخمس التي لديها بالفعل. لا يمكنها طلب المزيد.
  • حل EagleVision: يمتلك EagleVision خريطة منظور عين الطائر (BEV Map). تخيل خريطة مسطحة ثنائية الأبعاد للغرفة تطفو فوق الفيديو، توضح بالضبط أين كانت الكاميرا في كل إطار.
    • حلقة "افترض-انظر-تحقق":
      1. فكر: يقول الذكاء الاصطناعي: "أعتقد أن الكرسي بالقرب من النافذة، لكني لا أراه في صوري الحالية".
      2. اطلب: بدلًا من التخمين، يشير إلى خريطة BEV ويقول: "أحتاج إلى رؤية المنظر من هذه البقعة المحددة على الخريطة".
      3. انظر: يقفز النظام فورًا إلى إطار الفيديو الحقيقي الذي يطابق تلك البقعة على الخريطة ويعرضه للذكاء الاصطناعي.
      4. تحقق: ينظر الذكاء الاصطناعي إلى الصورة الجديدة، ويحدث نظريته، ويكرر العملية حتى يتأكد بنسبة 100%.

كيف يتعلم؟ (تدريب "بلا معلم")

عادةً، لتعليم الذكاء الاصطناعي أن يكون محققًا جيدًا، تحتاج إلى معلم بشري يكتب تعليمات خطوة بخطوة مثل: "أولاً انظر إلى السرير، ثم انظر يسارًا، ثم انظر يمينًا". هذا مكلف وصعب التنفيذ.

يتعلم EagleVision بشكل مختلف. فهو يستخدم التعلم المعزز (مثل تدريب كلب باستخدام المكافآت).

  • يحاول الذكاء الاصطناعي حل اللغز.
  • إذا خمن الإجابة الصحيحة، يحصل على "مكافأة" (جائزة).
  • إذا طلب عرضًا غير موجود (مثل توجيه الكاميرا نحو جدار حيث لم يتم التقاط فيديو فيه)، فإنه يتلقى "توبيخًا" (عقوبة).
  • بمرور الوقت، يتعلم الذكاء الاصطناعي من تلقاء نفسه: "أوه، يجب أن أطلب فقط المشاهد الموجودة بالفعل في الفيديو، ويجب أن أستمر في البحث حتى أتأكد". إنه يتعلم استراتيجية البحث دون الحاجة إلى كتابة نص من قبل بشر.

لماذا يعد هذا أمرًا مهمًا؟

  • إنه فعال: لا يهدر الطاقة في النظر إلى إطارات عديمة الفائدة. إنه يختار الأفضل أولاً.
  • إنه نشط: لا يكتفي بمجرد التحديق فيما أُعطي له؛ بل يسعى بنشاط وراء القطع المفقودة من اللغز.
  • إنه دقيق: في الاختبارات، تفوق EagleVision على جميع نماذج الذكاء الاصطناعي مفتوحة المصدر الأخرى في فهم المساحة ثلاثية الأبعاد، والمسافات، والتخطيطات.

باخت مختصر: EagleVision هو الفرق بين طالب يخمن الإجابة لأنه لم يذاكر، وطالب يفتح الكتاب المدرسي، وينتقل إلى الصفحة المطلوبة بدقة، ويتحقق من الرسم التوضيحي، ثم يكتب الإجابة الصحيحة بكل ثقة. إنه يحول "التخمين" إلى "تحقيق".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →