← أحدث الأبحاث
💻 computer science

FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering

يُعد FocusGraph إطار عمل مبتكر للإجابة على الأسئلة في الفيديوهات الطويلة المعتمدة على التجسيد، حيث يجمع بين مُنتخب (Scene-Caption LLM) خفيف الوزن لتحديد المقاطع ذات الصلة بالاستعلام، وطريقة احتفاظ بالتدفق المتناثر القائم على الرقع (Patch-wise Sparse-Flow Retention) خالية من التدريب لاختيار الإطارات الرئيسية، محققاً بذلك أداءً هو الأفضل في فئته على معايير القياس الخاصة بالرؤية من منظور الشخص الأول مع تقليل وقت الاستدلال بشكل كبير.

المؤلفون الأصليون: Tatiana Zemskova, Solomon Andryushenko, Ilya Obrubov, Viktoriia Khoruzhaia, Ekaterina Eroshenko, Ekaterina Derevyanka, Dmitry Yudin

نُشر 2026-03-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tatiana Zemskova, Solomon Andryushenko, Ilya Obrubov, Viktoriia Khoruzhaia, Ekaterina Eroshenko, Ekaterina Derevyanka, Dmitry Yudin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز ما، ولكن بدلاً من الحصول على بضعة أدلة، تم تسليمك شريط كاميرا مراقبة مدته 3 ساعات ليوم كامل لشخص ما. مهمتك هي الإجابة على سؤال محدد مثل: "ماذا فعل الشخص مباشرة قبل أن يلتقط كوب القهوة؟"

إذا حاولت مشاهدة الشريط بأكمله بالسرعة العادية، فستشعر بالتعب والملل، ومن المرجح أن تفوتك اللحظة الحاسمة. وإذا حاولت مشاهدة كل ثانية بالحركة البطيئة، فإن عقلك (أو في هذه الحالة، الكمبيوتر) سينهار بسبب كمية البيانات الهائلة.

هذه هي المشكلة التي يحلها FocusGraph. إنه طريقة جديدة تجعل الذكاء الاصطناعي يشاهد الفيديوهات الطويلة دون أن يشعر بالارتباك. إليك كيف يعمل، مقسماً إلى تشبيهات بسيطة:

1. المشكلة: "فيضان المعلومات"

نماذج الذكاء الاصطناعي الحالية (التي تسمى نماذج اللغات الكبيرة متعددة الوسائط - MLLMs) تشبه المحققين العباقرة الذين يمكنهم قراءة وفهم النصوص بشكل مثالي. ولكن عندما تعرض عليهم فيديو طويلاً، فإنهم يحاولون النظر إلى كل إطار (كل صورة بجزء من الثانية).

  • المشكلة: الأمر يشبه أن تطلب من محقق قراءة كل صفحة في كتاب مكون من 1000 صفحة للعثور على جملة واحدة محددة. هذا يستغرق وقتاً طويلاً للغاية، ويكلف الكثير من المال (قدرة حوسبية)، وغالباً ما يرتبك المحقق بسبب كل الضجيج الإضافي.

2. الحل: استراتيجية الخطوتين لـ FocusGraph

يعمل FocusGraph مثل محرر ذكي وكشاف ضوئي. هو لا يشاهد الفيديو بأكمله؛ بل يحدد أين ينظر وماذا يشاهد.

الخطوة 1: "المحرر الملخص" (محدد Scene-Caption LLM)

بدلاً من عرض إطارات الفيديو الخام للذكاء الاصطناعي، يقوم FocusGraph أولاً بتقسيم الفيديو إلى مقاطع قصيرة (Clips).

  • التشبيه: تخيل أن لديك فيلماً مدته 3 ساعات. بدلاً من عرض الفيلم للذكاء الاصطناعي، تطلب من مساعد سريع وخفيف الوزن كتابة ملخص من جملة واحدة لكل مقطع مدته 10 ثوانٍ.
    • ملخص المقطع 1: "الشخص يدخل المطبخ."
    • ملخص المقطع 2: "الشخص يفتح الثلاجة."
    • ملخص المقطع 3: "الشخص يأخذ الحليب."
  • السر: ينظر الذكاء الاصطناعي بعد ذلك إلى هذه الملخصات النصية (وهي صغيرة وسهلة القراءة) ويسأل: "أي من هذه الملخصات يبدو وكأنه يحتوي على الإجابة لسؤالي؟"
  • النتيجة: يتجاهل الأجزاء المملة (مثل مشي الشخص في الممر لمدة 5 دقائق) ويحتفظ فقط بالمقاطع المثيرة للاهتمام (مثل مشهد الثلاجة). هذا هو جزء "الرسم البياني" (Graph)—فهو ينظم هذه الملخصات في خريطة للأشياء والأفعال.

الخطوة 2: "الكشاف الضوئي" (خوارزمية PSFR)

الآن أصبح لدى الذكاء الاصطناعي بعض المقاطع القصيرة، لكنها لا تزال تحتوي على الكثير من الإطارات. نحن بحاجة لاختيار أفضل صور قليلة لعرضها على المحقق الرئيسي.

  • التشبيه: تخيل أن لديك فيديو لطائر يطير. إذا التقطت صورة كل ثانية، فإن 90% من الصور ستبدو متطابقة تماماً. أنت تحتاج فقط لصورة عندما يخفق الطائر بجناحيه أو يغير اتجاهه.
  • الطريقة: يستخدم FocusGraph حيلة ذكية تسمى الاحتفاظ بالتدفق المتفرق للقطع (PSFR). هو لا يحتاج لأن "يُعلّم" كيفية القيام بذلك؛ بل يراقب ببساطة الحركة والتغيير.
    • يقسم الشاشة إلى شبكة.
    • يتتبع نقاطاً صغيرة (الزوايا) على الأشياء.
    • إذا تحركت النقاط بشكل ملحوظ أو اختفت (بمعنى أن المشهد تغير)، فإنه يقول: "آها! هذه لحظة رئيسية! التقط صورة!"
    • إذا ظلت النقوت ثابتة، فإنه يقول: "لا يوجد شيء جديد هنا، تخطَّ هذا الإطار."

3. الإجابة النهائية

الآن، يتعين على المحقق الرئيسي (الذكاء الاصطناعي الكبير MLLM) النظر فقط إلى:

  1. الملخصات النصية لمعرفة أين ينظر.
  2. مجموعة قليلة من الصور الرئيسية (التي حدثت فيها الأشياء بالفعل) لرؤية التفاصيل.

لماذا يعد هذا أمراً مهماً؟

  • السرعة: الأمر يشبه الانتقال من قراءة مكتبة كاملة إلى قراءة بطاقة فهرس واحدة. يجيب الذكاء الاصطناعي على الأسئلة بسرعة أكبر بكثير (في ثوانٍ بدلاً من دقائق).
  • الذكاء: لأنه يركز على اللحظات الصحيحة، فإنه لا يرتبك بسبب التفاصيل غير ذات الصلة. بل إنه يصبح في الواقع أفضل في الإجابة على الأسئلة الصعبة حول الفيديوهات الطويلة.
  • الكفاءة: يوفر كمية هائلة من قدرة الكمبيوتر، مما يجعل من الممكن تشغيل هذه الوكلاء الأذكياء على أجهزة ليست بالضرورة حواسيب فائقة القدرة.

باختصار: يعلم FocusGraph الذكاء الاصطناعي كيف يتوقف عن التحديق في المحيط بأكم، وبدلاً من ذلك يتعلم كيف يرصد الأمواج المحددة التي تهم. إنه يحول فيلماً مدته 3 ساعات إلى شريط لأبرز اللحظات مدته 5 دقائق، مما يضمن ألا يفوت الذكاء الاصطناعي أبداً نقطة التحول في القصة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →