← أحدث الأبحاث
💻 computer science

OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding

تقدم الورقة البحثية OmniVTG، وهي مجموعة بيانات ضخمة لتحديد زمن الفيديو في العالم المفتوح تم إنشاؤها عبر عملية توسيع التغطية الدلالية وسلسلة تعليقات توضيحية متمحورة حول الوصف، إلى جانب نموذج تدريب يعتمد على "سلسلة أفكار التصحيح الذاتي" يستفيد من قدرات الفهم المتفوقة للنماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) لتحسين التنبؤات، محققاً أداءً هو الأفضل حالياً على هذه المجموعة الجديدة والمنصات المرجعية القائمة.

المؤلفون الأصليون: Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

نُشر 2026-04-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة من فيديوهات منزلية غير محررة، ثم سلمك أحدهم جملة محددة، مثل "ابحث عن الجزء الذي يقلب فيه القط المزهرية". مهمتك هي الإشارة بدقة إلى متى يحدث ذلك. تسمى هذه المهمة التأصيل الزمني للفيديو (Video Temporal Grounding).

المشكلة هي أن معظم نماذج الذكاء الاصطناعي تشبه الطلاب الذين درسوا فقط لاختبار محدد؛ فهي بارعة في إيجاد الأشياء الشائعة (مثل "شخص يركض")، لكنها تضيع تمامًا عندما يُطلب منها البحث عن أشياء نادرة أو صعبة (مثل "شخص يجمع ساعة صغيرة بدقة متناهية"). إنها تعاني لأنها لم تشاهد أمثلة كافية على هذه المفاهيم النادرة، ولأن البيانات التي تدربت عليها صغيرة ومتكررة.

قرر مؤلفو هذه الورقة البحثية، OmniVTG، إصلاح ذلك عبر بناء "كتاب مدرسي" أفضل و"طريقة دراسة" أذكى.

1. الكتاب المدرسي الجديد: مجموعة بيانات OmniVTG

فكر في مجموعات بيانات الفيديو الحالية كمكتبة تحتوي فقط على كتب عن الطبخ والرياضة. إذا سألت الذكاء الاصطناعي عن فيديو يتعلق بـ "علم الفلك"، فلن يعرف ماذا يفعل.

قام المؤلفون ببناء OmniVTG، وهي مكتبة جديدة ضخمة تحتوي على أكثر من 2000 ساعة من الفيديوهات. لكنهم لم يجمعوا فيديوهات عشوائية فحسب؛ بل استخدموا استراتيجية ذكية تسمى التوسع التكراري للتغطية الدلالية (Semantic Coverage Iterative Expansion).

  • التشبيه: تخيل أنك محقق تبحث عن كلمات مفقودة في قاموس. تدرك أن القاموس يفتقر إلى كلمات مثل "دقيق" أو "المشي على الحبال".
  • العملية: بدلاً من التخمين، يطلب الذكاء الاصطناعي من نموذج لغوي قوي (مثل أمين مكتبة فائق الذكاء) ترجمة تلك الكلمات المفقودة إلى مصطلحات بحث محددة (على سبيل المثال، تغيير كلمة "دقيق" إلى "صانع ساعات يجمع التروس"). ثم يبحث عن فيديوهات تناسب تلك الأوصاف المحددة.
  • النتيجة: لقد أنشأوا مجموعة بيانات ضخمة تغطي مجموعة واسعة ومذهلة من المواضيع، من الأنشطة اليومية إلى الأحداث المحددة والنادرة جدًا.

كيف قاموا بتسميتها (Labeling)؟
تسمية الفيديوهات يدويًا عملية بطيئة ومكلفة. لاحظ المؤلفون شيئًا مثيرًا للاهتمام: الذكاء الاصطناعي في الواقع أفضل في وصف الفيديو باستخدام طوابع زمنية ("عند الثانية 10، يلتقط رجل كوبًا") مما هو عليه في تخمين الطوابع الزمنية لجملة معينة. لذا، قلبوا الآية؛ طلبوا من الذكاء الاصطناعي كتابة قصص مفصلة ذات طوابع زمنية عن الفيديوهات أولاً، ثم استخدموا تلك القصص لتعليم الذكاء الاصطناعي كيفية إيجاد اللحظات المناسبة لاحقًا. الأمر يشبه جعل الذكاء الاصطناعي يكتب مذكرات أولاً، ثم استخدام تلك المذكرات لتعليمه كيفية العثور على أحداث محددة.

2. طريقة الدراسة الأذكى: سلسلة أفكار التصحيح الذاتي (Self-Correction CoT)

حتى مع وجود كتاب مدرسي أفضل، ظل الذكاء الاصطناعي يعاني مع المفاهيم النادرة. أدرك المؤلفون أن لدى الذكاء الاصطناعي "شخصية منقسمة":

  • عقل الفهم: كان بارعًا في مشاهدة فيديو والقول: "نعم، هذا يطابق الوصف"، أو "لا، هذا الحدث لم يبدأ بعد".
  • عقل التخمين: كان سيئًا للغاية في مجرد تخمين أوقات البداية والنهاية فورًا.

الحل: استراتيجية "تنبأ، ثم صحح"
بدلاً من إجبار الذكاء الاصطناعي على تخمين الإجابة فورًا، علموه التفكير في خطوات، باستخدام طريقة تسمى سلسلة أفكار التصحيح الذاتي (Self-Correction Chain-of-Thought - CoT).

  • التشبيه: تخيل أنك تجري اختبارًا في الرياضيات.
    • الطريقة القديمة: تكتب أول إجابة تخطر ببالك. إذا كنت مخطئًا، فأنت مخطئ.
    • طريقة OmniVTG: تكتب تخمينًا تقريبيًا. ثم تتوقف وتسأل نفسك: "انتظر، هل يطابق هذا المشكلة حقًا؟ هل فاتني تفصيل ما؟". تستخدم "عقل الفهم" القوي لديك للتحقق من عملك، وتدرك أنك ارتكبت خطأً، ثم تكتب الإجابة الصحيحة.

تتم عملية التدريب في ثلاث مراحل:

  1. الضبط الدقيق الخاضع للإشراف (SFT): تعليم الذكاء الاصطناعي الأساسيات وكيفية التحقق مما إذا كان الفيديو يطابق وصفًا ما.
  2. سلسلة أفكار التصحيح الذاتي (Self-Correction CoT): تعليم الذكاء الاصطناعي تقديم تخمين تقريبي، ثم "التركيز" (Zoom in) وتصحيح نفسه باستخدام مهارات الفهم لديه.
  3. التعلم المعزز (Reinforcement Learning): منح الذكاء الاصطناعي نظام مكافآت للحصول على الإجابة النهائية الصحيحة بعد أن يبذل الجهد الشاق في تصحيح نفسه.

3. النتائج

عندما اختبروا هذا النهج الجديد:

  • على مجموعة البيانات الخاصة بهم: أصبح الذكاء الاصطناعي أفضل بكثير في إيجاد الأحداث النادرة والشائعة على حد سواء، مما قلص الفجوة بينهما.
  • على الاختبارات الموجودة الأخرى: حتى بدون التدريب على تلك الاختبارات المحددة، تفوق الذكاء الاصطناعي على أي نموذج آخر موجود (الأفضل في مجاله - State-of-the-Art). لقد أثبت أنه من خلال تعليم الذكاء الاصطناعي "التفكير وتصحيح نفسه"، أصبح محققًا أكثر موثوقية لأحداث الفيديو.

باختصار: تقول الورقة البحثية: "لقد بنينا مكتبة فيديو أكبر وأكثر تنوعًا، وعلمنا الذكاء الاصطناعي أن يتوقف عن التخمين ويبدأ في مراجعة عمله. هذا يجعله أذكى بكثير في العثور على لحظات محددة في الفيديوهات، حتى الغريبة والنادرة منها".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →