LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs
لمعالجة الفجوة في تقييم النماذج اللغوية الكبيرة متعددة الوسائط (omnimodal) على المحتوى طويل التنسيق، تقدم هذه الورقة LVOmniBench، وهو معيار جديد يتكون من 275 فيديو (تتراوح مدتها بين 10 إلى 90 دقيقة) و1,014 زوجاً من الأسئلة والأجوبة يكشف أن النماذج الحالية تعاني في الاستيعاب السمعي البصري الممتد، حيث حققت دقة أقل من 35% للنماذج مفتوحة المصدر وما يصل إلى 65% لنموذج Gemini 3 Pro.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيف يفهم العالم. حتى الآن، علمناه كيف ينظر إلى صورة واحدة أو يستمع إلى مقطع أغنية مدته 10 ثوانٍ. إنه يؤدي بشكل جيد في تلك المهام القصيرة. لكن الحياة الواقعية ليست مجالية من اللقطات الثابتة؛ إنها فيلم مستمر ومتدفق يمكن أن يستمر لساعات، مليء بالناس وهم يتحدثون، والموسيقى وهي تعزف، وأشياء تحدث في الخلفية.
تقدم هذه الورقة البحثية LVOmniBench، وهو "امتحان نهائي" جديد مصمم لاختبار ما إذا كان بإمكان روبوتات الذكاء الاصطناعي الأكثر ذكاءً التعامل فعلياً مع هذه الأفلام الطويلة والمعقدة.
إليك تفصيل لما قاموا به، باستخدام بعض التشبيهات البسيطة:
1. المشكلة: فخ "المقطع القصير"
حتى الآن، كانت معظم اختبارات الذكاء الاصطناعي تشبه عرض فيديو مدته 10 ثوانٍ لقطة تقفز على طالب وسؤاله: "هل قفزت القطة؟". كان بإمكان الذكاء الاصطناعي حفظ تلك القفزة المحددة بسهولة.
لكن في العالم الحقيقي، الفيديوهات تشبه الأفلام الوثائقية التي تبلغ مدتها 90 دقيقة أو فيديوهات الـ vlogs. فهي تحتوي على:
- ذاكرة طويلة المدى: "ماذا قال ذلك الرجل قبل 20 دقيقة؟"
- توقيت معقد: "متى توقفت الموسيقى وبدأ المطر؟"
- إشارات مختلطة: أشخاص يتحدثون فوق صوت الموسيقى أثناء القيام بشيء ما بأيديهم.
نماذج الذكاء الاصطناعي الحالية تشبه الطلاب الذين يمكنهم حفظ البطاقات التعليمية ولكنهم يفشلون في امتحان نهائي مدته 3 ساعات. إنهم يضيعون عندما تصبح القصة طويلة جداً.
2. الحل: LVOmniBench (اختبار "الماراثون")
قام الباحثون ببناء اختبار جديد يسمى LVOmniBench. فكر فيه كأنه ماراثون وليس سباقاً قصيراً.
- المسار: قاموا بجمع 275 فيديو من العالم الحقيقي (مثل برامج الطبخ، وفيديوهات السفر، والمقابلات) التي تتراوح مدتها من 10 إلى 90 دقيقة.
- الأسئلة: كتبوا أكثر من 1,000 سؤال تتطلب من الذكاء الاصطناعي استخدام كل من عينيه (الفيديو) وأذنيه (الصوت) في نفس الوقت.
- مثال: "الرجل في الفيديو يقول إنه يبحث عن 'توبي'. كم مرة رآه توبي بالفعل في الفناء؟"
- لماذا هذا صعب: يجب على الذكاء الاصطناعي الاستماع إلى الاسم، ومشاهدة الفيديو للعثور على الكلب، وعدّ مرات الظهور، وتجاهل المرات التي لا يكون فيها الكلب موجوداً.
3. النتائج: "الابن الغني" مقابل "الطالب المتعثر"
اختبر الباحثون أفضل نماذج الذكاء الاصطناعي في هذا الماراثون. كانت النتائج صادمة نوعاً ما:
- النماذج "المملوكة" (الأبناء الأغنياء): هذه هي النماذج باهظة الثمن والمغلقة المصدر مثل Gemini 3 Pro. إنهم مثل الطلاب الذين لديهم مدرسون خصوصيون ووقت دراسة غير محدود. سجلوا حوالي 65%. لقد أدوا جيداً، لكنهم لا يزالون يخطئون في حوالي ثلث الأسئلة.
- النماذج "مفتوحة المصدر" (الطلاب المتعثرون): هذه هي النماذج المجانية التي بناها المجتمع. سجلوا أقل من 35%.
- التشبيه: إذا كنت تخمن عشوائياً في اختبار اختيار من متعدد، فستحصل على 25% صحيحة. هذه النماذج مفتوحة المصدر كانت بالكاد تؤدي بشكل أفضل من التخمين العشوائي. لقد ضاعوا تماماً في الفيديوهات الطويلة.
4. أين فشلوا؟ (منطقة "الهلوسة")
وجدت الورقة البحثية أن الذكاء الاصطناعي يفشل بثلاث طرق محددة، مثل طالب سيء في:
- العد: "كم مرة نبح الكلب؟" (غالباً ما يفقد الذكاء الاصطناعي القدرة على العد).
- إدراك الموسيقى: "ما هي الآلة التي تعزف؟" (الذكاء الاصطناعي يسمع الضجيج لكنه لا يستطيع تحديد اللحن).
- السفر عبر الزمن: "ماذا حدث قبل 15 دقيقة؟" (الذكاء الاصطناعي ينسى بداية الفيديو بحلول وصوله إلى نهايته).
5. الخلاصة الكبرى
الرسالة الرئيسية هي أننا لم نصل بعد.
بينما يعد الذكاء الاصطناعي مذهلاً في النظر إلى صورة أو الاستماع إلى جملة قصيرة، إلا أنه حالياً سيء جداً في فهم قصة طويلة ومستمرة حيث تختلط الأصوات والمشاهد معاً. النماذج "مفتوحة المصدر" هي في الأساس عمياء وصماء تجاه تفاصيل الفيديوهات الطويلة.
لماذا يهم هذا؟
لأن مستقبل الذكاء الاصطناعي لا يقتصر فقط على الإجابة عن أسئلة حول صورة. بل يتعلق بامتلاك مساعد ذكاء اصطناعي يمكنه مشاهدة بث كاميرا مراقبة لمدة ساعتين للعثور على لص، أو الاستماع إلى محاضرة مدتها 45 دقيقة وتلخيص النقاط الرئيسية. هذا الاختبار الجديد (LVOmniBench) هو الخطوة الأولى لإجبار مطوري الذكاء الاصطناعي على بناء نماذج يمكنها حقاً التعامل مع طول وتعقيد الحياة الواقعية.
باختصار: لقد صنعنا اختباراً أصعب، وفشل الذكاء الاصطناعي فيه. الآن، نحن نعرف بالضبط ما الذي يجب إصلاحه لجعل الجيل القادم من الذكاء الاصطناعي "شامل الذكاء" حقاً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.