← أحدث الأبحاث
💻 computer science

Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models

تقدم هذه الورقة البحثية "Prompts-to-Summaries"، وهو إطار عمل جديد من نوعه (zero-shot) يستفيد من النماذج اللغوية الكبيرة لتحويل تعليقات نماذج الفيديو واللغة إلى ملخصات فيديو موجهة من قبل المستخدم دون الحاجة إلى بيانات تدريب، محققاً أداءً تنافسياً في المعايير القياسية مع التفوق على الأساليب غير الخاضعة للإشراف السابقة.

المؤلفون الأصليون: Mario Barbara, Alaa Maalouf

نُشر 2026-02-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mario Barbara, Alaa Maalouf

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة من ملفات الفيديو — آلاف الساعات من لقطات عطلتك، أو كاميرات المراقبة، أو يوتيوب. تريد العثور على أفضل اللحظات، لكن مشاهدة كل شيء أمر مستحيل. عادةً، لإنشاء "ملخص لأبرز اللحظات"، تحتاج إلى برنامج كمبيوتر تم تدريبه على آلاف الأمثلة لما يعتبره البشر ملخصات "جيدة". ولكن ماذا لو أردت ملخصاً لفيديو لم يره الكمبيوتر من قبل، أو أردت أن تطلب منه "أرني فقط لحظات الكلب المضحكة" أو "تخطَّ الأجزاء المملة"؟

تقدم هذه الورقة البحثية أداة جديدة تسمى "Prompts-to-Summaries" (من الأوامر إلى الملخصات). فكر فيها كأنها محرر فيديو ذكي لا يحتاج لتدريب مسبق، يعمل مثل فريق من مساعدين متخصصين: المراقب البصري والناقد الحكواتي.

إليك كيف يعمل الأمر، مقسماً إلى خطوات بسيطة:

1. المراقب البصري (VideoLM)

أولاً، ينظر النظام إلى الفيديو. وبما أن الحواسيب لا تستطيع قراءة فيديو مدته ساعتان دفعة واحدة (لأن ذلك يمثل بيانات ضخمة جداً)، يقوم المراقب البصري بتقطيع الفيديو إلى قطع صغيرة ومنطقية تسمى "مشاهد".

  • التشبيه: تخيل محرر أفلام يشاهد شريطاً خاماً ويقطعه إلى مشاهد فردية: "مطاردة السيارات"، "حفلة العشاء"، "العاصفة المطرية".
  • السحر: هذا المراقب لا يكتفي بالتقطيع فحسب؛ بل يكتب وصفاً قصيراً لكل مشهد، مثل ترجمة الأفلام. "رجل يركض مع كلب في الحديقة".

2. الناقد الحكواتي (LLM)

بعد ذلك، يأخذ النظام كل تلك الأوصاف ويسلمها إلى الناقد الحكواتي (نموذج لغوي كبير، مثل الذكاء الاصطناعي الذي يقف وراء هذه الدردشة).

  • المهمة: تعطِي الناقد تعليمات محددة (أمراً/Prompt). على سبيل المثال: "اصنع ملخصاً يركز على الكلب، ولكن تجاهل عملية الركض".
  • الإجراء: يقرأ الناقد وصف كل مشهد ويقوم بتقييمه على مقياس من 1 إلى 100. ويسأل نفسه: "هل يناسب هذا المشهد طلب المستخدم؟ هل هو مهم للقصة بأكملها؟"
  • النتيجة: ينشئ الناقد بطاقة تسجيل (Scorecard). المشاهد التي تحتوي على كلاب تحصل على درجات عالية؛ والمشاهد التي تحتوي على مجرد ركض تحصل على درجات منخفضة.

3. الانتقال السلس (الغراء)

إذا قام الناقد باختيار المشاهد الأعلى تقييماً فحسب، فقد ينتقل الفيديو بشكل غريب (على سبيل المثال، من حديقة إلى مطبخ ثم العودة مجدداً).

  • الحل: يستخدم النظام تقنية "التنعيم" (Smoothing). فهو يعامل الدرجات مثل موجة لطيفة بدلاً من كونها منحدرات حادة. إذا كان المشهد مهماً، فإن الإطارات التي تسبق وتلحق به مباشرة تحصل أيضاً على دفعة بسيطة في الأهمية. هذا يضمن أن يتدفق الفيديو النهائي بشكل طبيعي، مثل فيلم تم تحريره جيداً وليس مجرد عرض شرائح.

4. القطعة النهائية

أخيراً، يقوم النظام بتجميع أعلى الإطارات تقييماً في فيديو قصير ومتماسك.

  • النتيجة: تحصل على ملخص لأبرز اللحظات مخصص يناسب طلبك الخاص، تم إنشاؤه دون أن يحتاج الكمبيوتر أبداً لأن يتم "تعليمه" عبر مجموعة بيانات ضخمة أولاً.

لماذا يعد هذا أمراً هاماً؟

  • لا يتطلب تدريباً: معظم محرري الفيديو يشبهون الطلاب الذين يتعين عليهم الدراسة لسنوات في كتب مدرسية محددة قبل أن يتمكنوا من أداء وظيفة ما. أما هذه الطريقة الجديدة فهي مثل شخص عبقري يمكنه قراءة أي كتاب فوراً. إنها تعمل على أي فيديو، من برامج الطبخ إلى كاميرات المراقبة، دون الحاجة إلى ممارسة مسبقة.
  • أنت المخرج: يمكنك أن تطلب أي شيء. "أرني فقط الأجزاء التي يضحك فيها الناس"، أو "أزل أي مشاهد عنف". النظام يفهم اللغة الطبيعية، وليس مجرد الأكواد البرمجية.
  • التفوق على الخبراء: بشكل مفاجئ، هذا الأسلوب الذي "لا يتطلب تدريباً" يتفوق في الواقع على العديد من الطرق المعقدة التي تعتمد بكثافة على التدريب والتي تمت دراستها لسنوات.

"السر الخفي"

لقد ابتكر المؤلفون أيضاً اختباراً جديداً يسمى VidSum-Reason. تخيل أنك تسأل الكمبيوتر: "أرني الأجزاء التي يدرك فيها الشخص أنه تائه". هذا يتطلب من الذكاء الاصطناعي فهم المشاعر والمنطق، وليس فقط رصد "شخص" أو "سيارة". هذه الأداة الجديدة هي واحدة من أوائل الأدوات التي تتعامل مع هذه الطلبات العميقة القائمة على التفكير بنجاح.

باختأطر شديد: تمنحنا هذه الورقة البحثية ملخصاً عالمياً للفيديو يستمع لصوتك، ويفهم قصدك، ويحرر فيديوهاتك فوراً، وكل ذلك دون الحاجة إلى تدريبه أولاً على جبل من البيانات. إنها تحول فيض الفيديو الفوضوي إلى قصة شخصية قابلة للقراءة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →