Using LLMs for Ontology generation by video summarization
تقدم هذه الورقة خوارزمية مكونة من مرحلتين تسخر النماذج اللغوية الكبيرة لإنشاء أنطولوجيات RDF تلقائياً من روابط فيديوهات يوتيوب عبر إنشاء ملخص نصي أولاً ثم تحويله إلى تمثيل نطاق مهيكل، محققة دقة بنسبة 90% على مجموعة بيانات رياضية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في المشهد الشاسع للمعلومات الرقمية، هناك تحدٍ مستمر: كيف نعلم الحواسيب ليس فقط تخزين البيانات، بل فهم العلاقات بين الأفكار. تخيل مكتبة يتم فيها تصنيف كل كتاب حسب لون غلافه بدلاً من موضوعه؛ سيكون العثور على قصة معينة أمراً مستحيلاً تقريباً. في عالم الحوسبة، يتم حل هذه المشكلة عن طريق إنشاء "الأنطولوجيات" (Ontologies). فكر في الأنطولوجيا كخريطة معرفية مهيكلة لمجال محدد، مثل الرياضة أو الطب؛ فهي تحدد المفاهيم الرئيسية داخل ذلك المجال، والأهم من ذلك، ترسم الخطوط التي تربط بينها. تسمح هذه الخريطة للآلات بالاستنتاج والبحث ومشاركة المعلومات بطريقة تحاكي الفهم البشري. ومع ذلك، فإن بناء هذه الخرائط كان تقليدياً عملية بطيئة ومكلفة تتطلب فرقاً من الخبراء البشريين لتعريف كل مصطلح واتصال يدوياً. ومع انفجار حجم المحتوى الرقمي، لا سيما في تنسيقات الفيديو، تعاني الأساليب القديمة للبناء اليدوي لمواكبة هذا التدفق.
يحاول نهج جديد، فصلت تفاصيله أبحاث حديثة للدكتور خالد عمر من جامعة دمشق، تجاوز عقبة العمل البشري باستخدام الذكاء الاصطناعي المتقدم لبناء خرائط المعرفة هذه مباشرة من الفيديو. تركز الدراسة على نوع معين من الذكاء الاصطناعي يُعرف بنماذج اللغات الكبيرة، وهي أنظمة تدربت على كميات هائلة من النصوص ويمكنها قراءة وفهم وتوليد اللغة البشرية بطلاقة ملحوظة. وبينما استُخدمت هذه النماذج سابقاً لتلخيص النصوص، يطرح هذا البحث سؤالاً أكثر جرأة: هل يمكنها مشاهدة فيديو، وفهم رسالته الجوهرية، وبناء خريطة معرفية رسمية لموضوعه تلقائياً؟ الإجابة، وفقاً للدراسة، هي "نعم" واعدة. فقد طور الباحثون نظاماً يتكون من خطوتين: يحول أولاً الفيديو إلى ملخص مكتوب موجز، ثم يحول هذا الملخص إلى تنسيق بيانات مهيكل يمكن للحواسيب استخدامه للاستنتاج حول محتوى الفيديو.
تبدأ العملية بمدخل بسيط: رابط لفيديو على يوتيوب. لا يشاهد النظام الفيديو بالطريقة التي يفعلها البشر، عبر معالجة الصور المتحركة؛ بل يقوم أولاً باستخراج الكلمات المنطوقة من الفيديو، مما ينشئ نصاً مكتوباً (Transcript). بعد ذلك، يتم تغذية هذا النص في نموذج ذكاء اصطناعي قوي يسمى Llama 3.2، والذي قام الباحثون بتشغيله على أجهزتهم المحلية لتجنب تكاليف الحوسبة السحابية. يعمل النموذج كمحرر ماهر، حيث يقرأ النص ويقسمه إلى أجزاء يمكن إدارتها، ثم يلخص كل قسم ويجمع تلك الملخصات في سرد متماسك واحد. هذا السرد ليس مجرد مجموعة عشوائية من الجمل؛ بل هو مهيكل بعناية لتسليط الضوء على الموضوع الرئيسي للفيديو، وتحديد الأشخاص أو الأشياء الأكثر أهمية المذكورة، واستخراج الاستنتاقات الرئيسية. والنتيجة هي قصة نصية نظيفة تلتقط جوهر الفيديو الأصلي.
بمجرد أن يصبح هذا الملخص النصي جاهزاً، ينتقل النظام إلى مرحلته الثانية: تحويل القصة إلى خريطة رسمية. هنا، يتولى نموذج ذكاء اصطناعي مختلف، وهو Gemini Pro 002، زمام الأمور. يزود الباحثون هذا النموذج بمجموعة محددة من التعليمات، أو "الأمر" (Prompt)، تطلب منه العمل كمهندس معرفة. يُطلب من النموذج النظر في الملخص، وتحديد مجال الفيديو، وسرد المفاهيم الرئيسية الموجودة فيه. ثم يأخذ هذه المفاهيم ويبدأ في رسم الروابط بينها، مع تحديد كيفية ارتباطها ببعضها البعض. أخيراً، يخرج النموذج هذه البنية بتنسيق قياسي معروف باسم RDF، وهو طريقة لكتابة البيانات تسمح للأنظمة الحاسوبية المختلفة بتبادل المعلومات وفهمها بسلاسة. وتحدث دورة العمل بأكملها، من رابط فيديو خام إلى خريطة معرفية مهيكلة، بشكل تلقائي، دون الحاجة إلى تدخل بشري لتعريف المصطلحات أو العلاقات.
لاختبار ما إذا كانت هذه الطريقة المؤتمتة تعمل بالفعل، طبق الباحثون هذا النهج على مجموعة بيانات مكونة من مائة فيديو تركز على الرياضة. لم يكتفوا بترك النظام يعمل ويتمنون الأفضل فحسب؛ بل قاموا بقياس أدائه مقابل معيار عالٍ. بالنسبة للجزء الأول من العملية، وهو تلخيص الفيديو، قارنوا ملخص الذكاء الاصطناعي المكتوب بالعنوان الأصلي للفيديو لمعرفة مدى تطابقهما في المعنى. حقق النظام مستوى عالٍ من الاتفاق، حيث توافقت الملخصات مع العناوين بنسبة تسعين بالمائة تقريباً. وبالنسبة للجزء الثاني، وهو إنشاء خريطة المعرفة، قارن الباحثون الخريطة التي أنشأها الذكاء الاصطناعي بخريطة أنشأها خبير بشري. وهذا هو الاختبار الحقيقي لما إذا كان الآلة تفهم هيكل المعرفة، وليس مجرد الكلمات. في هذه المقارنة، نجح النظام المؤتمت في إعادة إنشاء خريطة الخبير البشري بدقة بلغت خمسة وثمانين بالمائة. وعند النظر إلى العملية برمتها ككل، حسب الباحثون دقة إجمالية بلغت تسعين بالمائة.
إن الآثار المترتبة على هذا العمل كبيرة جداً لكيفية إدارتنا للمحيط المتزايد من محتوى الفيديو على الإنترنت. فمن خلال أتمتة إنشاء خرائط المعرفة هذه، يقلل النظام من الاعتماد الكبير على الخبراء البشريين، مما يجعل من الممكن تنظيم وفهم بيانات الفيديو على نطاق كان مستحيلاً في السابق. ويشير الباحثون إلى أنه بينما اختبروا ذلك على فيديوهات رياضية، فإن الطريقة ليست مقتصرة على هذا المجال؛ بل يمكن تطبيقها على المحاضرات الطبية، أو الدروس التعليمية، أو أي مجال يكون فيه الفيديو مصدراً أساسياً للمعلومات. وتشير الدراسة إلى أن مستقبل تنظيم المعرفة الرقمية قد يكمن في هذه الأنظمة الهجينة، حيث يتولى الذكاء الاصطناعي المهام الشاقة من الاستخراج والهيكلة، مما يسمح للبشر بالتركيز على التحقق والتطبيق في مستويات أعلى. ويقف هذا البحث كدليل على أنه مع الأدوات المناسبة، فإن المهمة المعقدة لتحويل صورة متحركة إلى فهم مهيكل وقابل للقراءة آلياً للعالم لم تعد مجرد إمكانية نظرية، بل واقع عملي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.