← أحدث الأبحاث
⚡ electrical engineering

AVSD-Scenes: A Dataset for Audio-Visual Description of Urban Scenes

تقدم هذه الورقة AVSD-Scenes، وهي مجموعة بيانات جديدة مكونة من 12,291 وصفاً صوتياً-بصرياً مقترناً للبيئات الحضرية تم إنشاؤها عبر دمج مخرجات نمطية محددة من نماذج ذكاء اصطناعي متقدمة، والتي تُظهر أداءً فائقاً في المحاذاة الدلالية، والاسترجاع عبر الوسائط، وتصنيف المشاهد مقارنة بالنهج أحادي النمط.

المؤلفون الأصليون: Dhanunjaya Varma Devalraju, Arshdeep Singh, Mark D. Plumbley

نُشر 2026-10-02
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Dhanunjaya Varma Devalraju, Arshdeep Singh, Mark D. Plumbley

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

المدن لا تسكن أبداً، ولا تهدأ أبداً. إنها نسيج مستمر ومتغير من الصوت والمشهد، حيث يحدث دوي حافلة، ودردشة حشد، والمسح البصري لمقعد في حديقة، كل ذلك في آن واحد. لعقود من الزمن، حاول العلماء تعليم الحواسيب فهم هذه البيئات، لكنهم غالباً ما اعتمدوا على تسميات بسيطة، مثل وسم تسجيل بكلمة "منتزه" أو "شارع". هذه التسميات مفيدة، لكنها ضحلة؛ فهي تخبرنا بالموقع ولكنها تغفل القصة. إنها لا تلتقط حفيف الأوراق المحدد، أو لون معطف عابر سبيل، أو الطريقة التي يتردد بها صدى الصوت عن مبنى ما. لكي يفهم الحاسوب المدينة حقاً، فإنه يحتاج إلى ما هو أكثر من مجرد اسم؛ إنه يحتاج إلى وصف ينسج ما يُرى مع ما يُسمع في سرد واحد متماسك.

هذا هو التحدي الذي واجهه الباحثون في المعهد الهندي للتكنولوجيا بمدريد (IIT Madras) وكلية كينغز بلندن (King's College London) من خلال مشروع جديد يسمى AVSD-Scenes. لقد سعى الفريق لإنشاء مجموعة ضخمة من المشاهد الحضرية، كل منها مقترن بوصف لغوي طبيعي غني يشرح بالضبط ما يحدث في كل من الصوت والفيديو. بدأوا بمكتبة موجودة بالفعل تضم 12,291 تسجيلاً من عشر مدن أوروبية، حيث يحتوي كل مقطع على صوت وفيديو متزامنين. ومع ذلك، كانت المكتبة الأصلية تقدم فقط وسوماً فئوية أساسية. أراد الباحثون ملء الفجوات، وتحويل تلك الوسوم البسيطة إلى فقرات مفصلة تصف الأحداث والأشياء والأفعال المحددة التي تحدث في كل مشهد.

ولتحقيق ذلك، بنوا مسار عمل مؤتمتاً يعمل كفريق من المراقبين المتخصصين. أولاً، استخدموا نماذج ذكاء اصطناعي قوية للنظر في الصوت والفيديو بشكل منفصل. استمع أحد النماذج إلى الصوت، محدداً أصواتاً معينة مثل زقزقة العصافير أو ضوضاء المرور، وكتب ملخصاً قصيراً لما سمعه. وراقب نموذج آخر الفيديو، ليرصد الأشخاص والمركبات والحركات، وكتب ملخصاً لما رآه. ثم تم إدخال هذين التقريرين المنفصلين إلى نموذج لغوي ثالث أكثر تقدماً. عمل هذا النموذج النهائي كمحرر، حيث دمج الملاحظات الصوتية والملاحظات البصرية في قصة واحدة موحدة. وقد أُمر النموذج بضمان أن تكون القصة منطقية، وتجنب اختلاق الأمور، والحفاظ على وصف مرتبط بالأدلة الفعلية المقدمة من الصوت والصورة. وكانت النتيجة عبارة عن مجموعة بيانات حيث يرافق كل مشهد حضري فقرة تقرأ وكأنها ملاحظة بشرية، تلتقط السياق الكامل للحظة.

اختبر الباحثون بعد ذلك ما إذا كانت هذه الأوصاف التي أنشأها الكمبيوتر مفيدة حقاً. طرحوا سلسلة من الأسئلة لمعرفة ما إذا كانت الأوصاف يمكن أن تساعد الكمبيوتر على فهم العالم بشكل أفضل. تضمن أحد الاختبارات معرفة ما إذا كان بإمكان الكمبيوتر استخدام وصف نصي للعثور على مقطع الفيديو أو المقطع الصوتي الصحيح من مكتبة كبيرة. وأظهرت النتائج أن هذه الأوصاف متعددة الوسائط كانت أفضل بكثير في هذه المهمة من الأوصاف القائمة على الصوت فقط أو الرؤية فقط. عندما استخدم الكمبيوتر الوصف المدمج، تمكن من العثى المقطع الصوتي المطابق في كثير من الأحيان، مما يشير إلى أن النص قد نجح في التقاط جوهر الصوت.

كما اختبروا أيضاً ما إذا كانت هذه الأوصاف يمكن أن تساعد الكمبيوتر في تحديد نوع المشهد الحضري الذي ينظر إليه، مثل التمييز بين محطة مترو مزدحمة وساحة عامة هادئة. باستخدام الأوصاف النصية فقط، حقق النظام دقة بلغت 94.5 بالمائة في تحديد المشهد الصحيح. وعندما دمج الباحثون النص مع البيانات الصوتية والمرئية الأصلية، ارتفت الدقة قليلاً إلى 95.4 بالمائة. كان هذا تحسناً ملحوظاً مقارنة باستخدام الصوت أو الفيديو وحدهما، اللذين واجها صعوبة في الوصول إلى مستويات مماثلة من الدقة. تشير النتائج إلى أن الأوصاف المكتوبة قد التقطت تفاصيل عميقة وذات مغزى عن البيئة فات مرت من خلال البيانات الخام وحدها.

ولعل الجزء الأكثر كشفاً في الدراسة كان اختباراً صُمم لمعرفة ما إذا كان الكمبيوتر يحفظ أسماء المشاهد أم يفهم المحتوى حقاً. قام الباحثون بإزالة تسميات المشاهد من التعليمات المعطاة للذكاء الاصطناعي أثناء عملية الإنشاء، مما أجبره على الاعتماد كلياً على المحتوى الصوتي والمرئي لإنشاء الأوصاف. وحتى دون إخباره باسم المكان، ظلت الأوصاف فعالة للغاية في التمييز بين أنواع المشاهد المختلفة. أشار هذا إلى أن الذكاء الاصطناعي لم يكن ببساطة يكرر تسمية "منتزه" لأنه أُمر بذلك؛ بل كان يصف حقاً المساحات العشبية، والأسوار الخشبية، والأصوات المحددة للبيئة. كانت الأوصاف تلتقط واقع المشهد، وليس مجرد الفئة.

قيم الفريق أيضاً جودة الكتابة نفسها. استخدموا أدوات مؤتمتة وحكاماً بشريين لتقييم الأوصاف بناءً على عوامل مثل الطلاقة، والقواعد، ومدى مطابقة النص للصوت والفيديو. وجد الحكام البشريون أن الأوصاف دقيقة ومعلوماتية بشكل عام، مع درجات عالية في كيفية وصف ما يُرى ومدى سلاسة كتابتها. وبينما كانت هناك لحظات عرضية حيث يمكن تحسين الأوصاف، إلا أن الجودة الإجمالية كانت قوية بما يكفي لتكون مفيدة للمهام المعقدة.

يمثل هذا العمل خطوة كبيرة للأمام في كيفية إدراك الآلات للعالم. فمن خلال الانتقال من التسميات البسيطة إلى السرديات الوصفية الغنية، أظهر الباحثون أن الحواسيب يمكنها تعلم فهم التفاعل المعقد بين الصوت والرؤية في حياتنا اليومية. توفر مجموعة البيانات هذه، المتاحة الآن للآخرين لاستخدامها، أساساً جديداً لبناء أنظمة يمكنها حقاً "رؤية" و"سماع" العالم كما نفعل نحن. إنها تشير إلى أن مستقبل الذكاء الاصطناعي في البيئات الحضرية لا يكمن في تسميات أفضل، بل في قصص أفضل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →