← أحدث الأبحاث
💻 computer science

Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores

تقدم هذه الورقة MSU-Bench، وهو معيار مُنسق بشرياً يتكون من 1,800 زوج من الأسئلة والأجوبة التوليدية عبر الأنماط النصية والبصرية لتقييم وتحسين قدرة النماذج اللغوية الكبيرة ونماذج الرؤية واللغة على فهم المدونات الموسيقية الكاملة من خلال الاستدلال المتكامل على طبقة الصوت، والإيقاع، والتناغم، والبنية.

المؤلفون الأصليون: Congren Dai, Yue Yang, Krinos Li, Huichi Zhou, Shijie Liang, Bo Zhang, Enyang Liu, Ge Jin, Hongran An, Haosen Zhang, Peiyuan Jing, Kinhei Lee, Z henxuan Zhang, Xiaobing Li, Maosong Sun

نُشر 2026-04-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Congren Dai, Yue Yang, Krinos Li, Huichi Zhou, Shijie Liang, Bo Zhang, Enyang Liu, Ge Jin, Hongran An, Haosen Zhang, Peiyuan Jing, Kinhei Lee, Z henxuan Zhang, Xiaobing Li, Maosong Sun

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك روبوت أمين مكتبة عبقرياً وفائق الذكاء، قد قرأ ملايين الكتب ويمكنه الإجابة على أي سؤال تطرحه عليه تقريباً. الآن، تخيل أنك سلمت هذا الروبوت نوتة موسيقية كاملة متعددة الصفحات (مثل النوتة الموسيقية لسمفونية) وطلبت منه أن يتقمص دور أستاذ موسيقى.

هذا هو بالضبط ما يدور حوله هذا البحث، MSU-Bench. أراد الباحثون معرفة ما إذا كانت نماذج الذكاء الاصطنا_ي المتقدمة اليوم (مثل تلك التي تشغل ChatGPT أو Google Gemini) يمكنها حقاً "قراءة" وفهم قطعة موسيقية كاملة، وليس مجرد نوتة واحدة أو مقطع قصير.

إليك تفصيل نتائجهم باستخدام بعض التشبيهات من الحياة اليومية:

1. المشكلة: الروبوت "الأعمى"

وجد الباحثون أنه بينما تبرع نماذج الذكاء الاصطناعي هذه في قراءة النصوص، إلا أنها سيئة جداً في قراءة النوتة الموسيقية المرئية (ملفات PDF).

  • مشكلة "الضياع بين الصفحات": إذا سألت بشراً: "ما هي النوتة الموجودة في المازورة السابعة؟"، فسيقوم بالعدّ ويجدها. لكن الذكاء الاصطناعي غالباً ما يضيع؛ فقد ينظر إلى المازورة السابعة ويصف المازورة الثامنة بالخطأ، أو قد يخترع إجابة من عنده لأنه يقوم بالتخمين فقط.
  • مشكلة "الهلوسة": هذا يشبه طالباً لم يذاكر للاختبار ولكنه يحاول التظاهر بالمعرفة. يرى الذكاء الاصطناعي سؤالاً عن جزء محدد من الموسيقى، وبدلاً من الاعتراف بأنه لا يستطيع رؤيته بوضوح، يبتدع إجابة وهمية. قد يقول: "أوه، هناك طبل صاخب هناك!" بينما لا يوجد في الواقع سوى الصمت.

2. الحل: ترجمة "الكتاب المدرسي"

لإصلاح ذلك، جرب الباحثون حيلة ذكية. بدلاً من عرض صورة النوتة الموسيقية (PDF) للذكاء الاصطناعي، قدموا له ترجمة نصية تسمى ترميز ABC (ABC Notation).

  • التشبيه: تخيل أن النوتة الموسيقية هي خريطة معقدة مرسومة يدوياً. قراءة الخريطة صعبة على الروبوت لأن الخطوط متعرجة والرموز صغيرة جداً. ترميز ABC يشبه تحويل تلك الخريطة إلى قائمة بسيطة من إحداثيات نظام تحديد المواقع (GPS) وأسماء الشوارع (على سبيل المثال: "انعطف يساراً عند C، وسر مستقيماً لمدة 4 نبضات").
  • النتيجة: عندما قرأ الذكاء الاصطناعي هذا "القائمة النصية"، أصبح أكثر ذكاءً. استطاع أخيراً الإجابة على الأسئلة المتعلقة بالأوتار (Chords)، والإيقاع، والبنية بدقة. لقد أثبت أن الذكاء الاصطناعي يعرف نظرية الموسيقى، لكنه فقط يعاني من أجل "رؤية" الرموز المرئية على الصفحة.

3. الاختبار: "الامتحان ذو المستويات الأربعة"

أنشأ الباحثون امتحاناً ضخماً يسمى MSU-Bench يحتوي على 1,800 سؤال بناءً على قطع شهيرة لمؤلفين مثل باخ، وبيتهوفن، وشوبان. وقد نظموا الاختبار في أربعة مستويات من الصعوبة، مثل تسلق السلم:

  • المستوى 1 (الغلاف): "من الذي كتب هذا؟ ما هو العنوان؟ ما هي سرعة العزف؟" (أشياء سهلة).
  • المستوى 2 (التفاصيل): "في المازورة الخامسة، هل توجد علامة دييز (Sharp)؟ ما هي أدنى نوتة؟" (التركيز على التفاصيل).
  • المستوى 3 (الهارموني): "ما هو الوتر الذي يُعزف هنا؟ هل هو وتر كبير (Major) مبهج أم وتر صغير (Minor) حزين؟" (فهم العلاقات بين النوتات).
  • المستوى 4 (الصورة الكبيرة): "أين يظهر اللحن الرئيسي؟ كيف تتغير الأغنية من البداية إلى النهاية؟" (فهم القصة بأكملها).

4. النتائج: تقرير درجات مختلط

عندما اختبروا أكثر من 15 نموذجاً من نماذج الذكاء الاصطنا_ي، كانت النتائج مفاجئة:

  • الفجوة المرئية: عند النظر إلى صور النوتة الموسيقية الفعلية (PDF)، سجلت نماذج الذكاء الاصطنا_ي درجات منخفضة جداً (حوالي 20%). كانوا مثل طلاب يحاولون قراءة كتاب بلغة لا يعرفونها.
  • دفعة النص: عندما تم تزويدهم بالنسخة النصية (ABC)، ارتفعت الدرجات بشكل ملحوظ (لتصل إلى ما يقرب من 50%). استطاعت النماذج أخيراً استخدام "عقولها" لحل الألغاز المنطقية.
  • صراع "الكل أو لا شيء": الجزء الأصعب لم يكن مجرد الإجابة على سؤال واحد، بل الإجابة على جميع الأسئلة بشكل صحيح على التوالي. استخدم الباحثون مقياساً يسمى معدل النجاح لكل مستوى (Level-wise Success Rate). إنه يشبه ألعاب الفيديو: إذا فشلت في المستوى 1، فلن تتمكن حتى من تجربة المستوى 2. فشلت معظم نماذج الذكاء الاصطنا_ي في الحفاظ على سلسلة نجاحهم وتجاوز المستويات الأولى.

5. المستقبل: تدريب الروبوت

حاول الباحثون أيضاً "تعليم" الذكاء الاصطنا_ي من خلال عرض أمثلة عليه (الضبط الدقيق - Fine-tuning).

  • الأخبار الجيدة: بعد قدر قليل من التدريب، أصبح الذكاء الاصطنا_ي أفضل بكثير في كل من قراءة النص وفهم الصور. لم ينسَ كيفية القيام بالأشياء الأخرى (مثل كتابة المقالات أو حل المسائل الرياضية)؛ بل أضاف الموسيقى فقط إلى مهاراته.
  • الأخبار السيئة: حتى مع التدريب، لا يزال الذكاء الاصطنا_ي يعاني مع الجزء المرئي. الأمر يشبه تعليم شخص قراءة الموسيقى، لكنه لا يزال مضطراً لـ "تضييق عينيه" للنظر إلى الصفحة. إنهم بحاجة إلى "عيون" أفضل (معالجة بصرية) لإتقان النوتة الموسيقية حقاً.

الخلاصة

هذا البحث هو بمثابة جرس إنذار لعالم الذكاء الاصطنا_ي. الذكاء الاصطنا_ي ذكي بما يكفي لفهم نظرية الموسيقى، لكنه حالياً "أعمى" تجاه اللغة المرئية للنوتة الموسيقية.

لقد بنى الباحثون هذا المعيار (MSU-Bench) ليكون مسطرة قياس للمستقبل. إنهم يريدون دفع مطوري الذكاء الاصطنا_ي لبناء نماذج يمكنها النظر إلى قطعة من النوتة الموسيقية، وإيجاد الصفحة الصحيحة، وعدّ الموازير (المازورات)، وشرح الموسيقى تماماً كما يفعل قائد الأوركسترا البشري. وحتى ذلك الحين، إذا كنت تريد من الذكاء الاصطنا_ي تحليل سمفونية، فقد لا تزال بحاجة إلى تزويده بترجمة نصية أولاً!

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →