← أحدث الأبحاث
🤖 AI

Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

تقدم هذه الورقة Diagram-MMU، وهو معيار متعدد الوسائط يضم 3.7 ألف رسم توضيحي علمي و18.3 ألف سؤال تم التحقق من صحتها لتقييم نماذج اللغات الكبيرة متعددة الوسائط (MLLMs) في مهام تحويل الرسم التوضيحي إلى كود، والتحرير، والإجابة على الأسئلة، مما يكشف عن تفوق النماذج في الاستنتاج، بينما تعاني في مهام توليد الكود ما لم تعمل في بيئات وكيلة (agentic settings).

المؤلفون الأصليون: Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang

نُشر 2026-08-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك عالم تكتب ورقة بحثية عن اكتشاف جديد. لديك رسم بياني رائع لبياناتك، أو مخطط دائرة كهربائية لتجربتك، أو بنية جزيئية لعقار جديد. في الأيام الخوالي، ربما كنت سترسم ذلك يدويًا أو تستخدم برنامج كمبيوتر لإنشاء ملف صورة (مثل PNG أو JPG) وتلصقه في مستندك. ولكن في العصر الحديث، غالبًا ما يستخدم العلماء لغة خاصة تسمى LaTeX لكتابة أوراقهم لأنها تبدو احترافية للغاية وتتعامل مع الرياضيات بشكل مثالي. وداخل LaTeX، توجد أداة قوية جدًا تسمى TikZ. فكر في TikZ كأنها مجموعة من التعليمات الدقيقة لرسام آلي. بدلًا من إعطاء الرسام صورة جاهزة، أنت تعطيه قائمة من الأوامر مثل "ارسم دائرة حمراء هنا"، "صل هذه الخطوط بذاك الخط"، و"اكتب الرقم 5 هنا". إذا اتبع الرسام التعليمات بدقة، فإنه سيرسم الرسم التوضيحي الذي تحتاجه تمامًا، وسيتناسب تمامًا مع ورقتك البحثية.

الآن، تخيل أن لديك عقلًا حاسوبيًا فائق الذكاء يسمى نموذج لغوي كبير متعدد الوسائط (MLLM). قد تفكر: "إذا كان هذا العقل يمكنه قراءة صورة وفهم معناها، ألا يمكنه ببساطة النظر إلى الرسم التوضيحي الخاص بي وكتابة تعليمات TikZ لي؟" هذا هو السؤال الكبير الذي تعالجه هذه الورقة البحثية. يريد العلماء أن تكون هذه العقول الاصطناعية قادرة على النظر إلى رسم توضيحي، وفهم العلم الكامن وراءه، ثم كتابة الكود لإعادة إنتاجه أو حتى تغييره (مثل تحويل مخطط أعمدة إلى مخطط خطي) بمجرد الاستماع إلى طلب بسيط. هذا جزء من اتجاه جديد يسمى "كتابة النبض" (vibe writing)، حيث تصف فقط ما تريد، ويقوم الذكاء الاصطعي بالعمل الشاق نيابة عنك. ولكن هل يمتلك الذكاء الاصطناعي المهارات اللازمة للقيام بذلك حقًا، أم أنه يتظاهر بالفهم فقط؟

لقد قرر الباحثون وراء Diagram-MMU بناء اختبار ضخم وصارم لمعرفة ذلك. لقد أنشأوا معيارًا (اختبارًا معياريًا) يضم 3,744 رسمًا توضيحيًا علميًا فريدًا و 18,305 سؤالًا ومهمة مختلفة. تغطي هذه الرسوم ستة عوالم علمية مختلفة: المخططات (مثل الرسوم البيانية)، الهندسة المسطحة، الأشكال ثلاثية الأبعاد، رسوم الشبكات، الجزيئات الكيميائية، والدوائر الكهربائية. لم يكتفوا بسؤال الذكاء الاصطناعي عن النظر إلى الصورة فحسب؛ بل اختبروه في ثلاثة تحديات محددة:

  1. التحليل (Parsing): النظر إلى رسم توضيحي وكتابة الكود لرسمه من الصفر.
  2. التعديل (Editing): النظر إلى رسم توضيحي والكود الخاص به، ثم تغيير الكود ليتوافق مع تعليمات جديدة (مثل "اجعل المقاومة زرقاء" أو "حول هذه الدائرة المتوازية إلى دائلة توالي").
  3. الإجابة على الأسئلة (Question Answering): النظر إلى الرسم التوضيحي والإجابة على سؤال حول العلم الموجود بداخله (مثل "ما هي المقاومة الإجمالية؟").

لقختبروا أيضًا ما إذا كان بإمكان الذكاء الاصطناعي العمل كمساعد مفيد يعرف متى يبحث عن المعلومات. لقد أعطوا الذكاء الاصطناعي "أداة بحث" خاصة للبحث عن قواعد (syntax) لغة TikZ إذا تعثر، واختبروا ما إذا كان بإمكانه تخطيط خطواته: "أولاً، أحتاج لفهم الصورة، ثم سأبحث عن القاعدة، ثم سأكتب الكود".

إذًا، ماذا وجدوا؟ كانت النتائج مزيجًا من "واو" و"أوه لا". النماذج الذكية في الواقع جيدة جدًا في التفكير في الرسوم التوضيحية. فعندما سُئلت أسئلة مثل "أي عمود هو الأطول؟" أو "هل هذان المكونان متصلان؟"، أجابت النماذج بشكل صحيح في معظم الأحيان (بدقة تصل إلى 86%). إنها تفهم العلم!

ومع ذلك، عندما تعلق الأمر بـ كتابة الكود لرسم الرسوم التوضيحية، واجهت النماذج صعوبة كبيرة. فحتى أفضل النماذج لم تحصل إلا على حوالي 31% إلى 57% فقط من العناصر الأساسية (مثل الدوائر، والخطوط، والنصوص) في أماكنها الصحيحة. الأمر يشبه أن يكون الذكاء الاصطناعي قادرًا على وصف منزل مثالي بالتفصيل، ولكن عندما يحاول بناءه بالفعل باستخدام الطوب، فإنه يضع النوافذ في السقف والباب في الأرضية. تشير الورقة إلى أنه بينما يمكن لهذه النماذج أن تكون رائعة في الاستنتاج، إلا أنها لا تزال سيئة نوعًا ما في الإدراك البصري الدقيق اللازم لترجمة صورة إلى كود دقيق.

كما درست الدراسة ما إذا كان منح الذكاء الاصطناعي "أداة بحث" (السماح له بالبحث عن القواعد) قد ساعد. بالنسبة لمهام التعديل، فقد ساعد ذلك قليلاً. ولكن بالنسبة لمهام الإجابة على الأسئلة، فقد جعل الأمر الأمور أسوأ في كثير من الأحيان لأن الذكاء الاصطناعي ارتبك بسبب كثرة المعلومات أو طرح الأسئلة الخاطئة. برز نموذج Claude-4.6 Opus كأكثر النماذج اتساقًا، حيث أصبح أفضل في المهام الثلاث عند منحه أداة البحث، لكن معظم النماذج الأخرى تعثرت.

باختصار، تكشف الورقة عن فجوة مضحكة: يمكن للذكاء الاصطناعي اليوم أن يكون عالمًا عبقريًا يفهم رسوماتك التوضيحية تمامًا، لكنه لا يزال فنانًا أخرق عندما يحاول رسمها باستخدام لغة TikZ. ويأمل المؤلفون أن يساعد هذا الاختبار المطورين على بناء أدوات أفضل بحيث يمكن للعلماء في المستقبل حقًا مجرد "بث نبض" (vibe) رسوماتهم التوضيحية إلى الوجود دون القلق بشأن الكود.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →