← أحدث الأبحاث
💻 computer science

Assessing Y-Axis Influence: Bias in Multimodal Language Models on Chart-to-Table Translation

تقدم هذه الورقة إطار عمل FairChart2Table الذي يكشف أن نماذج اللغات متعددة الوسائط تظهر تحيزات أداء كبيرة تتعلق بخصائص المحور الصادي (مثل طول الأرقام، وعدد العلامات، ونطاق القيم) وتعقيد وسيلة الإيضاح في عملية ترجمة المخططات إلى جداول، مع إثبات أن توفير معلومات صريحة حول المحور الصادي يمكن أن يخفف من هذه التفاوتات.

المؤلفون الأصليون: Seok Hwan Song, Azher Ahmed Efat, Wallapak Tavanapong

نُشر 2026-04-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Seok Hwan Song, Azher Ahmed Efat, Wallapak Tavanapong

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طباخاً آلياً (نموذج لغوي متعدد الوسائط، أو MLM)، ومهمته هي النظر إلى صورة لمخطط بياني وكتابة الوصفة (جدول البيانات) تماماً كما تظهر. من المتوقع أن يكون هذا الروبوت مثالياً، أليس كذلك؟

تقول هذه الورقة البحثية: تمهل قليلاً. فالروبوت في الواقع "متطلب" جداً بشأن كيفية كتابة الأرقام على المسطرة الرأسية للمخطط (المحور الصادي y-axis). إذا بدا شكل المسطرة بطريقة معينة، فسيطبخ الروبوت وجبة رائعة. أما إذا بدت مختلفة قليلاً، فسيحرق الطعام.

إليك تفصيل نتائجهم باستخدام تشبيهات بسيطة:

1. المشكلة: الروبوت لديه "نقاط عمياء"

لاحظ الباحثون أن المخططات التي تدرب عليها الروبوتات كانت غير متوازنة. كان الأمر يشبه تدريب طباخ فقط على وصفات تستخدم "أكواب الدقيق"، دون تعليمه أبداً عن استخدام "الملاعق الكبيرة". وعندما يرى الطباخ لأول مرة ملعقة كبيرة، يصاب بالارتباك.

في عالم المخططات، "المكونات" هي أشياء مثل:

  • طول الرقم (Digit Length): هل الرقم هو "5" أم "5,000,000"؟
  • علامات التجزئة (Tick Marks): هل هناك 3 خطوط على المسطرة أم 11 خطاً؟
  • التنسيقات (Formats): هل الأرقام مكتوبة كـ "7,000"، أم "7K"، أم "7.00e+3"؟

وجدت الورقة أن أداء الروبوتات يتراجع عندما تتغير هذه "المكونات" المحددة، حتى لو كانت البيانات الفعلية هي نفسها.

2. الحل: "مطبخ اختبار عادل" (FairChart2Table)

لإثبات ذلك، بنى الباحثون مطبخ اختبار جديداً فائق التحكم يسمى FairChart2Table.

  • الإعداد: بدلاً من استخدام مخططات حقيقية فوضوية، قاموا بإنشاء الآلاف من المخططات الاصطناعية المثالية.
  • التحكم: قاموا بتغيير شيء واحد فقط في كل مرة. على سبيل المثال، أخذوا نفس البيانات تماماً وصنعوا مخططاً واحداً بأرقام مثل "1، 2، 3" ومخططاً آخر بأرقام مثل "1,000، 2,000، 3,000".
  • الهدف: معرفة أي ميزة محددة في المسطرة هي التي تجعل الروبوت يتعثر.

3. النتائج الرئيسية: ما الذي يربك الروبوت؟

أ. "حجم" الأرقام (طول الرقم)
اعتبر طول الرقم بمثابة حجم الخط على المسطرة.

  • النتيجة: يرتبك الروبوت عندما تصبح الأرقام طويلة جداً (مثل 15 أو 16 رقماً). الأمر يشبه محاولة قراءة قائمة طعام حيث تُكتب الأسعار بخط مجهري صغير جداً. بعض الروبوتات (مثل GPT-4o) أصبحت فوضوية للغاية مع الأرقام الطويلة جداً، بينما تعاملت روبوتات أخرى (مثل Gemini) معها بشكل أفضل لكنها لا تزال تعاني.

ب. "الزحام" في المخطط (عدد الكيانات/الخطوط)
تخيل مخططاً به خط واحد (كيان واحد) مقابل مخطط به ستة خطوط تتقاطع جميعها مثل وعاء من السباغيتي.

  • النتيجة: كلما زاد الازدحام في الخطوط، بدأت الروبوتات في الخلط بينها. قد تقول الروبوت: "هذه النقطة تنتمي للخط الأحمر"، بينما هي في الواقع تنتمي للخط الأزرق. كلما زاد عدد الخطوط، زاد احتمال قيام الروبوت بتبديل الإجابات.

ج. "نمط" المسطرة (التنسيقات وعلامات التجزئة)

  • النتيجة: الروبوتات تكره الاختصارات. إذا كتبت "1 مليون" بصيغة "1M" أو "1,000,000"، فإن بعض الروبوتات تضيع. كما أنها تعاني إذا كانت المسطرة تحتوي على علامات قليلة جداً (3 علامات) مقارنة بوجود علامات كثيرة (11 علامة). الأمر يشبه محاولة تخمين درجة الحرارة باستخدام ميزان حرارة مكتوب عليه فقط "حار" و"بارد"، مقابل ميزان يحتوي على كل درجة حرارة مفصلة.

4. الخدعة السحرية: إعطاء الروبوت "ورقة غش"

سأل الباحثون: "ماذا لو أخبرنا الروبوت بما تقوله المسطرة؟"

  • التجربة: قدموا للروبوتات أمراً (Prompt) يسرد صراحةً الأرقام الموجودة على المحور الصادي (مثلاً: "المسطرة تمتد من 0 إلى 100 بخطوات قدرها 10").
  • النتيجة: نجح الأمر كالسحر لبعض الروبوتات. فقد ارتفع أداؤها بشكل كبير. إنه يشبه تسليم الطباخ مسطرة حتى لا يضطر للتخمين. ومع ذلك، لم يساعد هذا كل الروبوتات بالتساوي؛ فبعضها كان جيداً بالفعل، والبعض الآخر ظل يعاني مع تنسيقات معينة مثل الاختصارات.

5. أدوات جديدة للمهمة

ابتكر الباحثون أيضاً طرقاً جديدة لتقييم الروبوتات.

  • التقييم القديم: كان يتحقق فقط مما إذا كان الرقم قريباً.
  • التقييم الجديد (TBE): أدركوا أن الخطأ بمقدار "200 نقطة" يبدو مختلفاً تماماً اعتماداً على المخطط. إذا كان المخطط يتراوح من 0 إلى 1,000، فإن الخطأ بمقدار 200 يعد خطأً جسيماً. أما إذا كان المخطط يتراوح من 0 إلى 1,000,000، فإن الخطأ بمقدار 200 يعد ضئيلاً جداً. يقيس مقياسهم الجديد الأخطاء بناءً على "خطوط الشبكة" (Grid lines) الخاصة بالمخطط، وهي طريقة أكثر عدلاً للحكم على ما إذا كان الروبوت قد "رأى" المخطط فعلياً بشكل صحيح.

الملخص

تخلص الورقة إلى أن النماذج اللغوية متعددة الوسائط ليست مثالية بعد في قراءة المخططات لأنها تتأثر بالتحيز لطريقة عرض الأرقام على المحور الرأسي. فهي تعمل بشكل جيد في بعض الأنماث وتفشل في غيرها. ومن خلال إنشاء بيئة اختبار عادلة وإعطاء النماذج القليل من المساعدة (عبر تزويدها بقيم المحور)، يمكننا تحديد مواضع فشلها بدقة ومساعدتها على التحسن.

ملاحظة: لا تدعي الورقة أن هذه الروبوتات تُستخدم حالياً في التشخيص الطبي أو التداول المالي؛ بل تركز حصرياً على الأداء التقني لترجمة صور المخططات إلى جداول بيانات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →