ViTaB-A: Evaluating Multimodal Large Language Models on Visual Table Attribution
تقدم هذه الورقة ViTaB-A، وهو إطار تقييم يوضح أنه على الرغم من قدرة النماذج اللغوية الكبيرة متعددة الوسائط على الإجابة عن أسئلة تتعلق بالبيانات المهيكلة، إلا أنها تفتقر حالياً إلى الموثوقية لتقديم عزو دقيق ومفصل لإجاباتها عبر تنسيقات مختلفة، مما يحد من موثوقيتها في التطبيقات ذات الأهمية البالغة للشفافية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً ذكياً جداً ومطلعاً، يمكنه النظر إلى جدول بيانات معقد (مثل تقرير مالي لشركة أو سجل طبي) والإجابة على أسئلتك حوله.
أنت تسأل: "هل ارتفعت إيرادات الشركة في عام 2023؟"
يقول المساعد: "نعم، لقد ارتفعت!"
يبدو هذا رائعاً، أليس كذلك؟ ولكن هناك خدعة: من أين حصلوا على هذه الإجابة؟
في العالم الحقيقي، وخاصة في مجالات مثل القانون أو الطب أو التمويل، لا يمكنك الاكتفاء بأخذ الإجابة على سبيل الإيمان فحسب. أنت بحاجة لرؤية الدليل. أنت بحاجة للإشارة إلى الصف والعمود بدقة في جدول البيانات الذي يثبت أن الإيرادات قد ارتفعت.
هذه الورقة البحثية، التي تحمل عنوان ViTaB-A، هي بمثابة "شهادة تقييم" لمدى جودة مساعدي الذكاء الاصطناعي اليوم في القيام بهذا الأمر تحديداً: الإشارة إلى الدليل.
الاكتشاف الكبير: المساعد "الذكي ولكن الضائع"
اختبر الباحثون العديد من نماذج الذكاء الاصطناعي رفيعة المستوى (وهي "العقول" التي تقف وراء هؤلاء المساعدين) باستخدام ثلاث طرق مختلفة لعرض البيانات عليهم:
- الصور: صورة لجدول.
- لغة ماركداون (Markdown): ملف نصي يبدو كأنه جدول.
- لغة جيسون (JSON): تنسيق برمجي خام تحبه الحواسيب لكنه صعب القراءة على البشر.
إليك ما وجدوه، باستخدام تشبيه بسيط:
تشبيه "الطاهي"
تخيل أنك تسأل طاهياً: "هل الحساء مالح؟"
- الإجابة: يتذوق الطاهي الحساء ويقول: "نعم، إنه مالح". (هذا هو الإجابة على الأسئلة).
- الدليل: تسأله: "أرني وعاء الملح الذي استخدمته". فيشير الطاهي إلى وعاء فلفل، أو ملعقة عشوائية، أو يكتفي بهز كتفيه. (هذا هو الإسناد/الاستناد إلى المصدر).
وجدت الدراسة أنه بينما ينجح الطهاة (نماذج الذكاء الاصطناعي) في تقديم إجابات "نعم/لا" بشكل صحيح غالباً (بنسبة دقة تتراوح بين 50-60%)، إلا أنهم سيئون جداً في الإشارة إلى المكون المحدد (الخلية في الجدول) الذي أدى إلى تلك الإجابة.
- بالنسبة للصور: الطهاة جيدون في الإشارة إلى الدليل (بنسبة دقة حوالي 33%).
- بالنسبة للنصوص (Markdown): يصبحون أسوأ.
- بالنسبة للأكواد (JSON): إنهم يخمنون تقريباً. تنخفض دقة نماذجهم إلى ما يقرب من 0%. الأمر يشبه أن تطلب من إنسان أن يجد كلمة محددة في كتاب حيث كُتبت كل صفحاته بالحبر السري.
لغز "الصف مقابل العمود"
لاحظ الباحثون أيضاً نمطاً غريباً. نماذج الذكاء الاصطناي هي أفضل بكثير في العثية على الصف (الخط الأفقي، مثل سجل شخص معين) مقارنة بـ العمود (الفئة الرأسية، مثل "الراتب" أو "التاريخ").
فكر في الأمر كفصل دراسي:
- الصفوف هي الطلاب. "ابحث عن جون". (سهل! يستطيع الذكاء الاصطناعي رؤية الاسم).
- الأعمدة هي المواد الدراسية. "ابحث عن درجة الرياضيات". (صعب! غالباً ما يرتبك الذكاء الاصطناعي بشأن أي خط رأسي يمثل الرياضيات).
الذكاء الاصطناعي بارع في قول: "هذا هو سجل جون"، لكنه غالباً ما يفشل في قول: "وهنا المربع المحدد الذي يوجد فيه درجات الرياضيات الخاصة به".
"فخ الثقة"
هذا هو الجزء الأكثر رعباً. سأل الباحثون الذكاء الاصطناعي: "ما مدى تأكدك من أنك وجدت الدليل الصحيح؟"
سيقول الذكاء الاصطناعي: "أنا متأكد بنسبة 90%!"
لكن عندما تحقق الباحثون، وجدوا أن الذكاء الاصطناعي كان مخطئاً في الواقع.
الأمر يشبه طالباً يؤدي اختباراً وهو واثق جداً من نفسه، رغم أنه اختار الإجابة الخاطئة. وجدت الدراسة أن "مقياس الثقة" لدى الذكاء الاصطناعي معطل عندما يتعلق الأمر بإثبات عمله. لا يمكنك الوثوق في تقييم الذكاء الاصطناعي لذاته لتعرف ما إذا كان يقول الحقيقة فعلاً حول مكان العثور على البيانات.
لماذا يهم هذا؟
إذا كنت تسأل روبوت دردشة لتلخيص حبكة فيلم، فلا بأس إذا أخطأ في بعض التفاصيل. ولكن إذا كنت طبيباً تسأل الذكاء الاصطناعي للتحقق من جرعة دواء لمريض، أو قاضياً يطلب منه مراجعة عقد قانوني، فأنت بحاجة لمعرفة بالضبط من أين حصل الذكاء الاصطناعي على معلوماته.
إذا قال الذكاء الاصطناعي: "المريض يعاني من حساسية تجاه البنسلين"، لكنه لا يستطيع الإشارة إلى السطر المحدد في السجل الطبي الذي يذكر ذلك، فلن تتمكن من الوثوق بتلك الإجابة.
الخلاصة
تخلص الورقة البحثية إلى أن نماذج الذكاء الاصطناعي الحالية تشبه السحرة الذين يمكنهم إخراج أرنب من القبعة (تقديم الإجابة الصحيحة) ولكن ليس لديهم أدنى فكرة عن كيفية القيام بذلك (لا يمكنهم شرح الخدعة).
إنهم يتحسنون في تخمين الإجابة الصحيحة، لكنهم لا يزالون سيئين جداً في عرض خطوات عملهم. وحتى يتم إصلاح هذا، علينا أن نكون حذرين للغاية عند استخدام هذه الأدوات في القرارات المهمة في العالم الحقيقي حيث يكون "عرض طريقة العمل" بنفس أهمية الحصول على الإجابة الصحيحة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.