← أحدث الأبحاث
💬 NLP

The Mighty ToRR: A Benchmark for Table Reasoning and Robustness

تقدم هذه الورقة ToRR، وهو معيار شامل مصمم لتقي‌م قدرات الاستنتاج والمتانة لنماذج الذكاء الاصطناعي عبر تنسيقات ونطاقات جداول متنوعة، كاشفةً أن حتى النماذج القوية تظهر سلوكاً هشاً، ومسلطةً الضوء على الأهمية البالغة لاختبار تنسيقات ومطالبات متعددة لتقدير الأداء بشكل موثوق.

المؤلفون الأصليون: Shir Ashury-Tahan, Yifan Mai, Rajmohan C, Ariel Gera, Yotam Perlitz, Asaf Yehudai, Elron Bandel, Leshem Choshen, Eyal Shnarch, Percy Liang, Michal Shmueli-Scheuer

نُشر 2026-02-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shir Ashury-Tahan, Yifan Mai, Rajmohan C, Ariel Gera, Yotam Perlitz, Asaf Yehudai, Elron Bandel, Leshem Choshen, Eyal Shnarch, Percy Liang, Michal Shmueli-Scheuer

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف مساعداً جديداً لإدارة جداول البيانات الخاصة بشركتك. لديك كومة من السير الذاتية (النماذج الذكية)، وتريد أن تعرف من هو الأفضل في قراءة الجداول، والقيام بالعمليات الحسابية، وإيجاد الحقائق.

هذه الورقة البحثية، بعنوان "The Mighty ToRR"، تشبه مقابلة عمل ضخمة وصارمة مصممة لاختبار هؤلاء المساعدين الذكيين. أدرك الباحثون من IBM وستانفورد وMIT أنه بينما نعلم أن الذكاء الاصطناعي بارع في كتابة القصائد أو الدردشة، إلا أننا لا نعرف حقاً ما إذا كان بإمكانه التعامل مع البيانات المملة والفوضوية التي نستخدمها يومياً في الواقع.

إليك تفصيل لنتائجهم، باستخدام تشبيهات من الحياة اليومية:

1. المشكلة: فخ "المقاس الواحد الذي يناسب الجميع"

تخيل أنك تسأل مساعدك: "كم أنفقنا على القهوة الشهر الماضي؟"

  • السيناريو (أ): تعرض عليه ورقة Excel مطبوعة ومنظمة بدقة.
  • السيناريو (ب): تسلمه إيصالاً مجعداً حيث كُتبت الأرقام بترتيب مختلف.
  • السيناريو (ج): تكتب البيانات في صندوق دردشة كقائمة بسيطة.

من المتوقع أن يعطيك المساعد نفس الإجابة في الحالات الثلاث، أليس كذلك؟ تكشف الورقة أن نماذج الذكاء الاصطناعي الحالية هشة بشكل مفاجئ. إنهم يشبهون طالباً حفظ نموذج الإجابة لاختبار معين، لكنه يفشل إذا غيرت نوع الخط أو غيرت ترتيب الأسئلة.

2. الحل: معيار "ToRR"

قام الباحثون ببناء ToRR (التفكير في الجداول والمتانة - Table Reasoning and Robustness). فكر في هذا كأنه "اختبار جهد" (Stress Test) لصالة ألعاب رياضية مخصصة للذكاء الاصطعي.

  • التمرين: أخذوا 10 أنواع مختلفة من مهام الجداول (مثل الحسابات المالية، البيانات العلمية، وحقائق ويكيبيديا).
  • العقبات: لكل سؤال، لم يكتفوا بطرحه مرة واحدة فقط، بل طرحوه بـ 35 طريقة مختلفة.
    • غيروا التنسيق (مثل تحويل جدول إلى ملف CSV، أو كود HTML، أو قائمة Markdown).
    • خلطوا الأوراق (عن طريق تغيير ترتيب الصفوف أو الأعمدة عشوائياً، أو حتى قلب الجدول جانبياً).

إذا كان الذكاء الاصطناعي ذكياً حقاً، فيجب أن يحصل على الإجابة الصحيحة بغض matter عن كيفية تقديم البيانات. إذا ارتبك لمجرد أن الصفوف تم تغيير ترتيبها، فهو ليس "متيناً".

3. النتائج الصادمة: "عقول هشة"

كانت النتائج بمثابة جرس إنذار لمجتمع الذكاء الاصطناعي:

  • تأثير "الهشاشة": حتى أكثر نماذج الذكاء الاصطناعي تقدماً وتكلفة (مثل GPT-4o أو Claude 3.5) واجهت صعوبات. كانت "هشة"، بمعنى أنها تنكسر بسهولة تحت التغييرات الصغيرة. في لحظة قد يبدو كأنه محاسب عبقري؛ وفي اللحظة التالية، مع تغيير ترتيب الصفوف، يصبح مجرد شخص يخمن.
  • لا يوجد تنسيق سحري: كان الباحثون يأملون في العثور على أن "Markdown" أو "JSON" هو الطريقة المثالية للتحدث مع الذكاء الاصطناعي. لكنهم كانوا مخطئين. لم يكن هناك تنسيق واحد يعمل بشكل أفضل للجميع. أحياناً يفضل النموذج صيغة CSV، وفي أحيان أخرى يفضل HTML. الأمر يشبه محاولة العثور على اللغة المثالية للتحدث مع شخص يغير رأيه كل 5 دقائق.
  • الحجم لا يهم دائماً: النماذج الأكبر (التي تمتلك "قدرة عقلية" أكبر) كانت أفضل بشكل عام، لكن الفجوة بين النماذج "الأذكى" والنماذج "المقبولة" لم تكن كبيرة. جميعها كانت تعاني من نفس الضعف الأساسي: لم تستطع التعامل مع فوضى البيانات الحقيقية باستمرار.

4. الدرس الكبير: لا تثق في اختبار واحد

هذا هو أهم استنتاج لأي شخص يستخدم الذكاء الاصطناعي.

  • كذبة "المحاولة الواحدة": معظم الاختبارات المعيارية تسأل النموذج سؤالاً مرة واحدة وتعلن الفائز. تجادل الورقة بأن هذا يشبه تقييم طباخ من خلال السماح له بطهي طبق واحد فقط. إذا كان لديه يوم سيء أو كانت المكونات مختلفة قليلاً، فستحصل على تقييم خاطئ.
  • حقيقة "المحاولات المتعددة": وجد الباحثون أنك إذا سألت النموذج نفس السؤال بـ طرق متعددة (مطالبات مختلفة، تنسيقات مختلفة)، فستحصل على صورة أكثر موثوقية لذكائه الحقيقي.
  • الخدعة السحرية: اكتشفوا أن سؤال النموذج نفسه بـ 10 طرق مختلفة فعال تماماً مثل اختبار النموذج على 100 سؤال مختلف. إنه "كود غش" للموثوقية: بدلاً من الحاجة إلى مكتبة ضخمة من أسئلة الاختبار، تحتاج فقط إلى طرح نفس الأسئلة بأصوات مختلفة.

الملخص

تخبرنا الورقة أنه بينما يصبح الذكاء الاصطناعي أكثر ذكاءً، فإنه لا يزال غير موثوق عند التعامل مع الجداول. الأمر يشبه طالباً عبقرياً يصاب بالذعر إذا قام المعلم بتغيير نوع الخط في ورقة الامتحان.

ToRR هو أداة جديدة تجبر الذكاء الاصطناعي على إثبات أنه يفهم معنى البيانات، وليس فقط شكل البيانات. ويقترح المؤلفون أنه لكي نثق حقاً في الذكاء الاصطناعي في العالم الحقيقي، يجب أن نتوقف عن اختباره بطلب (Prompt) واحد مثالي، ونبدأ باختباره عبر مجموعة متنوعة وفوضوية من التنسيقات لنرى ما إذا كان بإمكانه حقاً التفكير وسط الضجيج.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →