FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks
تقدم هذه الورقة FormInv، وهو بروتوكول قياس يكشف كيف تؤدي عيوب الثبات الدلالي في معايير قياس الاستدلال الرياضي إلى تشويه تصنيفات النماذج، ويكشف عن فجوة حرجة بين الدقة الإجمالية والاتساق الدلالي، مما يثبت أن خيارات تصميم المعايير تحدد ضمنياً أي النماذج تبدو متفوقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحث "FormInv" باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.
الفكرة الكبرى: اختبار "تغيير الشكل"
تخيل أن لديك طالباً يؤدي اختباراً في الرياضيات. تسأله: "هل الجذر التربيعي لـ 4 أكبر من أو يساوي 0؟" فيجيب: "نعم". ثم تسأله السؤال نفسه تماماً ولكن بتغيير الصياغة قليلاً: "هل 0 أقل من أو يساوي الجذر التربيعي لـ 4؟".
إذا كان الطالب ذكياً حقاً، فيجب أن يجيب بـ "نعم" على كليهما. ولكن ماذا لو أجاب على الأول بشكل صحيح والثاني بشكل خاطئ؟
هذا هو بالضبط ما اكتشفته هذه الورقة البحثية حول أكثر نماذج الذكاء الاصطيفتطورة (مثل GPT-4o وClaude وDeepSeek). فعلى الرغم من أنها بارعة للغاية في الرياضيات، إلا أنها هشة بشكل مفاجئ. إذا غيرت "شكل" السؤال دون تغيير "معناه"، فإن الذكاء الاصطناعي غالباً ما يرتبك ويعطي إجابة مختلفة.
يطلق المؤلفون على هذا النقص في الاستقرار اسم "فجوة الثبات الدلالي" (Semantic Invariance Gap). وباللغة البسيطة: الذكاء الاصطناعي لا يفهم الرياضيات؛ بل يتعرف فقط على نمط الجملة.
المشكلة: فخ "السؤال الخادع"
تجادل الورقة بأن المعايسات الحالية (الاختبارات القياسية للذكاء الاصطناعي) معيبة لأنها تطرح الأسئلة بطريقة واحدة محددة فقط. الأمر يشبه اختبار سائق على طريق سريع مستقيم فقط؛ قد يقود ببراعة هناك، ولكن إذا طلبت منه سلوك نفس الطريق ولكن مع تبديل المسارات، فقد يصطدم.
وجد الباحثون أن:
- الدرجات العالية مضللة: قد يحصل نموذج الذكاء الاصطناعي على 96% من الإجابات الصحيحة في اختبار قياسي. ولكن عندما تطرح نفس الأسئلة بطرق مختلفة، تنخفض نسبة الـ "96%" بشكل كبير لأن الذكاء الاصطناعي يفشل في إدراك أن الأسئلة هي نفسها.
- "انعكاس التصنيف": هذا هو الجزء الأكثر صدمة. اعتماداً على "كيفية" طرح الأسئلة، يتغير الفائز.
- إذا طرحت الأسئلة بـ "الترتيب أ"، يفوز النموذج (X).
- إذا طرحت نفس الأسئلة بـ "الترتيب ب"، يفوز النموذج (Y).
- الأمر يشبه دوري رياضي يتغير فيه الفريق الفائز بالبطولة في كل مرة تغير فيها قواعد اللعبة، رغم أن اللاعبين هم أنفسهم.
الحل: "تدقيق الإجماع"
كيف تمسك بهذه الأسئلة السيئة؟ ابتكر المؤلفون بروتوكولاً يسمى FormInv.
فكر في الأمر كأنه لجنة من الحكام في برنامج مواهب. إذا كان لديك 9 حكام مختلفين (نماذج ذكاء اصطناعي) وجميعهم يتفقون على أن سؤالاً معيناً مربك أو معيب، فمن المرجح أن السؤال هو المعيب وليس الحكام.
- البروتوكول: يأخذون سؤالاً ويطلبون من 9 نماذج ذكاء اصطناعي مختلفة الإجابة عليه.
- الاكتشاف: إذا أخطأت 6 من أصل 9 نماذج في نسخة "مُعاد صياغتها" (مُعاد كتابتها) من السؤال، بينما أجابوا جميعاً بشكل صحيح على النسخة الأصلية، فإن النظام يصنف السؤال المُعاد صياغته على أنه "معيب".
- النتيجة: وجدوا أن حوالي 3% إلى 47% من الأسئلة "المُعاد صياغتها" في الاختبارات الموجودة كانت في الواقع غير صحيحة رياضياً أو مربكة. الذكاء الاصطناعي لم يكن يفشل في الرياضيات؛ بل كان الاختبار هو الذي يفشل في تقييم الذكاء الاصطناعي.
قاعدة "لا يوجد معيار مثالي"
تقدم الورقة ادعاءً جريئاً: لا يوجد اختبار مثالي.
تخيل أنك تحاول تصنيف 9 سيارات مختلفة.
- إذا اختبرتها على السرعة، تفوز السيارة (أ).
- إذا اختبرتها على كفاءة الوقود، تفوز السيارة (ب).
- إذا اختبرتها على التحكم، تفوز السيارة (ج).
يقول المؤلفون إن الشيء نفسه يحدث مع اختبارات الرياضيات للذكاء الاصطناعي. ولأن لا يوجد ذكاء اصطناعي واحد مثالي في كل نوع من أنواع إعادة الصياغة، فإن الشخص الذي يصمم الاختبار هو من يملك حق اختيار "نوع" الأسئلة. ومن خلال اختيار الأسئلة، هم يقررون سراً من سيفوز في السباق. توفر الورقة أداة لجعل هذا الاختيار شفافاً حتى نعرف لماذا فاز نموذج معين.
النقاط الرئيسية المستخلصة
- الدقة ليست كل شيء: يمكن للنموذج أن يكون دقيقاً بنسبة 96% ولكنه لا يزال يفشل في نصف الوقت عند إعادة صياغة السؤال. هذا يعني أنه لا "يفهم" الرياضيات حقاً؛ بل يخمن بناءً على الأنماط.
- "فجوة الثبات": هذا مقياس جديد يقيس مدى اتساق الذكاء الاصطناعي. إذا حصل الذكاء الاصطناعي على نفس الإجابة لنفس السؤال بغض النظر عن كيفية طرحه، فلديه درجة "ثبات" عالية. أفضل النماذج في الدراسة حققت حوالي 82% فقط من الاتساق، مما يعني أنها كانت غير متسقة في نحو سؤال من كل 5 أسئلة.
- إصلاح الاختبارات: قام المؤلفون ببناء أداة (FormInv) تتحقق تلقائياً مما إذا كان سؤال الاختبار "معيباً" من خلال معرفة ما إذا كانت عدة نماذج ذكاء اصطناعي ترتبك أم لا. وقد استخدموا ذلك لإصلاح الاختبارات الموجودة، مما غير ترتيب أفضل نماذج الذكاء الاصطناي في القمة.
تشبيه ملخص
تخيل أنك تختبر مترجماً.
- الطريقة القديمة: تسأل المترجم أن يترجم "القطة على الحصيرة" إلى الفرنسية. يقوم بذلك ببراعة، فتعطيه درجة (أ).
- الطريقة الجديدة (FormInv): تطلب منه ترجمة "الحصيرة عليها قطة"، و"هل القطة على الحصيرة؟"، و"على الحصيرة تجلس القطة".
- النتيجة: ينجح في الجملة الأولى ولكنه يفشل في البقية. تدرك حينها أنه لا يفهم الفرنسية حقاً؛ بل حفظ الجملة الأولى فحسب.
FormInv هي الأداة التي تجبرنا على طرح المجموعة الثانية من الأسئلة حتى نتمكن من معرفة من يفهم اللغة حقاً ومن يقوم فقط بحفظ الأنماط.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.