BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
يقدم "بينش-بيند" (BeyondBench) إطار تقييم مقاوم للتلوث يستخدم التوليد الخوارزمي للمشكلات أثناء التشغيل لتقييم قدرات الاستنتاج الحقيقية لـ 101 نموذج لغوي عبر 44 مهمة، مما يكشف عن فجوات كبيرة في حل المشكلات المعقدة والدور الحاسم لاستخدام الأدوات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول اختبار مدى براعة طالب في الرياضيات. تعطي له ورقة عمل تحتوي على 100 مسألة. إذا كان الطالب قد رأى هذه المسائل المئة تحديداً من قبل في كتابه المدرسي، فقد يقوم بمجرد حفظ الإجابات ليحصل على 100%. لكن هذا لا يعني أنه بارع حقاً في الرياضيات؛ بل يعني فقط أن لديه ذاكرة قوية.
هذا هو بالضبط ما يحدث مع الذكاء الاصطناعي اليوم. إن "الكتب المدرسية" (البيانات المتاحة على الإنترنت المستخدمة لتدريب الذكاء الاصطناعي) ضخمة جداً لدرجة أن نماذج الذكاء الاصطناعي من المحتمل أنها حفظت الإجابات للاختبارات القياسية التي نستخدمها لتقييمها. إنها لا "تفكر"؛ بل هي مجرد "تسترجع" ما حفظته.
BEYONDBENCH هي طريقة جديدة لاختبار الذكاء الاصطناعي تعالج هذه المشكلة. إليك كيف تعمل، مشروحة ببساطة:
1. المكتبة اللانهائية (لا مزيد من الحفظ)
تخيل مكتبة حيث تُكتب الكتب بواسطة آلة سحرية. في كل مرة تطلب فيها اختباراً، تقوم الآلة بإنشاء كتاب جديد تماماً لم يوجد من قبل ولن يوجد مرة أخرى أبداً.
- الطريقة القديمة: كنا نستخدم اختبارات ثابتة (مثل قائمة محددة من مسائل الرياضيات). الأمر يشبه إعطاء نفس الاختبار لكل الطلاب؛ فإذا تسرب الاختبار، سيغش الجميع.
- طريقة BEYONDBENCH: تقوم بإنشاء المسائل فورياً. عدد المسائل الممكنة أكبر من عدد حبات الرمل على الأرض (أكثر من احتمالاً). من المستحيل إحصائياً أن يكون الذكاء الاصطناعي قد حفظ المسألة المحددة التي قدمتها له للتو. هذا يجبر الذكاء الاصطناعي على حل اللغز فعلياً، وليس مجرد استرجاع الإجابة.
2. مستويات الصعوبة الثلاثة (تشبيه ألعاب الفيديو)
تنظم الورقة البحثية هذه المسائل إلى ثلاثة "مستويات"، مثل لعبة الفيديو:
- المستوى السهل (المرحلة التعليمية): الحساب الأساسي والعد. هل يمكن للذكاء الاصطناعي جمع الأرقام أو إيجاد الرقم الأكبر في قائمة؟
- المستوى المتوسط (مواجهة الزعيم): الأنماط والمتتاليات. هل يمكن للذكاء الاصطناعي اكتشاف الرقم التالي في نمط معقد (مثل متتالية فيبوناتشي) أو حل لغز في نظرية الأعداد؟
- المستوى الصعب (الدهليز النهائي): هذه هي مسائل "NP-complete". فكر في هذه المسائل كأكثر الألغاز تعقيداً في الكون، مثل السودوكو، أو برج هانوي (تحريك الأقراص بين الأوتاد)، أو تلوين المخططات (تلوين خريطة بحيث لا تملك الدول المتجاورة نفس اللون). تتطلب هذه المسائل تخطيطاً منطقياً عميقاً وخطوة بخطوة.
3. "آلة الحقيقة" (لا مجال للتخمين)
في العديد من اختبارات الذكاء الاصطناعي، يتعين على الكمبيوتر التخمين عما إذا كانت إجابة الذكاء الاصطناعي صحيحة أم لا. أحياناً يعطي الذكاء الاصطناعي إجابة غريبة قد تكون صحيحة، فيصاب الكمبيوتر بالارتباك.
يستخدم BEYONDBENCH "آلة حقيقة" (حلول رياضية). قبل أن يرى الذكاء الاصطناعي المسألة حتى، يقوم الكمبيوتر بحساب الإجابة الصحيحة بالضبط.
- إذا كانت هناك إجابة واحدة صحيحة فقط، يتحقق الكمبيوتر منها.
- إذا كانت هناك إجابات متعددة صحيحة (كما في بعض الألغاز)، يقوم الكمبيوتر بسرد كل تلك الإجابات.
- إذا أجاب الذكاء الاصطناعي بشكل صحيح، يحصل على الدرجة. وإذا أخطأ، يحصل على صفر. لا يوجد تخمين، ولا غموض.
4. النتائج: وهم "التفكير"
اختبر الباحثون 101 نموذجاً مختلفاً من نماذج الذكاء الاصطناعي، من النماذج الصغيرة إلى الحواسيب الفائقة الضخمة. وهذا ما وجدوه:
- نماذج "التفكير" تفرط في التفكير: صُممت بعض نماذج الذكاء الاصطري الجديدة لـ "تفكر" لفترة أطول قبل الإجابة (مثل أخذ نفس عميق). وجدت الورقة البحثية أنه بالنسبة لهذه الألغاز المعقدة، غالباً ما يؤدي التفكير لفترة أطول إلى جعل أدائهم أسوأ. فهم يبدأون في حل اللغز بشكل صحيح، ثم يرتبكون في المنتصف، ثم يحاولون "إصلاح" خطئهم، مما يجعل الأمر أسوأ. الأمر يشبه طالباً يعرف الخطوة الأولى من مسألة رياضية، لكنه يبدأ في التشكيك في نفسه ثم يكتب إجابة خاطئة تماماً.
- مستخدمو "الأدوات" هم الفائزون: أفضل المؤدين لم يكونوا أولئك الذين يحاولون القيام بكل شيء في عقولهم، بل كانوا أولئك الذين عرفوا متى يستخدمون الآلة الحاسبة أو كتابة الكود البرمجي.
- تشبيه: تخيل إنساناً يحاول حل لغز سودوكو. إذا حاول القيام بذلك بالكامل في ذهنه، فقد يفشل. ولكن إذا سُمح له باستخدام قلم وورقة (أداة)، فيمكنه حلها بسهولة. أفضل نماذج الذكاء الاصطناعي أدركت: "لا يمكنني الاحتفاظ بكل هذه الأرقام في ذاكرتي؛ أحتاج إلى تدوينها".
- السقف: حتى أكثر نماذج الذكاء الاصطناعي ذكاءً تصطدم بـ "سقف" في المسائل الأكثر صعوبة. تمكنوا من حل حوالي 50-60% من أصعب المسائل، لكنهم لم يستطيعوا الوصول إلى 100%. هذا يشير إلى أن الذكاء الاصطناعي الحالي لا يزال يفتقر إلى قطعة أساسية من "الاستنتاج المنطقي" التي يمتلكها البشر.
5. لماذا هذا مهم؟
يثبت BEYONDBENCH أن العديد من نماذج الذكاء الاصطناعي هي أوهام من الذكاء. فهي تبدو ذكية لأنها حفظت بيانات التدريب، ولكن عندما تعطيها لغزاً جديداً تماماً لم يسبق رؤيته، فإنها تعاني.
تخلص الورقة البحثية إلى أنه لبناء ذكاء اصطناعي عام حقيقي (AGI)، لا ينبغي لنا فقط جعل النماذج أكبر حجماً. بدلاً من ذلك، نحتاج إلى بناء أنظمة هجينة: أنظمة ذكاء اصطناعي يمكنها التحدث وفهم اللغة، ولكنها تعرف أيضاً متى تتوقف وتستخدم آلة حاسبة، أو مفسر كود، أو محرك بحث لإنجاز المهمة.
باختصار: BEYONDBENCH هو أول اختبار يكشفحيل غش نماذج الذكاء الاصطناعي عبر حفظ الإجابات. إنه يوضح لنا أنه بينما يتحسن الذكاء الاصطناعي في التحدث، فإنه لا يزال يعاني في "التفكير" حقاً عبر المسائل المعقدة والجديدة دون مساعدة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.