Diagnosing CFG Interpretation in LLMs
تقدم هذه الورقة إطار عمل "RoboGrid" لتقييم النماذج اللغوية الكبيرة كمفسرات في سياق القواعد النحوية الجديدة الخالية من السياق، مما يكشف عن أن هذه النماذج غالباً ما تحافظ على البنية السطحية، لكنها تعاني من تدهور هرمي وفشل دلالي تحت التعقيد البنيوي بسبب اعتمادها على التمهيد الدلالي القائم على الكلمات المفتاحية بدلاً من الاستقراء الرمزي الصرف.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك استأجرت طباخاً بارعاً ومثقفاً (النموذج اللغوي الكبير أو LLM) ليطهو لك وجبة. عادةً ما يكون هذا الطباخ مذهلاً لأنه قد طهى ملايين الوجبات من قبل؛ فهو يعرف تماماً كيف يصنع "سباغيتي كاربونارا" أو "يخنة اللحم" بمجرد سماع الاسم.
لكن اليوم، أنت لا تعطيه وصفة مألوفة، بل تسلمه كتاب طهي جديداً وغريباً مكتوباً بلغة لم يرها من قبل، بكلمات مخترعة وقواعد غريبة. وتطلب منه طهي طبق بناءً على هذه التعليمات الجديدة فقط.
هذه الورقة البحثية، بعنوان "تشخيص تفسير قواعد اللغة الخالية من السياق (CFG) في النماذج اللغوية الكبيرة"، هي بمثابة اختبار جهد لهذا الطباخ. أراد الباحثون معرفة: هل يمكن لهذا الذكاء الاصطناعي أن يتعلم ويتبع مجموعة جديدة من القواعد فعلياً أثناء العمل، أم أنه يكتفي بالتخمين بناءً على ما يتذكره من الماضي؟
إليك تفصيل تجربتهم ونتائجهم، باستخدام تشبيهات بسيطة.
1. المطبخ التجريبي: ROBOGRID
بنى الباحثون عالماً افتراضياً يسمى ROBOGRID. فكر فيه كإنسان آلي (روبوت) يتنقل في شبكة، يلتقط الصناديق، ويتحرك في الأرجاء.
- القواعد: أعطوا الذكاء الاصطناعي "قواعد لغوية" (مجموعة من القواعد) لكيفية كتابة التعليمات للروبوت.
- الخدعة: صنعوا نسختين من كتاب القواعد:
- النسخة "الطبيعية": تستخدم كلمات مثل
loop(حلقة تكرارية)، وif(إذا)، وmove(تحرك). لقد رأى الذكاء الاصطناعي هذه الكلمات مليارات المرات في بيانات تدريبه. - النسخة "الفضائية":ية: استبدلت كل تلك الكلمات بكلمات غير مفهومة مثل
v_xkqmوv_gsqe. لا يمكن للذكاء الاصطناعي الاعتماد على الذاكرة هنا؛ بل يجب عليه اتباع القواعد الجديدة المقدمة في النص بدقة.
- النسخة "الطبيعية": تستخدم كلمات مثل
2. مستويات الفشل الثلاثة
لم يكتفِ الباحثون بالتحقق مما إذا كان الروبوت قد تحرك فحسب، بل تحققوا من أداء الذكاء الاصطناعي على ثلاثة مستويات مختلفة، مثل لعبة فيديو تزداد صعوبة:
- المستوى 1: النحو (شرطة القواعد)
- السؤال: هل كتب الذكاء الاصطناعي الجملة بشكل صحيح وفقاً للقواعد الجديدة؟ (مثلاً: هل وضع الأقواس في مكانها الصحيح؟)
- النتيجة: كان الذكاء الاصطناعي جيداً في هذا عادةً. استطاع محاكاة شكل الجملة.
- المستوى 2: السلوك (الفعل)
- السؤال: هل قام الروبوت بالفعل بما طُلب منه؟ (مثلاً: هل التقط الصندوق؟)
- النتيجة: في بعض الأحيان، كان الذكاء الاصطناعي يكتب جملة تبدو مثالية، لكن الروبوت يفعل الشيء الخطأ. "المنطق" كان معطلاً حتى لو كان "النحو" صحيحاً.
- المستوى 3: الدلالة (المعنى العميق)
- السؤال: هل فهم الذكاء الاصطناعي الهيكل الدقيق والهدف من التعليمات المعقدة المتداخلة؟
- النتيجة: هنا انهار الذكاء الاصطناعي تماماً. عندما أصبحت التعليمات عميقة ومعقدة (مثل "حلقة داخل حلقة داخل حلقة")، فقد الذكاء الاصطناعي القدرة على المتابعة.
3. الاكتشاف الكبير: جدار "التكرار العميق"
أهم نتيجة تتعلق بـ التعقيد.
- العمق الضحل: إذا كانت التعليمات بسيطة (مثل "تحرك للأمام، ثم توقف")، كان أداء الذكاء الاصطنيلاً جيداً.
- العمق الكبير: بمجرد أن تتطلب التعليمات تداخلاً عميقاً (مثل "كرر هذا الإجراء 10 مرات، وداخل ذلك، افعل هذا الشيء الآخر 5 مرات...")، انهار أداء الذكاء الاصطناعي.
التشبيه: تخيل محاولة تذكر رقم هاتف.
- إذا كان مكوناً من 3 أرقام، يمكنك حفظه في رأسك بسهولة.
- إذا كان 10 أرقام، قد تحفظه.
- أما إذا كان 20 رقماً بنماط معقدة، فقد ينسى عقلك (أو "نافذة السياق" لدى الذكاء الاصطناعي) البداية بحلول الوقت الذي تصل فيه إلى النهاية. يتوقف الذكاء الاصطناعي عن تتبع "حالة" البرنامج.
4. مشكلة "الغش"
وجد الباحثون أنه عندما استخدموا الكلمات "الطبيعية" (مثل loop)، كان أداء الذكاء الاصطناعي أفضل بكثير.
- ماذا يعني هذا: لم يكن الذكاء الاصطناعي يتعلم القواعد الجديدة فعلياً. بل كان يغش. لقد تعرّف على كلمة "loop" وظن: "أوه، أنا أعرف ماذا تفعل حلقة التكرار من بيانات تدريبي!" لقد استخدم معرفته القديمة لتخمين الإجابة.
- اختبار "الكلمات الفضائية": عندما استخدموا الكلمات غير المفهومة، لم يستطع الذكاء الاصطناعي الغش. كان عليه أن يقوم بعملية الحساب المنطقي فعلياً. وبدون الكلمات المألوفة، عانى الذكاء الاصطناعي بشكل كبير، مما يثبت أنه يعتمد بشدة على الاستناد الدلالي (استخدام المفاهيم المألوفة كعكاز) بدلاً من المنطق الصرف.
5. سلسلة الأفكوت (CoT): عكاز "التفكير بصوت عالٍ"
حاول الباحثون طلب "التفكير خطوة بخطوة" (سلسلة الأفكوت) من الذكاء الاصطناعي.
- الأخبار الجيدة: ساعد ذلك كثيراً! فقد أجبر الذكاء الاصطناعي على التمهل وتتبع القواعد بشكل أفضل.
- الأخبار السيئة: حتى مع "التفكير بصوت عالٍ"، ظل الذكاء الاصطناعي يفشل عندما تصبح التعليمات عميقة جداً. الأمر يشبه طالباً يعرف كيف يوضح خطوات الحل، لكنه لا يزال ينفد منه الورق عندما تصبح المسألة طويلة جداً.
الخلاصة
تخبرنا هذه الورقة البحثية أنه بينما يتميز نماذج الذكاء الاصطناعي بالقدرة على الظهور بمظهر فصيح واتباع قواعد بسيطة، إلا أنها ليست بعد "محركات منطقية" موثوقة للأنظمة الجديدة والمعقدة.
- هم محاكون، وليسوا مدركين.
- يمكنهم اتباع شكل القاعدة، لكنهم غالباً ما يفقدون المعنى عندما تتعقد الأمور.
- يعتمدون كثيراً على الكلمات المألوفة لتخمين ما يجب فعله.
لماذا يهم هذا؟
بينما بدأنا في استخدام الذكاء الاصطناعي للتحكم في أشياء في العالم الحقيقي (مثل السيارات ذاتية القيادة، أو الروبوتات الطبية، أو الأنظمة المالية)، لا يمكننا مجرد الأمل في أن "يفهم الجو العام". إذا أخطأ الذكاء الاصطناعي في تفسير تعليمات معقدة وجديدة بسبب فقدانه تتبع التداخل، فقد تكون النتائج كارثية. نحن بحاجة إلى ذكاء اصطناعي يمكنه حقاً استيعاب القواعد الجديدة، وليس مجرد التخمين بناءً على العادات القديمة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.