← أحدث الأبحاث
💬 NLP

When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models

تقدم هذه الورقة معياراً تشخيصياً يوضح أنه بينما تحقق النماذج اللغوية الكبيرة دقة عالية في المهام الإجرائية القصيرة، فإن قدرتها على تنفيذ الخوارزميات الخطوية بأمانة تتدهور بشكل كبير مع زيادة التعقيد، مما يكشف أن الأداء القوي في المعايير المرجعية غالباً ما يحجب نقاط ضعف جوهرية في اتباع التعليمات.

المؤلفون الأصليون: Sailesh Panda, Pritam Kadasi, Abhishek Upperwal, Mayank Singh

نُشر 2026-05-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Sailesh Panda, Pritam Kadasi, Abhishek Upperwal, Mayank Singh

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "عندما تتوقف النماذج اللغوية الكبيرة عن اتباع الخطوات"، باستخدام لغة بسيطة وتشبيهات إبداعية.

الفكرة الكبرى: اختبار "الوصفة"

تخيل أنك أعطيت طباخاً وصفة محددة للغاية لتحضير كعكة خطوة بخطوة. تقول الوصفة: "اخلط الدقيق والسكر. ثم أضف البيض. ثم حرك لمدة 10 ثوانٍ. ثم اخبز".

قد تتوقع من الطباخ أن يتبع كل تعليمات الوصفة بالترتيب. ولكن ماذا لو قام الطباخ، بدلاً من اتباع الخطوات، بتخمين المذاق الذي عادة ما تكون عليه الكعكة وقدم لك النتيجة؟ أو ماذا لو توقف في منتصف الطريق، ونسي آخر ثلاث خطوات، وقال ببساطة: "ها هي الكعكة"؟

هذه الورقة البحثية تشبه مطبخ تجارب ضخماً، حيث أعطى الباحثون 14 نموذجاً مختلفاً من نماذج الذكاء الاصطناعي (النماذج اللغوية الكبيرة) آلاف الوصفات المحددة هذه. كانت الوصفات عبارة عن مسائل رياضية بسيطة، لكن تم تصميمها لتكون طويلة ومعقدة. لم يكن الهدف هو معرفة ما إذا كان بإمكان الذكاء الاصطناعي حل مسائل رياضية صعبة، بل معرفة ما إذا كان بإمكانه اتباع التعليمات بأمانة من البداية إلى النهاية.

الإعداد: "الدرج اللامتناهي"

بنى الباحثون اختباراً خاصاً يحتوي على طريقتين رئيسيتين لجعل المهمة أكثر صعوبة:

  1. طول الدرج: أعطوا الذكاء الاصطناعي وصفات تتراوح ما بين 5 خطوات إلى 95 خطوة. تخيل سلماً (درجاً). السلم المكون من 5 درجات سهل الصعود. أما السلم المكون من 95 درجة فهو مرهق.
  2. قاعدة "النظر للخلف": في بعض الوصفات، لم تكن الخطوة العاشرة تعتمد فقط على نتيجة الخطوة التاسعة، بل قد تقول: "عد واستخدم النتيجة من الخطوة الثالثة". هذا يشبه قولك لمتنزه: "خذ خطوة للأمام، ثم عد إلى الشجرة الثالثة التي مررت بها والتقط حجراً من هناك". هذا يجبر الذكاء الاصطناعي على تذكر أشياء من الماضي البعيد.

ما وجدوه: "فقدان الذاكرة"

كانت النتائج مفاجئة. على الرغم من أن الرياضيات كانت بسيطة (مجرد جمع، طرح، ضرب، أو قسمة)، إلا أن أداء الذكاء الاصطناعي ساء تدريجياً كلما طالت الوصفات.

  • الهبوط: في وصفة قصيرة مكونة من 5 خطوات، أصاب الذكاء الاصطناعي في الإجابة حوالي 61% من المرات. ولكن في وصفة طويلة مكونة من 95 خطوة، انخفض معدل نجاحهم بشكل حاد ليصل إلى 20% فقط.
  • مشكلة "النظر للخلف": عندما كان على الذكاء الاصطناعي تذكر خطوات من الماضي البعيد (مثل الخطوة الثالثة)، انخفض أداؤهم بشكل أكبر. يبدو الأمر كما لو أن الذكاء الاصطناعي ارتبك بشأن مكانه في القصة.

كيف فشلت النماذج: "الطباخون الغشاشون"

لم يكتفِ الباحثون بالنظر إلى الإجابة النهائية فحسب؛ بل راقبوا كيف حاول الذكاء الاصطناعي حل المشكلة. ووجدوا أن النماذج غالباً لم تقم بالعمل الفعلي. بدلاً من ذلك، حاولوا "الغش" أو "اختصار الطرق" بعدة طرق مضحكة:

  1. "الخروج المبكر" (عدم التنفيذ الكامل): كان هذا هو الفشل الأكثر شيوعاً. يبدأ الذكاء الاصطناعي الوصفة، يقوم ببضع خطوات، ثم يشعر بالملل أو الارتباك، فيقفز مباشرة إلى النهاية، متظاهراً بأنه أنهى كل شيء. إنه يشبه طالباً يكتب الجملة الأولى من مقال، ثم يقفز إلى الخاتمة دون كتابة المنتصف.
  2. "الخطوات المهلوسة": في بعض الأحيان، كان الذكاء الاصطناعي يخترع خطوات إضافية لم تكن موجودة في الوصفة على الإطلاق. مثل طباخ يضيف "رشة من غبار وحيد القرن" بينما لم تذكر الوصفة ذلك أبداً.
  3. فخ "التصحيح الذاتي": أحياناً، يخطئ الذكاء الاصطناعي في الإجابة، ويدرك ذلك، ويحاول إصلاحه لاحقاً في النص. ولكن بحلول الوقت الذي يصل فيه للإصلاح، يكون قد أفسد النتيجة النهائية بالفعل.
  4. "مطابق الأنماط": بدلاً من إجراء العمليات الحسابية، بدا أن بعض النماذج تخمن الإجابة بناءً على شكل الأرقام، بدلاً من اتباع الخطوات فعلياً.

الخلاصة الرئيسية

تخلص الورقة البحثية إلى أنه مجرد تقديم الذكاء الاصطناعي لإجابة نهائية "تبدو منطقية"، لا يعني أنه قام بالعمل فعلياً.

فكر في الأمر كطالب يؤدي اختباراً. إذا حصل على الإجابة الصحيحة، قد تظن أنه ذاكر. لكن هذه الورقة تظهر أنه في بعض الأحيان، هم فقط يخمنون أو يتذكرون الإجابة من اختبار سابق، بدلاً من حل المشكلة فعلياً خطوة بخطوة.

باخت-القول: النماذج الحالية للذكاء الاصطناعي بارعة في التحدث بذكاء وإعطاء نتيجة نهائية، لكنها تعاني في العمل كآلة روبوت موثوقة تتبع قائمة طويلة ومملة من التعليمات بدقة. عندما تصبح التعليمات طويلة جداً أو تتطلب تذكر الكثير من الماضي، يميل الذكاء الاصطناعي إلى فقدان التركيز والتوقف عن اتباع القواعد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →