← أحدث الأبحاث
🤖 AI

LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning

يكشف اختبار LinAlg-Bench أن النماذج اللغوية الكبيرة تظهر عتبة سلوكية هيكلية عند أبعاد المصفوفات 4x4، حيث تتحول من أخطاء التنفيذ في المهام الأصغر إلى التخلي الحسابي المنهجي والهلوسة المهيكلة في المهام الأكبر، مما يشير إلى وجود حدود أساسية للذاكرة العاملة بدلاً من كونها فجوة معرفية.

المؤلفون الأصليون: Shradha Agarwal, Deepak Rajbhar, Tariq J

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shradha Agarwal, Deepak Rajbhar, Tariq J

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فريقاً من الروبوتات الذكية والمثقفة جداً. أنت تسألهم لحل مسائل رياضية. بالنسبة للمسائل الصغيرة والبسيطة، هم عباقرة. ولكن عندما تعطيهم مسألة أكبر قليلاً وأكثر تعقيداً، يتوقفون فجأة عن محاولة إجراء الحسابات ويبدأون في اختراع أشياء تبدو وكأنها رياضيات.

هذه الورقة البحثية، LinAlg-Bench، هي بمثابة تحقيق جنائي في سبب وكيفية تعطل هذه الروبوتات (النماذج اللغوية الكبيرة أو LLMs) عند القيام بالجبر الخطي (وهو نوع من الرياضيات يتضمن شبكات من الأرقام تسمى المصفوفات).

إليك تفصيل نتائجهم باستخدام تشبيهات بسيطة:

1. الاختبار: "اختبار جهد" للأدمغة

لم يكتفِ الباحثون بسؤال الروبوتات أسئلة عشوائية في الرياضيات. بل أنشأوا اختباراً محدداً يسمى LinAlg-Bench.

  • الإعداد: أعطوا الروبوتات مسائل تتضمن شبكات من الأرقام (مصفوفات) بثلاثة أحجام: 3x3 (صغير)، 4x4 (متوسط)، و 5x5 (كبير).
  • الخدعة: نوع المسألة الرياضية ظل كما هو تماماً (مثل إيجاد "المحدد" أو "القيم الذاتية"). الشيء الوحيد الذي تغير هو حجم الشبكة.
  • الهدف: إذا فشلت الروبوتات لأنها لا تعرف الرياضيات، فيجب أن تفشل في جميع الأحجام. أما إذا فشلت لأن "دماغها" قد تعب، فيجب أن تفشل فقط في الأحجام الأكبر.

2. الاكتشاف: "منحدر الـ 4x4"

أظهرت النتائج وجود "منحدر" حاد في الأداء.

  • عند 3x3 (صغير): معظم الروبوتات أجابت بشكل صحيح. لقد كانوا يجرون الحسابات بشكل صحيح.
  • عند 4x4 (متوسط): بدأت الروبوتات في التعثر. كانوا لا يزالون يحاولون إجراء الحسابات، لكنهم ارتكبوا أخطاء في الخطوات (مثل نسيان إشارة سالبة أو جمع الأرقام بشكل خاطئ).
  • عند 5x5 (كبير): هنا تغير السلوك تماماً. لم تكتفِ الروبوتات بارتكاب أخطاء حسابية؛ بل استسلمت.

التشبيه: تخيل طالباً يؤدي امتحاناً.

  • في اختبار قصير (3x3)، يحصل على 100%.
  • في اختبار متوسط (4x4)، يحاول بجد لكنه يرتبك ويرتكب أخطاء حسابية.
  • في الاختبار الطويل والصعب (5x5)، بدلاً من محاولة حل المسألة الصعبة، ينظر إلى السؤال، يتنهد، ثم يكتب إجابة تبدو وكأنها تنتمي للاختبار (لها التنسيق الصحيح والأرقام التي تبدو منطقية) لكنها في الواقع مختلقة تماماً.

3. حد "الذاكرة العاملة"

تجادل الورقة بأن الروبوتات لا تفشل بسبب نقص المعرفة (فهي تعرف القواعد). إنها تفشل بسبب حد الذاكرة العاملة.

  • التشبيه: فكر في دماغك مثل المكتب.
    • بالنسبة لمسألة 3x3، يمكنك وضع كل أوراق العمل على المكتب وحلها.
    • بالنسبة لمسألة 5x5، الأوراق كثيرة جداً على المكتب. سيتعين عليك الإمساك ببعض الأوراق في يدك أثناء كتابة أوراق أخرى.
    • "مكاتب" الروبوتات صغيرة جداً. عندما تصبح المسألة كبيرة جداً، لا يمكنهم الاحتفاظ بكل الخطوات الوسيطة في "أيديهم" في نفس الوقت. وبدلاً من الاعتراف بأنهم مثقلون، يبدأون في الهلوسة.

4. هلوسة "تقمص دور الأداة"

أحد أكثر الاكتشافات إثارة للاهتمام هو كيفية استسلام الروبوتات.

  • عندما تصبح الرياضيات صعبة جداً (عند 5x5)، غالباً ما تتظاهر الروبوتات باستخدام آلة حاسبة أو برنامج كمبيوتر لا تملكه في الواقع.
  • التشبيه: الأمر يشبه طالباً لا يعرف الإجابة على سؤال صعب، فيقول: "حسناً، لو كان لدي حاسوب خارق، فسيخبرني أن الإجابة هي 42"، ثم يكتب ببساطة "42".
  • تطلق الورقة على هذا اسم "التلفيق الواعي بالقيود" (Constraint-Aware Confabulation). الروبوتات ذكية بما يكفي لتعرف أن الإجابة يجب أن تتبع قواعد معينة (مثل أن مجموع الأرقام يجب أن يطابق قيمة محددة)، لذا فهي تخترع إجابة تتوافق مع تلك القواعد، رغم أنها لم تقم بالعمل الفعلي.

5. فخ "الاستراتيجية"

حاول الباحثون مساعدة الروبوتات عبر إجبارها على استخدام طريقة رياضية أكثر كفاءة (مثل قولهم لها: "لا تستخدمي الطريقة الطويلة، استخدمي الطريقة القصيرة!").

  • النتيجة: لم يساعد ذلك. حتى عند إجبارهم على استخدام الطريقة "السهلة"، ظلوا يفشلون.
  • لماذا؟ لم تكن المشكلة في أي طريقة استخدموها؛ بل كانت في عدم قدرتهم على الحفاظ على ترتيب الخطوات دون فقدان التركيز. إنه مثل إخبار عداء متعب بأن يأخذ خطوات أقصر؛ إذا كان منهكاً بالفعل، فلن تساعده الخطوات القصيرة على إنهاء السباق.

6. مستويات الروبوتات الثلاثة

صنفت الورقة 10 نماذج ذكاء اصطناعي مختلفة إلى ثلاث مجموعات بناءً على وقت انهيارها:

  • المستوى الأول (الأقوى): استطاعوا التعامل مع مسائل 5x5 بشكل صحيح في الغالب، لكن حتى هم بدأوا في "الاستسلام" واختلاق الإجابات عندما طُلب منهم النوع الأكثر تعقيداً من الإجابات (القيم الذاتية).
  • المستوى الثاني (المتوسط): تعاملوا مع المسائل المتوسطة بشكل جيد لكنهم انهاروا تماماً أمام المسائل الأصعب.
  • المستوى الثالث (الأضعف): بدأوا في الفشل مبكراً واستسلموا بسرعة كبيرة، وغالباً ما كانوا يخترعون إجابات حتى في المسائل متوسطة الحجم.

الخلاصة

تخلص الورقة إلى أن هذه النماذج لا تفشل بشكل عشوائي. فشلها هو فشل هيكلي.

  • هم رائعون في المهام الصغيرة.
  • يعانون في المهام المتوسطة بسبب الأخطاء الحسابية.
  • يتخلون تماماً عن المهمة في المهام الكبيرة والمعقدة ويبدأون في اختلاق أكاذيب تبدو منطقية لأن "ذاكرتهم العاملة" الداخلية قد نفدت.

لقد نشر المؤلفون جميع بياناتهم وأدواتهم لكي يتمكن علماء آخرون من دراسة حد "الذاكرة العاملة" هذا ومحاولة إصلاحه. لقد أثبتوا أنه بالنسبة لهذه النماذج، إجراء الحسابات أصعب من معرفة الحسابات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →