Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution
تقدم هذه الورقة إطار عمل "عزو الثقة التدريجي" (SCA)، وهو إطار لتشخيص إخفاقات الاستدلال متعدد الخطوات في النماذج اللغوية الكبيرة ذات الصندوق الأسود عبر تطبيق مبدأ "عنق زجاجة المعلومات" لتعيين درجات ثقة على مستوى الخطوة بناءً على هياكل الإجماع، مما يتيح تصحيحاً ذاتياً أكثر فعالية من التغذية الراجعة التقليدية على مستوى الإجابة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تسأل صديقاً ذكياً جداً، ولكنه مشتت الذهن قليلاً، ليحل مسألة رياضية معقدة أو يجيب على سؤال صعب. هو لا يكتفي بإعطائك الإجابة النهائية فحسب؛ بل يكتب لك كامل عملية تفكيره، خطوة بخطوة، كأنه محقق يحل قضية ما.
المسألة:
أحياناً، يصل صديقك إلى الإجابة الصحيحة بالصدفة، أو يصل إلى إجابة خاطئة بسبب خطأ صغير ارتكبه في منتصف منطقه. المشكلة هي، عندما يسلمك النتيجة النهائية، لا يمكنك بسهولة معرفة أين أخطأ. هل أخطأ في الخطوة الأولى؟ أم في الخطوة الأخيرة؟ أم أنه كان محظوظاً فقط؟
الطرق الحالية تشبه سؤال صديقك: "هل أجبت بشكل صحيح؟" وهو لا يستطيع إلا أن يقول "نعم" أو "لا" بخصوص الإجابة النهائية. لا يمكنه الإشارة إلى الجملة المحددة في دفتر ملاحظاته حيث تعطل منطقه.
الحل: عزو الثقة خطوة بخطوة (SCA)
ابتكر مؤلفو هذه الورقة البحثية أداة جديدة تسمى عزو الثقة خطوة بخطوة (Stepwise Confidence Attribution - SCA). فكر في هذا كـ "راصد للمنطق" يقرأ ملاحظات صديقك خطوة بخلف خطوة ويضع درجة ثقة بجانب كل جملة.
- ثقة عالية (علامة صح خضراء): "هذه الخطوة تبدو متينة. إنها تتوافق مع ما يفعله الآخرون الأذكياء عادةً لحل هذه المسألة."
- ثقة منخفضة (علامة تحذير حمراء): "مهلاً لحظة. هذه الخطوة تبدو غريبة. إنها لا تتناسب مع نمط الحل الصحيح. من المرجح أن هذا هو مكان وقوع الخطأ."
كيف يعمل ذلك؟ (تشبيه "الإجماع")
السر يكمن في شيء يسمى الإجماع (Consensus). تخيل أنك سألت 20 صديقاً ذكياً مختلفاً لحل نفس المسألة.
- على الرغم من أنهم قد يكتبون خطواتهم بترتيب مختلف أو يستخدمون كلمات مختلفة، إلا أن الحلول "الصحيحة" ستتشارك جميعها في بعض "المعالم" أو "المرتكزات" الرئيسية. على سبيل المثال، في مسألة رياضية، يجب على الجميع حساب تكلفة الأقلام قبل حساب الإجمالي.
- ينظر نظام الورقة البحثية إلى جميع الحلول العشرين. ويجد "الأرضية المشتركة" — الخطوات التي اتفق عليها كل من حصل على حل صحيح.
- إذا اتبع حل صديقك هذه المعالم المشتركة، يمنحه النظام درجة ثقة عالية.
- إذا اتخذ صديقك مساراً غريباً أو تخطى معلماً ضرورياً، يقوم النظام بوضع علامة تدل على انخفاض الثقة.
الأداتان اللتان صنعتاهما
تقدم الورقة طريقتين للقيام بعملية "الرصد" هذه:
- NIBS (مُطابق الكلمات): هي أداة بسيطة وسريعة. هي فقط تنظر إلى الكلمات والمعنى لكل خطوة. إذا بدت خطوة ما وكأنها تشبه الخطوات الموجودة في المجموعة "الصحيحة"، فإنها تحصل على درجة عالية. الأمر يشبه التحقق مما إذا كانت جملة في وصفة طعام تطابق الخطوات الموجودة في ألف وصفة ناجحة أخرى.
- GIBS (قارئ الخرائط): هذه هي الأداة المتقدمة والأكثر تطوراً. هي لا تنظر إلى الكلمات فحسب؛ بل تنظر إلى بنية المنطق. إنها تحول الاستنتاج إلى خريطة (رسم بياني) حيث ترتبط الخطوات بأسهم توضح كيف تؤدي إحداها إلى الأخرى. ثم تجد "الخريطة المشتركة" التي تشترك فيها جميع الحلول الصحيحة. إذا كانت خريطة صديقك تحتوي على جسر غير موجود في الخريطة المشتركة، فإن GIBS يضع علامة تحذير. هذا أفضل للمسائل المعقدة حيث يهم ترتيب الخطوات كثيراً.
لماذا يهم هذا؟ (سحر "التصحيح الذاتي")
تظهر الورقة أن هذا ليس مجرد وسيلة لإيجاد الأخطاء؛ بل يتعلق بإصلاحها أيضاً.
- الطريقة القديمة: أنت تخبر صديقك: "إجابتك النهائية خاطئة. حاول مرة أخرى". غالباً ما سيقوم بمجرد التخمين بشكل مختلف أو يرتكب نفس الخطأ مرة أخرى لأنه لا يعرف "لماذا" فشل.
- الطريقة الجديدة: أنت تخبر صديقك: "إجابتك النهائية خاطئة. وأيضاً، انظر إلى الخطوة 3 والخطوة 5؛ نظامنا يعتقد أن هاتين الخطوتين مهزوزتان".
- النتيجة: عندما اختبرت الورقة هذا، تمكنت نماذج الذكاء الاصطناعي من إصلاح أخطائها بشكل أفضل بكثير (بنسبة نجاح أعلى تصل إلى 13.5%) عندما تمت الإشارة إلى الخطوات الضعيفة المحددة، بدلاً من مجرد إخبارها بأن الإجابة النهائية خاطئة.
باختختصار
تعطينا هذه الورقة طريقة للنظر داخل "الصندوق الأسود" لتفكير الذكاء الاصطناعي دون الحاجة لفتح الصندوق. ومن خلال مقارنة خطوات استنتاج الذكاء الاصطناعي مع "إجماع" الحلول الصحيحة، يمكن للنظام تحديد المكان الذي ينهار فيه المنطق بالضبط. هذا يحول عبارة "أنت مخطئ" الغامضة إلى "لقد خرجت عن المسار هنا" مفيدة، مما يسمح للذكاء الاصطناعي بالتعلم من أخطائه المحددة وتصحيح نفسه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.