LLMs Faithfully and Iteratively Compute Answers During CoT: A Systematic Analysis With Multi-step Arithmetics
تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة تحسب الإجابات بأمانة بشكل تكراري أثناء عملية التفكير عبر سلسلة الأفك "chain-of-thought" بدلاً من تحديدها مسبقاً، مما يؤكد أن سلاسل الاستدلال التي تولدها تعكس بدقة عمليتها الحسابية الداخلية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة البحث بعنوان "نماذج اللغات الكبيرة (LLMs) تحسب الإجابات بأمانة وتكرار أثناء سلسلة الأفكاء (CoT)"، باستخدام لغة بسيطة وتشبيهات إبداعية.
السؤال الكبير: هل نماذج اللغات الكبيرة "تتظاهر حتى تتقن الأمر"؟
تخيل أنك سألت طالباً ذكياً جداً ولكنه مسرحي بعض الشيء لحل مسألة رياضية. يبدأ الطالب بكتابة شرح طويل وخطوة بخطوة (وهذا ما يسمى سلسلة الأفكار أو Chain-of-Thought وتُختصر بـ CoT). وفي النهاية، يكتب الإجابة في الأسفل.
القلق الكبير لدى الباحثين هو: هل يقوم الطالب فعلياً بإجراء العمليات الحسابية أثناء الكتابة، أم أنه عرف الإجابة بالفعل قبل أن يبدأ بالكتابة؟
إذا كان قد عرف الإجابة مسبقاً، فإن شرحه خطوة بخطوة ليس سوى "سيناريو" يلقيه ليبدو ذكياً. في هذه الحالة، لا يكون الشرح "أميناً" لكيفية وصوله إلى الإجابة؛ بل هو مجرد عرض أدائي.
يسأل هذا البحث: هل تقوم نماذج اللغات الكبيرة (LLMs) فعلياً بحساب الإجابة أثناء كتابة الخطوات، أم أنها تغش وتقرر الإجابة أولاً؟
التجربة: آلة "الأشعة السينية"
لمعرفة ذلك، صمم الباحثون آلة "أشعة سينية" خاصة لعقل الذكاء الاصطناعي.
- الاختبار: قدموا للذكاء الاصطناعي سلسلة من الألغاز الرياضية البسيطة متعددة الخطوات (مثل: أ = 1 + ب، ب = 2 + 3، إذاً ما هي أ؟).
- الأشعة السينية (الاستقصاء الخطي - Linear Probing): بينما كان الذكاء الاصطناعي يولد إجابته، قام الباحثون بإيقافه عند كل كلمة يكتبها. نظروا داخل "عقل" الذكاء الاصطناعي (الحالات الخفية - hidden states) ليروا ما إذا كانت الإجابة الصحيحة موجودة بالفعل هناك، تنتظر الكتابة.
- تشبيه: تخيل ساحراً يخرج أرنباً من قبعة. الباحثون هنا يتحققون من جيوب الساحر قبل أن يخرج الأرنب ليروا ما إذا كان الأرنب مخبأً هناك بالفعل.
الاكتشاف: الأرنب يظهر أثناء العرض
كانت النتائج مفاجئة ومطمئنة.
- قبل بدء الشرح: عندما يقرأ الذكاء الاصطنا_الالمسألة لأول مرة، تُظهر "الأشعة السينية" لا توجد إجابة. العقل فارغ من الحل. لم يقرر شيئاً بعد.
- أثناء الشرح: بينما يكتب الذكاء الاصطنا_الخطوات (مثل: "أولاً، أحسب ب...")، تبدأ الإجابة في الظهور في عقله.
- الاستنتاج: الذكاء الاصطنا_الليس مجرد يلقي سيناريو. إنه يقوم فعلياً بالحسابات "على الطاير" (أثناء العمل) أثناء الكتابة. الشرح الذي يقدمه لك هو انعكاس أمين لما يحدث داخل عقله في تلك اللحظة تحديداً.
تشبيه "انحياز الحداثة": الطلاء الطازج
نظرت الورقة أيضاً في كيفية ربط الذكاء الاصطنا_الالخطوات. وجدوا شيئاً يسمى انحياز الحداثة (Recency Bias).
- تشبيه: تخيل أنك تقوم بطلاء جدار. لست بحاجة لتذكر اللون الذي دهنت به قبل 10 سنوات لتعرف اللون الذي ستستخدمه الآن. أنت تحتاج فقط لتذكر اللون الذي دهنت به الجدار قبل خمس دقائق.
- النتيجة: تعتمد إجابة الذكاء الاصطنا_الالنهائية بشكل كبير على آخر الخطوات التي كتبها. لا يبدو أنه يعيد قراءة بداية المسألة باستمرار. إنه يثق في "الطلاء الطازج" الأخير (آخر خطوة تم حسابها) لتوجيه الخطوة التالية.
اختبار "الجراحة": تغيير الدماغ
للتأكد تماماً، أجرى الباحثون "جراحة دماغ" (التدخل السببي - Causal Intervention).
- الإعداد: أخذوا ذكاءً اصطناعياً يحل المسألة (أ)، وذكاءً اصطناعياً يحل المسألة (ب).
- التبديل: أخذوا "حالة الدماغ" (عملية التفكير الداخلية) للذكاء الاصطنا_الذي يحل المسألة (ب) وزرعوها في الذكاء الاصط_الذي يحل المسألة (أ) في منتصف الشرح تماماً.
- النتيجة: نسي الذكاء الاصطنا_الجواب للمسألة (أ) فوراً وبدأ في إعطاء إجابة المسألة (ب).
- ماذا يعني هذا: أثبت هذا أن الإجابة ليست "مبرمجة مسبقاً" في البداية. الإجابة تعتمد سببياً على خطوات الاستدلال التي يتم توليدها الآن. إذا غيرت الاستدلال، يتغير الجواب.
لماذا هذا مهم؟
هذه أخبار جيدة لكل من يستخدم الذكاء الاصطناعي.
- ثق في العملية: عندما يعطيك الذكاء الاصطنا_الشرح الطويل، يمكنك الوثوق بأنه يفكر فعلياً في المشكلة، وليس مجرد تخمين ثم تأليف قصة لتبريره.
- تصحيح الأخطاء (Debugging): إذا ارتكب الذكاء الاصطنا_الخطأ، فمن المرجح أنه تعثر في خطوة معينة في منتصف السلسلة، وليس لأنه كان "يكذب" منذ البلية.
- الشفافية: "سلسلة الأفكار" ليست مجرد غلاف جميل؛ إنها غرفة المحركات الفعلية حيث يتم العمل.
ملخص في جملة واحدة
تثبت هذه الورقة أنه عندما تستخدم نماذج الذكاء الاصطنا_الـ "سلسلة الفكرية" لحل المشكلات، فإنها تقوم فعلياً بحساب الإجابة خطوة بخطوة أثناء حديثها، بدلاً من تقرير الإجابة مسبقاً والتظاهر بالتفكير.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.