Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens
تقترح هذه الورقة أن استدلال "سلسلة الأفكار" (CoT) ليس علامة على ذكاء حقيقي، بل هو انعكاس هش لانحيازات استقرائية متعلمة تنجح فقط عندما تتوافق استعلامات الاختبار مع توزيع بيانات التدريب، وتفشل عند مواجهة تحولات في التوزيع.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
"خدعة السحر" للذكاء الاصطناعي: هل هو يفكر، أم أنه مجرد مقلّد بارع؟
تخيل أنك قابلت ساحرًا عالميًا. يؤدي خدعة حيث يتنبأ بدقة بالبطاقة التي ستختارها، شارحًا "منطقه" خطوة بخطوة: "أولاً، أرى يدك تتحرك يسارًا، ثم ألاحظ بريق عينيك نحو النوع الأحمر، لذا لا بد أنك ستختار آص القلوب".
يبدو الأمر عبقريًا. يبدو وكأنه يقرأ عقلك حقًا. ولكن ماذا لو أخبرتك أن الساحر قد رأى خدعة البطاقات هذه نفسها 10,000 مرة من قبل؟ هو لا يقرأ عقلك؛ هو فقط يستعرض نصًا نجح في الماضي.
تجادل هذه الورقة بأن "سلسلة التفكير" (Chain-of-Thought) في الذكاء الاصطناعي هي تمامًا مثل ذلك الساحر.
المفهوم: ما هي "سلسلة التفكير"؟
عندما نستخدم الذكاء الاصطناعي (مثل ChatGPT)، غالبًا ما نطلب منه أن "يفكر خطوة بخطوة". هذا ما يسمى "سلسلة التفكير" (Chain-of-Thought). بدلًا من القفز مباشرة إلى الإجابة، يكتب الذكاء الاصطناعي عملية "التفكير" الخاصة به. لفترة طويلة، نظر البشر إلى هذه الخطوات وظنوا: "واو، الذكاء الاصطناعي يفكر حقًا! إنه يتبع المنطق!"
لقد طرح الباحثون في هذه الورقة سؤالًا تشكيكيًا: هل يتبع الذكاء الاصطناعي المنطق حقًا، أم أنه مجرد "سراب" من التفكير؟
الاكتشاف: عدسة "توزيع البيانات"
لمعرفة ذلك، بنى الباحثون مختبرًا رقميًا يسمى DataAlchemy. فكر في هذا كملعب مصنوع من قطع الليغو. بدلًا من اللغة البشرية المعقدة، استخدموا "ذرات" بسيطة (حروف) و"تحويلات" (قواعد مثل "أزح كل حرف بمقدار 3").
قاموا بتدريب نماذج الذكاء الاصطناعي على هذه القواعد البسيطة ثم أعطوها "اختبارات" لمعرفة ما إذا كان بإمكانها التفكير حقًا. إليكم ما وجدوه باستخدام ثلاثة "اختبارات ضغط" مختلفة:
1. اختبار "الوصفة الجديدة" (تعميم المهام)
تخيل أنك علمت طباخًا كيفية صنع شطيرة زبدة الفول السوداني وشطيرة لحم. إذا طلبت منه فجأة صنع شطيرة زبدة فول سوداني ولحم (مزيج جديد)، فإن الطباخ الحقيقي سيقوم ببساطة بدمج الخطوات.
- فشل الذكاء الاصطناعي: غالبًا ما يرتبك الذكاء الاصطناعي. قد يحاول اتباع نص "زبدة الفول السوداني" أو نص "اللحم"، لكنه لا يستطيع دمجهما في عملية منطقية جديدة. هو ليس "يتعلم مفهوم الشطيرة"؛ هو فقط يحفظ وصفات محددة.
2. اختبار "الشطيرة العملاقة" (تعميم الطول)
تخيل أنك علمت طفلًا العد حتى الرقم 5. إذا طلبت منه فجأة العد حتى الرقم 50، فإن الطفل الذي يفهم الرياضيات سيستمر في العد فحسب.
- فشل الذكاء الاصطناعي: غالبًا ما يصطدم الذكاء الاصطناعي بـ "جدار". إذا تم تدريبه على التفكير في 3 خطوات، وأعطيته مسألة تتطلب 10 خطوات، فإنه غالبًا ما سيحاول "حشر" الإجابة في 3 خطوات أو سيبدأ في الهذيان. هو لم يتعلم مفهوم العد؛ بل تعلم فقط نمط التسلسل القصير.
3. اختبار "التعليمات الفوضوية" (تعميم التنسيق)
تخيل أنك تعطي شخصًا تعليمات: "1. اتجه يسارًا. 2. سر مستقيمًا". إذا غيرتها قليلًا لتصبح: "أولاً، يرجى الاتجاه يسارًا، ومن ثم، يجب عليك السير مستقيمًا"، فإن الإنسان لا يهتم—المنطق هو نفسه.
- فشل الذكاء الاصطنيعي: الذكاء الاصطناعي هش للغاية. إذا أضفت كلمة واحدة إضافية أو غيرت طريقة صياغة السؤال، فإن "التفكير" غالبًا ما ينهار. إنه مثل سيارة سباق عالية الأداء تتعطل إذا وُجدت حصاة واحدة على المسار.
الحكم: "سراب هش"
خلص الباحثون إلى أن سلسلة التفكير (CoT) هي سراب.
عندما يُسأل الذكاء الاصطناعي أسئلة تشبه تمامًا ما درسه في المدرسة (ما يسمونه "داخل التوزيع" - In-Distribution)، فإنه يبدو كعبقري. ولكن بمجرد أن يتحرك قليلًا خارج "منطقة الراحة" هذه (ما يسمونه "خارج التوزيع" - Out-of-Distribution)، يختفي المنطق.
الذكاء الاصطناعي لا "يفكر" في المشكلة؛ بل هو يقوم باستكمال الأنماط (Interpolating patterns). هو ينظر إلى المشكلة الحالية ويقول: "هذا يشبه بنسبة 90% ذلك الشيء الذي رأيته في بيانات التدريب الخاصة بي، لذا سأستعرض الخطوات من ذلك الشيء".
لماذا يهمك هذا؟
هذا تحذير للمستقبل. بينما نبدأ في استخدام الذكال الاصطناعي لأشياء مهمة—مثل النصائح الطبية، أو المساعدة القانونية، أو الهندسة—قد نرى الذكاء الاصطناعي يقدم تفسيرًا طويلًا جدًا، وواثقًا جدًا، و"يبدو منطقيًا" جدًا.
تحذرنا الورقة: لا تخلط بين التفسير الفصيح والتفسير الصحيح. مجرد قدرة الذكاء الاصطناعي على شرح كيف وصل إلى إجابة لا يعني أنه فهم المنطق الكامن وراءها حقًا. قد يكون مجرد ساحر موهوب جدًا يؤدي خدعة رآها ألف مرة من قبل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.