CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning
إنَّ CAP-CoT هو إطار عمل توجيهي تنافسي دوري يعمل على تحسين دقة واستقرار استدلال النماذج اللغوية الكبيرة من خلال حلقة تغذية راجعة بين حلّال أمامي، ومتحدٍّ تنافسي يقوم بتوليد أخطاء منطقية ذات دلالة للمهمة، ووكيل تغذية راجعة لتحسين كل من توجيهات الحلّال والمتحدي بشكل تكراري.
تخيل أنك تقوم بتدريب طالب على حل الألغاز الرياضية والمنطقية المعقدة. معظم الناس يعلمون الطلاب من خلال عرض أمثلة صحيحة عليهم: "إليك مسألة، وإليك الطريقة الصحيحة لحلها".
تجادل هذه الورقة البحثية، CAP-CoT، بأن طريقة التدريس هذه القائمة على "الإيجابية فقط" هي طريقة غير مكتملة. الأمر يشبه تعلم القيادة من خلال مشاهدة فيديوهات للقيادة المثالية فقط؛ قد تصبح بارعاً حتى تواجه موقفاً صعباً، وعندها ستتجمد في مكانك.
ولإصلاح ذلك، صمم الباحثون "معسكراً تدريبياً" يتكون من ثلاث شخصيات متخصصة.
الشخصيات الثلاث في المعسكر التدريبي
الحلال (الطالب): هذا هو الذكاء الاصطناعي الذي نريد تحسينه. مهمته هي النظر إلى المسألة وكتابة شرح خطوة بخطوة (سلسلة من الأفك/Chain of Thought) للوصول إلى الإجابة.
المتحدي (المخادع): هذا ذكاء اصطناعي متخصص، ومهمته الوحيدة هي أن يكون "مخرباً ذكياً". هو لا يحاول حل المسألة، بل ينظر إلى المسألة ويقوم بإنشاء "حل زائف". يبدو هذا الحل الزائف مقنعاً واحترافياً للغاية، ولكنه يحتوي على فخ منطقي واحد صغير وخفي—مثل خطأ رياضي مخبأ داخل جملة منمقة.
وكيل التغذية الراجعة (المدرب): هذا هو الموجه الحكيم. ينظر المدرب إلى إجابة الطالب الحقيقية وإلى إجابة المخادع المزيفة. يقول المدرب: "انظر يا طالب! لقد خدعك المخادع لأنك نسيت التحقق من مجال المعادلة. وأنت يا مخادع، أصبحت سهلاً للغاية؛ في المرة القادمة، حاول إخفاء خطئك في منتصف عملية حسابية طويلة".
"الدورة" (الخلطة السرية)
بدلاً من التدريس لمرة واحدة فقط، وضعوا هؤلاء الثلاثة في حلقة (دورة).
الجولة الأولى: يحاول الطالب حل مسألة ما. يقوم المخادع بإنشاء "كذبة معقولة". ويشير المدرب إلى الفجوة بين الحقيقة والكذبة.
الجولة الثانية: يقوم المدرب بتحديث "كتيب القواعد" الخاص بالطالب (الأمر البرمجي/Prompt) لتجنب ذلك الفخ المحدد. لكن المدرب يقوم أيضاً بتحديث المخادع، قائلاً له: "الطالب يزداد ذكاءً؛ عليك أن تأتي الآن بأكاذيب أكثر دهاءً!"
الجولة الثالثة: تتكرر الدورة. يصبح الطالب أكثر صرامة، ويصبح المخادع أكثر مكرًا.
بحلول الوقت الذي ينهون فيه بضع جولات، يكون الطالب قد "خاض اختباراً قتالياً". لم يتعلموا فقط كيف يكونوا على صواب، بل تعلموا كيف يتجنبون الخطأ.
لماذا يهم هذا؟ (النتيجة)
في العالم الحقيقي، غالباً ما تعاني أنظمة الذكاء الاصطناعي من "الهشاشة". إذا غيرت كلمة واحدة صغيرة في السؤال، فقد ينهار الذكاء الاصطناعي.
اختبر الباحثون ذلك على عدة معايير صعبة (مثل الرياضيات والقراءة طويلة السياق). ووجدوا أن CAP-CoT جعل الذكاء الاصطناعي:
أكثر ذكاءً: لقد أجاب على عدد أكبر من الأسئلة بشكل صحيح.
أكثر متانة: لم يعد يرتبك بسهء بسبب "الضجيج" أو التغييرات الطفيفة في كيفية طرح السؤال.
أكثر اتساقاً: حتى لو رفعت مستوى "الإبداع" (درجة الحرارة/Temperature) للذكاء الاصطناعي، فإنه سيظل على المسار الصحيح لأن أساسه المنطقي أصبح الآن أقوى بكثير.
باختصار: لا يعلم CAP-CoT الذكاء الاصطناعي كيفية اتباع المسار فحسب؛ بل يعلمه كيفية رصد الحفر الموجودة في الطريق.
ملخص تقني: CAP-CoT: التلقين التنافسي الدوري لتحسين تسلسل الأفكار في استدلال النماذج اللغوية الكبيرة
1. بيان المشكلة
بينما عزز "تلقين تسلسل الأفكار" (Chain-of-Thought - CoT) قدرات الاستدلال في النماذج اللغوية الكبيرة (LLMs) بشكل كبير، إلا أنه يعاني من قصورين أساسيين:
عدم الاستقرار والهشاشة: غالبًا ما يكون استدلال CoT غير متسق عبر عمليات التشغيل المختلفة في المسائل المعقدة متعددة الخطوات. يمكن أن تؤدي التغييرات الطفيفة في التلقين أو السياق إلى انخفاض كبير في الأداء.
الافتقار إلى تصحيح الأخطاء: تركز معظم الطرق الحالية على "الاستدلال الأمامي" (تحسين المسار الوحيد الذي يتخذه النموذج). وهي تفتقر إلى آلية منهجية لتحديد نقاط الضعف المنطقية الكامنة أو للتعلم من الأمثلة "السلبية" (مسارات الاستدلال الخاطئة)، والتي لا تقل أهمية عن المسارات الصحيحة.
2. المنهجية: إطار عمل CAP-CoT
يقترح المؤلفون CAP-CoT (تحسين التلقين التنافسي الدوري)، وهو إطار عمل يعامل تحسين التلقين كلعبة تنافسية دورية بين ثلاثة وكلاء متخصصين (جميعهم يتشاركون نفس الهيكل الأساسي ولكن باستخدام تلقينات قائمة على أدوار مختلفة):
الوكيل الحلّال (GS): الوكيل الأساسي المكلف بتوليد سلسلة استدلال متماسكة وخطوة بخطوة (CS) لحل استعلام معطى.
المتحدي التنافسي (GC): بدلاً من حل المسألة، يقوم هذا الوكيل ببناء "سلبيات صعبة" (hard negatives)—وهي سلاسل استدلال (CC) تبدو منطقية وتتبع الهيكل الصحيح ولكنها تحتوي على عيوب منطقية دقيقة مرتبطة بمهام العمل (مثل: القفزات المنطقية، أو الارتباك المفاهيمي، أو الافتراضات غير المدعومة).
وكيل التغذية الراجعة (F): هو "المُحسِّن الفائق" (meta-optimizer) الذي يقوم بإجراء تحليل مقارن بين سلسلة الحل الصحيحة للوكيل الحلّال وسلسة المتحدي المعيبة. ويقوم بتوليد تغذية راجعة مهيكلة ومتوافقة مع الخطوات.
دورة التحسين: يعمل إطار العمل في حلقة مغلقة:
المقارنة (Contrast): يحدد وكيل التغذية الراجعة بدقة أين نجح خطأ المتحدي وأين كان منطق الوكيل الحلّال هشاً.
التحديث ثنائي الاتجاه:
تحديث الوكيل الحلّال: يتم تحديث تلقين الوكيل الحلّال بإضافة "إرشادات ديناميكية" جديدة لإصلاح نقاط الضعف المحددة (مثال: "تحقق دائماً من قيود المجال قبل الحل").
تحديث المتحدي: يتم تحديث تلقين المتحدي للابتعاد عن الأخطاء البسيطة نحو أنماط أخطاء أكثر "استهدافاً" و"صعوبة" تستغل تحديداً نقاط الضعف الحالية للوكيل الحلّال.
التكرار: تتكرر هذه الدورة (عادةً من 2 إلى 3 مرات) حتى يصبح تلقين الوكيل الحلّال قوياً بما يكفي لمقاومة الهجمات التنافسية المتطورة.
3. المساهمات الرئيسية
التلقين التنافسي التكيفي: على عكس التلقين التنافسي الموجه نحو السلامة (الذي يهدف إلى "كسر حماية" النماذج)، يستخدم CAP-CoT التنافسية الدلالية للمهام لكشف نقاط الضعف المنطقية.
تصنيف تطوري للأخطاء: يبدأ إطار العمل بتصنيف أساسي للأخطاء (القفز، الارتباك، الضبابية، الغلاف) ولكنه يسمح للمتحدي بتطوير استراتيجيات أخطاء أكثر تعقيداً من خلال التغذية الراجعة.
تحسين التلقين عبر التغذية الراجعة المهيكلة (SFPR): آلية تحول الانتقادات باللغة الطبيعية إلى تعليمات موجزة وقابلة للنقل وآمرة لتحديث التلقين.
التحسين المرتكز على الاستقرار: لا يعمل الإطار على تحسين الدقة فحسب، بل يعمل أيضاً على الاستقرار تجاه درجات الحرارة (temperature) وتغيرات التلقين.
4. النتائج التجريبية
قام المؤلفون بتقييم CAP-CoT عبر ستة اختبارات معيارية (بما في ذلك MATH و GSM8K و BBH و LongBench) باستخدام أربعة هياكل رئيسية للنماذج اللغوية الكبيرة (GPT-4o، و GPT-4o-mini، و Qwen-turbo، و DeepSeek-V3).
دقة فائقة: تفوق CAP-CoT باستمرار على جميع النماذج المرجعية (بما في ذلك الطرق المتقدمة مثل Tree-of-Thought و Graph-of-Thought و Self-Refine) عبر جميع مجموعات البيانات والهياكل.
تعزيز الاستقرار: بينما تظهر طرق CoT القياسية تبايناً عالياً في الدقة مع زيادة درجة الحرارة، يقلل CAP-CoT بشكل كبير من "متوسط التباين"، مما يجعل استدلال النموذج أكثر استقراراً تحت ضجيج العينات.
الكفاءة: رغم أنه أكثر تكلفة من عملية CoT لمرة واحدة، إلا أن CAP-CoT أكثر كفاءة في استهلاك الرموز (tokens) من طرق "توسيع وقت الاختبار" (مثل ToT أو MAD)، لأن الحوسبة الثقيلة تحدث أثناء مرحلة التحسين، وليس أثناء كل عملية استدلال فردية.
5. الأهمية
يمثل CAP-CoT تحولاً من التلقين السلبي (إعطاء نموذج قالباً معيناً) إلى هندسة التلقين النشطة (تدريب التلقين من خلال المنافسة). ومن خلال الاستفيد من التباين بين "ما هو صحيح" و"ما يبدو صحيحاً ولكنه خاطئ"، يوفر إطار العمل وسيلة قوية لتقوية استدلال النماذج اللغوية الكبيرة ضد الأخطاء المنطقية التي تعيب عادةً حل المسائل المعقدة متعددة الخطوات. وتعد هذه الطريقة ذات قيمة خاصة لنشر النماذج اللغوية الكبيرة في بيئات الاستدلال عالية المخاطر حيث تعد الاتساق والموثوقية أمراً بالغ الأهمية.