← أحدث الأبحاث
💻 computer science

CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning

إنَّ CAP-CoT هو إطار عمل توجيهي تنافسي دوري يعمل على تحسين دقة واستقرار استدلال النماذج اللغوية الكبيرة من خلال حلقة تغذية راجعة بين حلّال أمامي، ومتحدٍّ تنافسي يقوم بتوليد أخطاء منطقية ذات دلالة للمهمة، ووكيل تغذية راجعة لتحسين كل من توجيهات الحلّال والمتحدي بشكل تكراري.

المؤلفون الأصليون: Shuxu Chen, Yitian Zhou, Jiaquan Zhang, Haoyu Bian, Aming Wu, Sungyoung Lee, Chaoning Zhang, Hyundong Shin

نُشر 2026-04-28
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shuxu Chen, Yitian Zhou, Jiaquan Zhang, Haoyu Bian, Aming Wu, Sungyoung Lee, Chaoning Zhang, Hyundong Shin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتدريب طالب على حل الألغاز الرياضية والمنطقية المعقدة. معظم الناس يعلمون الطلاب من خلال عرض أمثلة صحيحة عليهم: "إليك مسألة، وإليك الطريقة الصحيحة لحلها".

تجادل هذه الورقة البحثية، CAP-CoT، بأن طريقة التدريس هذه القائمة على "الإيجابية فقط" هي طريقة غير مكتملة. الأمر يشبه تعلم القيادة من خلال مشاهدة فيديوهات للقيادة المثالية فقط؛ قد تصبح بارعاً حتى تواجه موقفاً صعباً، وعندها ستتجمد في مكانك.

ولإصلاح ذلك، صمم الباحثون "معسكراً تدريبياً" يتكون من ثلاث شخصيات متخصصة.

الشخصيات الثلاث في المعسكر التدريبي

  1. الحلال (الطالب): هذا هو الذكاء الاصطناعي الذي نريد تحسينه. مهمته هي النظر إلى المسألة وكتابة شرح خطوة بخطوة (سلسلة من الأفك‏/Chain of Thought) للوصول إلى الإجابة.
  2. المتحدي (المخادع): هذا ذكاء اصطناعي متخصص، ومهمته الوحيدة هي أن يكون "مخرباً ذكياً". هو لا يحاول حل المسألة، بل ينظر إلى المسألة ويقوم بإنشاء "حل زائف". يبدو هذا الحل الزائف مقنعاً واحترافياً للغاية، ولكنه يحتوي على فخ منطقي واحد صغير وخفي—مثل خطأ رياضي مخبأ داخل جملة منمقة.
  3. وكيل التغذية الراجعة (المدرب): هذا هو الموجه الحكيم. ينظر المدرب إلى إجابة الطالب الحقيقية وإلى إجابة المخادع المزيفة. يقول المدرب: "انظر يا طالب! لقد خدعك المخادع لأنك نسيت التحقق من مجال المعادلة. وأنت يا مخادع، أصبحت سهلاً للغاية؛ في المرة القادمة، حاول إخفاء خطئك في منتصف عملية حسابية طويلة".

"الدورة" (الخلطة السرية)

بدلاً من التدريس لمرة واحدة فقط، وضعوا هؤلاء الثلاثة في حلقة (دورة).

  • الجولة الأولى: يحاول الطالب حل مسألة ما. يقوم المخادع بإنشاء "كذبة معقولة". ويشير المدرب إلى الفجوة بين الحقيقة والكذبة.
  • الجولة الثانية: يقوم المدرب بتحديث "كتيب القواعد" الخاص بالطالب (الأمر البرمجي/Prompt) لتجنب ذلك الفخ المحدد. لكن المدرب يقوم أيضاً بتحديث المخادع، قائلاً له: "الطالب يزداد ذكاءً؛ عليك أن تأتي الآن بأكاذيب أكثر دهاءً!"
  • الجولة الثالثة: تتكرر الدورة. يصبح الطالب أكثر صرامة، ويصبح المخادع أكثر مكرًا.

بحلول الوقت الذي ينهون فيه بضع جولات، يكون الطالب قد "خاض اختباراً قتالياً". لم يتعلموا فقط كيف يكونوا على صواب، بل تعلموا كيف يتجنبون الخطأ.

لماذا يهم هذا؟ (النتيجة)

في العالم الحقيقي، غالباً ما تعاني أنظمة الذكاء الاصطناعي من "الهشاشة". إذا غيرت كلمة واحدة صغيرة في السؤال، فقد ينهار الذكاء الاصطناعي.

اختبر الباحثون ذلك على عدة معايير صعبة (مثل الرياضيات والقراءة طويلة السياق). ووجدوا أن CAP-CoT جعل الذكاء الاصطناعي:

  1. أكثر ذكاءً: لقد أجاب على عدد أكبر من الأسئلة بشكل صحيح.
  2. أكثر متانة: لم يعد يرتبك بسهء بسبب "الضجيج" أو التغييرات الطفيفة في كيفية طرح السؤال.
  3. أكثر اتساقاً: حتى لو رفعت مستوى "الإبداع" (درجة الحرارة/Temperature) للذكاء الاصطناعي، فإنه سيظل على المسار الصحيح لأن أساسه المنطقي أصبح الآن أقوى بكثير.

باختصار: لا يعلم CAP-CoT الذكاء الاصطناعي كيفية اتباع المسار فحسب؛ بل يعلمه كيفية رصد الحفر الموجودة في الطريق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →