← أحدث الأبحاث
💬 NLP

Self-Consistency from Only Two Samples: CoT-PoT Ensembling for Efficient LLM Reasoning

تقدم هذه الورقة إطار عمل هجينًا لدمج "سلسلة الأفكار" (CoT) و"سلسلة البرامج" (PoT) يحسن دقة الاستدلال بشكل كبير مع تقليل التكلفة الحسابية لـ "الاتساق الذاتي" بمقدار 9.3 ضعفًا، مما يتيح حل 78.6% من المهام باستخدام عينتين فقط.

المؤلفون الأصليون: Raman Saparkhan, Majd Hawasly, Md Rizwan Parvez, Mohammad Raza

نُشر 2026-04-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Raman Saparkhan, Majd Hawasly, Md Rizwan Parvez, Mohammad Raza

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز رياضي صعب للغاية. تسأل مساعد ذكاء اصطناعي فائق الذكاء عن الإجابة.

أحياناً، يصيب الذكاء الاصطناعي في إجابته. وأحياناً أخرى، يرتبك ويرتكب خطأً رياضياً سخيفاً، أو يسيء فهم السؤال تماماً.

الطريقة القديمة: "اسأل نفس السؤال 40 مرة"

للتأكد من صحة إجابة الذكاء الاصطناعي، استخدم الباحثون تقنية تسمى "الاتساق الذاتي" (Self-Consistency). الأمر يشبه سؤال الذكاء الاصطناعي نفس السؤال 40 مرة متتالية.

  • إذا قال الذكاء الاصطناعي "12" عشرين مرة و"13" عشرين مرة، فإنك تختار "12" لأنها الإجابة الأكثر شيوعاً.
  • المشكلة: هذه الطريقة مكلفة وبطيئة. إنها تشبه توظيف 40 شخصاً مختلفاً لحل لغز واحد فقط لضمان السلامة. إنها تستغرق الكثير من الوقت والمال.

الفكرة الجديدة: "المحقق والمحاسب"

أدرك مؤلفو هذه الورقة البحثية أن سؤال الذكاء الاصطناعي نفس السؤال 40 مرة هو أمر غير فعال، لأن الذكاء الاصطناعي غالباً ما يعطيك 40 نسخة مختلفة قليلاً من نفس الخطأ. الأمر يشبه سؤال 40 شخصاً درسوا جميعاً في نفس المدرسة لحل لغز؛ قد يرتكبون جميعاً نفس الخطأ المنطقي تماماً.

بدلاً من ذلك، قرروا أن يطلبوا من الذكاء الاصطناعي حل المشكلة بطريقتين مختلفتين تماماً في نفس الوقت:

  1. المحقق (سلسلة الأفك‏/CoT): هذا النمط يفكر باللغة الإنجليزية العادية. إنه يشرح المشكلة خطوة بخطوة كالبشر. "حسناً، إذا كان لدي 5 تفاحات وأعطيت منها 2، يتبقى لدي 3..."

    • نقاط القوة: بارع في فهم القصة والمنطق.
    • نقاط الضعف: سيئ في الرياضيات. قد يقول "5 ناقص 2 يساوي 4" لمجرد أنه يتحدث بسرعة.
  2. المحاسب (برنامج الأفك‏/PoT): هذا النمط لا يتحدث؛ بل يكتب كوداً برمجياً. يحول المشكلة إلى برنامج حاسوبي. "اجعل التفاح = 5، اجعل المعطى = 2، احسب التفاح - المعطى."

    • نقاط القوة: مثالي في الرياضيات. الحواسيب لا ترتكب أخطاء حسابية.
    • نقاط الضعف: سيئ في فهم القصة. قد يكتب كوداً يحسب شيئاً خاطئاً لأنه أساء فهم السؤال.

الخدعة السحرية: "توقف عند العينة الثانية"

هذا هو الجزء العبقري في اكتشافهم: إذا اتفق المحقق والمحاسب على الإجابة، فهما بالتأكيد على صواب.

لماذا؟

  • المحقق يرتكب أخطاء منطقية لكنه يصيب في الحساب (عادةً).
  • المحاسب يرتكب أخطاء منطقية لكنه يصيب في الحساب (دائماً).
  • من النادر جداً أن يرتكب كلاهما نفس الخطأ وبنفس الطريقة.

لذا، بدلاً من السؤال 40 مرة، تعمل الطة الجديدة كالتالي:

  1. اسأل المحقق مرة واحدة.
  2. اسأل المحاسب مرة واحدة.
  3. تحقق: هل أعطيا نفس الإجابة؟
    • نعم؟ توقف! لديك إجابتك. لقد استخدمت عينتين فقط.
    • لا؟ اسألهما مرة أخرى (ربما للمرة الثالثة) حتى يتفقا.

النتائج: فوز هائل

تظهر الورقة البحثية أن فريق "المحقق + المحاسب" هذا يغير قواعد اللعبة:

  • السرعة: لقد حلوا 78% من جميع المشكلات باستخدام عينتين فقط (واحدة من كل نمط). الطرق السابقة كانت تحتاج على الأقل 4 أو 5 عينات، والطريقة القديمة كانت تحتاج 40!
  • الدقة: لأن النمطين يغطيان نقاط ضعف بعضهما البعض، فإن الإجابة النهائية هي في الواقع أكثر دقة من الطريقة القديمة، رغم أنهما سألا عدداً أقل من الأسئلة.
  • التكلفة: لقد خفضوا تكلفة الحوسبة بمقدار 9.3 مرة. إنه مثل الحصول على نتيجة أفضل بسعر كوب قهوة واحد بدلاً من مأدبة كاملة.

تشبيه من الواقع

تخيل أنك تحاول تخمين وزن بطيخة.

  • الطريقة القديمة: تسأل 40 شخصاً ليخمنوا الوزن. إذا خمنوا جميعاً "10 أرطال" لأنهم رأوا بطيخة صغيرة سابقاً، فقد تكون مخطئاً.
  • الطريقة الجديدة: تسأل شخصاً واحداً ليخمن بالنظر (المحقق) وشخصاً واحداً ليخمن بوضعها على الميزان (المحاسب).
    • إذا قال الشخص الذي ينظر "10 أرطال" وقال الميزان "10 أرطال"، يمكنك أن تكون متأكداً بنسبة 99% أنها تزن 10 أرطال. لست بحاجة لسؤال 38 شخصاً آخرين.

الملخص

تعلمنا هذه الورقة البحثية أن التنوع أفضل من الكمية. بدلاً من سؤال الذكاء الاصطناعي نفس السؤال 40 مرة، اسأله نوعين مختلفين من الأسئلة (المنطق مقابل الرياضيات). إذا اتفقا، يمكنك التوقف فوراً. هذا يوفر كميات هائلة من الوقت والمال مع الحصول فعلياً على إجابات أفضل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →