← أحدث الأبحاث
💬 NLP

Evolutionary Pre-Prompt Optimization for Mathematical Reasoning

تقدم هذه الورقة البحثية "تحسين التلقين المسبق التطوري" (EPPO)، وهي طريقة تسخر الخوارزميات التطورية لاختيار أمثلة "سلسلة الأفكار" ذات القليل من الأمثلة (few-shot)، مما يحسن أداء الاستدلال الرياضي بشكل كبير على معايير مثل GSM8k وMathQA بأكثر من 10 نقاط مطلقة مقارنة بالنهج الساذج.

المؤلفون الأصليون: Mathurin Videau, Alessandro Leite, Marc Schoenauer, Olivier Teytaud

نُشر 2026-02-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mathurin Videau, Alessandro Leite, Marc Schoenauer, Olivier Teytaud

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم طالب عبقري ولكنه مشتت قليلاً (نموذج لغوي كبير) كيفية حل المسائل الرياضية المعقدة. لا يمكنك إعادة كتابة دماغ الطالب (لا يمكنك إعادة تدريب النموذج)، بدلاً من ذلك، عليك إعطاؤه "ورقة غش" أو مجموعة من الأمثلة المسألة ليلقي نظرة عليها قبل خوض الاختبار. يُسمى هذا التحفيز بالقليل من الأمثلة (few-shot prompting).

السؤال الكبير الذي تطرحه الورقة البحثية هو: أي الأمثلة يجب أن تكون موجودة في ورقة الغش تلك؟

غالباً ما يختار الناس بعض الأمثلة العشوائية أو يختارون تلك التي تبدو "صعبة". تجادل هذه الورقة بأن هناك طريقة أذكى بكثير لاختيار هذه الأمثلة، باستخدام طريقة مستوحاة من التطور.

إليك تفصيل اكتشافهم، EPPO (تحسين ما قبل التحفيز التطوري)، باستخدام تشبيهات بسيطة:

1. المشكلة: "يانصيب" ورقة الغش

عادةً، عندما نريد من الذكاء الاصطناائي حل مسائل رياضية، نعطيه بضعة أمثلة لكيفية حل مسائل مماثلة أولاً.

  • الطريقة القديمة: غالباً ما يختار الناس أمثلة عشوائياً أو يدوياً. الأمر يشبه محاولة الفوز باليانصيب باختيار أرقام بناءً على تاريخ ميلادك. قد ينجح الأمر أحياناً، لكنه ليس موثوقاً.
  • رؤية الورقة: اختيار الأمثلة تحديداً يهم أكثر من مجرد امتلاك المزيد من الأمثلة. في الواقع، إعطاء الكثير من الأمثلة للذكاء الاصطناعي قد يربكه (تماماً مثل محاولة الدراسة للاختبار عبر قراءة 50 كتاباً مختلفاً بدلاً من التركيز على أفضل 4 كتب).

2. الحل: ورقة الغش "الأصلح للبقاء"

ابتكر المؤلفون نظاماً يسمى EPPO. فكر في الأمر كأنه مسابقة طبخ للعثور على الوصفة المثالية، ولكن بدلاً من الطعام، نحن نمزج ونطابق الأمثلة الرياضية.

  • المكونات: لديهم مخزن ضخم يحتوي على آلاف المسائل الرياضية (مجموعة العرض).
  • المسابقة: يختار الكمبيوتر مجموعة صغيرة من الأمثلة (مثلاً 4 مسائل) لوضعها في "ورقة الغش".
  • اختبار التذوق: يطلب الكمبيوتر من الذكاء الاصطناعي حل مجموعة من مسائل التدريب الرياضية باستخدام ورقة الغش المحددة تلك.
  • التطور:
    1. إذا أدى الذكاء الاصطناائي بشكل جيد، يحتفظ الكمبيوتر بورقة الغش تلك.
    2. إذا كان أداؤه سيئاً، يقوم الكمبيوتر باستبدال مثال أو اثنين بأمثلة جديدة من المخزن.
    3. يكرر هذه العملية آلاف المرات، مع الاحتفاظ دائماً بالأوراق "الأصلح" (الأفضل أداءً) والتخلص من الأوراق السيئة.

بمرور الوقت، "يطور" النظام مجموعة صغيرة ومثالية من الأمثلة التي تجعل الذكاء الاصطناائي يعمل بشكل أفضل بشكل ملحوظ.

3. الاكتشاف المذهل: القليل يعني الكثير

أحد أكثر النتائج إثارة للاهتمام في الورقة هو حول عدد الأمثلة التي تحتاجها.

  • المنطق السليم يقول: "المزيد من الأمثلة = فهم أفضل".
  • EPPO يقول: "في الواقع، 4 أمثلة هي غالباً النقطة المثالية".

وجدت الورقة أنه عندما حاولوا استخدام 8 أو 12 أو 16 مثالاً، أصبح أداء الذكاء الاصطناعي في الواقع أسوأ. الأمر يشبه محاولة حفظ خطاب عبر قراءته 20 مرة؛ قد تبدأ في الارتباك أو الملل. لقد تعرض الذكاء الاصطناعي لـ "فرط التخصيص" (overfitting)، مما يعني أنه حفظ الأمثلة المحددة بدقة شديدة ولم يعد قادراً على تطبيق المنطق على مسائل جديدة ومختلفة قليلاً. وجدت الطريقة "التطورية" بشكل طبيعي أن قائمة موجزة من 4 أمثلة عالية الجودة هي الأفضل.

4. لماذا يعد هذا أمراً هاماً؟

  • رخيص وسريع: بدلاً من محاولة إعادة تدريب نموذج الذكاء الاصطناعي الضخم (الذي يكلف ثروة من الكهرباء والوقت)، قاموا فقط بتحسين "ورقة الغش". إنه يشبه ضبط محرك السيارة بدلاً من بناء سيارة جديدة.
  • يعمل على الرياضيات الصعبة: اختبروا هذا على مجموعات بيانات رياضية صعبة جداً (مثل مستوى المدرسة الثانوية والجامعة). ارتفعت درجة الذكاء الاصطناائي بأكثر من 10 نقاط بمجرد تغيير الأمثلة في ورقة الغش.
  • قوي ومتين: حتى لو كانت الأمثلة التي وجدوها قد تم إنشاؤها بواسطة الذكاء الاصطنافي نفسه (وليس بواسطة بشر مثاليين)، فقد وجد النظام طريقة لجعلها تعمل. إنه يشبه اكتشاف أن ملاحظات الطالب الفوضوية هي في الواقع أفضل طريقة للدراسة للاختبار.

5. "التركيبة السحرية"

وجدت الورقة أيضاً أن هذه الطريقة تعمل بشكل أفضل عند دمجها مع الاتساق الذاتي (Self-Consistency).

  • الاتساق الذاتي هو مثل طلب حل نفس المسألة من الذكاء الاصطنافي 8 مرات ثم أخذ الإجابة التي تظهر أكثر من غيرها (مثل تصويت هيئة المحلفين).
  • النتيجة: عندما تستخدم "ورقة الغش المتطورة" (EPPO) بالإضافة إلى "تصويت الهيئة" (Self-Consistency)، يصبح الذكاء الاصطنااني عبقري رياضيات. الطريقتان تتراكمان فوق بعضهما لإنتاج نتائج أفضل.

الملخص

تظهر الورقة أننا لسنا بحاجة لتغيير دماغ الذكاء الاصطنااني لجعله أكثر ذكاءً في الرياضيات. نحن فقط بحاجة لاستخدام عملية تطورية ذكية لاختيار أفضل 4 أمثلة لعرضها عليه. هذا "التحسين التطوري لما قبل التحفيز" (EPPO) يمنع الذكاء الاصطنااني من الارتباك بسبب كثرة المعلومات ويساعده على التفكير في المسائل المعقدة بفعالية أكبر بكثير.

باختختصار: لا تلقِ بالأمثلة العشوائية على الذكاء الاصطناني. دع التطور يختار القليل المثالي، وشاهد مهارات الرياضيات لدى الذكاء الاصطنااني وهي ترتقي بشكل صاروخي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →