← أحدث الأبحاث
💻 computer science

Predicting Performance of Symbolic and Prompt Programs with Examples

تقترح هذه الورقة إطار عمل RAP، وهو إطار للتنبؤ بالأداء يستفيد من المهام المماثلة المسترجعة وبرامج التلقين (prompt programs) لبناء توزيع احتمالي مسبق تقريبي، مما يعالج بفعالية عدم موثوقية التلقين باستخدام النماذج اللغوية الكبيرة عبر التمييز بين توزيع أدائها المنتشر وطبيعة البرامج الرمزية القائمة على مبدأ "الكل أو لا شيء".

المؤلفون الأصليون: Chengqi Zheng, Keya Hu, Shuzhi Liu, Tao Wu, Kevin Ellis, Yewen Pu

نُشر 2026-05-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chengqi Zheng, Keya Hu, Shuzhi Liu, Tao Wu, Kevin Ellis, Yewen Pu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك مدير توظيف يحاول تحديد ما إذا كان موظف جديد مستعداً لوظيفة كبيرة. لديك نوعان من المرشحين: الروبوت (برنامج رمزي، مثل كود بايثون) والمستقل المبدع (برنامج توجيهي، وهو عبارة عن تعليمات تُعطى لذكاء اصطناعي لأداء مهمة).

تطرح الورقة سؤالاً بسيطاً: إذا اجتاز كلا المرشحين بضعة اختبارات تدريبية صغيرة، فهل يمكننا الوثوق بهما للقيام بالوظيفة الحقيقية؟

يقول المؤلفون: نعم بالنسبة للروبوت، ولكن ربما ليس للمستقل المبدع. وإليك السبب، باستخدام منطق وتشبيهات الورقة نفسها.

1. نوعا "البرامج"

  • الروبوت (البرنامج الرمزي): هذا يشبه الآلة الحاسبة الصارمة. إذا قلت لها "2 + 2"، فيجب أن تقول "4". إنها تتبع قواعد جامدة. إذا اجتاز اختباراً، فذلك لأنه اتبع القواعد بدقة.
  • المستقل المبدع (البرنامج التوجيهي): هذا يشبه طلب رسم قطة من فنان ذكي ولكنه غير متوقع قليلاً. أنت تعطي الفنان "توجيهاً" (تعليمات). قد يرسم الفنان قطة رائعة، أو قطة غريبة، أو كلباً. حتى لو اجتاز بضعة اختبارات تجريبية، فقد يكون ذلك مجرد حظ، أو قد تكون التعليمات غير دقيقة تماماً بالنسبة للعالم الحقيقي.

2. نموذج "رمي العملة"

يتخيل المؤلفون كل مرة يعمل فيها البرنامج في اختبار ما، كأنها عملية رمي لعملة معدنية.

  • صورة (Heads): ينجح البرنامج في الاختبار.
  • كتابة (Tails): يفشل البرنامج في الاختبار.

الهدف هو تخمين مدى "ثقل" هذه العملة. هل هي عملة عادلة (50/50)؟ أم أنها عملة مخادعة تسقط دائماً على "الصورة" (100% نجاح)؟

3. الاكتشاف الكبير: "شكل" الماضي

قبل أن ننظر حتى إلى نتائج الاختبارات، نظر المؤلفون إلى تاريخ آلاف هذه البرامج ليروا كيف تبدو "أوزان العملات" الخاصة بها عادةً. وقد وجدوا شكلين مختلفين تماماً:

  • تاريخ الروبوت (الكل أو لا شيء):
    تخيل الرسم البياني (Histogram) لجميع برامج الروبوت. يبدو كخطين عموديين عند الطرفين تماماً.

    • العمود الأول: معظم الروبوتات مثالية (نجاح بنسبة 100%).
    • العمود الثاني: معظم الروبوتات معطلة (نجاح بنسبة 0%).
    • المنتصف: لا يوجد شيء تقريباً. الروبوتات نادراً ما تكون "جيدة نوعاً ما". فهي إما مثالية أو تفشل تماماً.
    • التشبيه: إنه مثل مفتاح الضوء. إما "تشغيل" أو "إيقاف".
  • تاريخ المستقل المبدع (السحابة المنتشرة):
    تخيل الرسم البياني لجميع برامج المستقل المبدع. يبدو كسحابة واسعة ومسطحة في المنتصف.

    • هناك العديد من البرامج التي هي "صحيحة تقريباً" (70%، 80%، 90%).
    • هناك عدد قليل جداً من البرامج المثالية، وعدد قليل جداً من الإخفاقات الكلية.
    • التشبيه: إنه مثل مفتاح التحكم في شدة الإضاءة (Dimmer). معظم المستقلين المبدعين موجودون في مكان ما في المنتصف، وتتفاوت شدة إضاءتهم.

4. لماذا تخدعك بضعة اختبارات؟

يوضح هذا الاختلاف لماذا تكون بضعة اختبارات ناجحة مضللة للمستقل المبدع ولكنها مطمئنة للروبوت.

  • بالنسب للروبوت: إذا رأيته يجتاز 3 اختبارات، فأنت تعلم أنه من المرجح أن يكون واحداً من تلك "القمم المثالية". ولأن "المنطقة الوسطى" (حيث قد يكون جيداً فقط) غير موجودة، فإن اجتياز بضعة اختبارات هو ضمان قوي بأنه سيستمر في العمل.
  • للمستقل المبدع: إذا رأيته يجتاز 3 اختبارات، فقد يكون مجرد واحد من تلك البرامج "الجيدة نوعاً ما" التي حالفها الحظ. ولأن هناك سحابة ضخمة من البرامج "الجيدة نوعاً ما"، فإن اجتياز بضعة اختبارات لا يثبت أنه سيكون مثالياً لاحقاً. يمكنه بسهولة أن يفشل في الاختبار التالي.

5. الحل: RAP (أداة "البحث عن التشابه")

بما أننا لا نستطيع الوثوق ببضعة اختبارات للمستقل المبدع، فقد صمم المؤلفون أداة تسمى RAP (الرائد التقريبي السابق - Retrieved Approximate Prior).

فكر في RAP كأنه أمين مكتبة ذكي.

  1. المشكلة: لديك توجيه (Prompt) لمستقل مبدع جديد وبعض نتائج الاختبارات. أنت لا تعرف ما إذا كان جيداً أم لا.
  2. المكتبة: يمتلك RAP مكتبة ضخمة من "التوجيهات" و"المهام" الأخرى التي تم تجربتها من قبل.
  3. البحث: ينظر RAP إلى التوجيه الجديد الخاص بك ويسأل: "من في المكتبة يشبهك أكثر؟". إنه يجد التوجيهات الأخرى التي حلت مشكلات مشابهة.
  4. التنبؤ: بدلاً من التخمين بناءً على قاعدة عامة، ينظر RAP إلى كيفية أداء تلك التوجيهات "المشابهة" في الماضي. إنه يبني "خريطة تخمين" (Prior) مخصصة لتوجيهك أنت تحديداً.
  5. التحديث: بينما تقوم بتشغيل المزيد من الاختبارات، يقوم RAP بتحديث تخمينه.

النتيجة: RAP أفضل بكثير في التنبؤ بما إذا كان المستقل المبدع سينجح مقارنة بمجرد التخمين أو النظر إلى المكتبة بأكملها دفعة واحدة. إنه يتكيف مع نوع المهمة التي تقوم بها تحديداً.

الملخص

  • الروبوتات (الكود) ثنائية: إما مثالية أو معطلة. بضعة اختبارات تثبت أنها مثالية.
  • المستلون المبدعون (التوجيهات) متغيرون: غالباً ما يكونون "جيدين نوعاً ما". بضعة اختبارات لا تثبت مدى موثوقيتهم.
  • RAP يعالج هذا الأمر من خلال البحث عن أمثلة سابقة مشابهة لجعل تخمين أكثر ذكاءً حول مدى جودة عمل التوجيه الجديد، بدلاً من الاعتماد فقط على بضعة جولات اختبارية محظوظة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →