← أحدث الأبحاث
🤖 machine learning

Efficient Multi-objective Prompt Optimization via Pure-exploration Bandits

تتناول هذه الورقة الطبيعة متعددة الأوجه لأداء الأوامر البرمجية (prompts) من خلال صياغة اختيار الأوامر كمسألة "بانديت" استكشاف نقي متعددة الأهداف، مقترحةً خوارزميات مبتكرة لاستعادة مجموعة باريتو وتحديد أفضل أمر برمجي قابل للتنفيذ، وهي خوارزميات مضمونة نظرياً ومثبتة تجريبياً في تفوقها على النماذج المرجعية الحالية عبر نماذج لغوية كبيرة متعددة.

المؤلفون الأصليون: Donghao Li, Chengshuai Shi, Weijuan Ou, Cong Shen, Jing Yang

نُشر 2026-05-15
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Donghao Li, Chengshuai Shi, Weijuan Ou, Cong Shen, Jing Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك طاهٍ يحاول العثور على الوصفة المثالية لطبق جديد. لديك كتاب طهي ضخم يحتوي على آلاف الوصفات المحتملة (المطالبات/Prompts)، ولكن ليس لديك سوى قدر محدود من الوقت والمكونات ("الميزانية") لاختبارها.

في عالم النماذج اللغوية الكبيرة (LLMs)، هذه "الوصفات" هي التعليمات التي نعطيها للذكاء الاصطناعي. تكمن المشكلة في أن "الوصفة الجيدة" لا تتعلق فقط بالمذاق (الدقة)؛ بل يجب أن تكون أيضاً سريعة الطهي (الإيجاز)، وصحية (الأمان)، وغير مكلفة (التكلفة). لقد حاولت معظم الطرق السابقة العثور على أفضل وصفة من خلال النظر إلى شيء واحد فقط، مثل المذاق. ولكن في الحياة الواقعية، غالباً ما يتعين عليك موازنة المقايضات: فقد يكون ألذ طبق يستغرق وقتاً طويلاً جداً للطهي، أو قد يكون الأسرع طهياً بلا طعم.

هذه الورقة البحثية، بعنوان "تحسين المطالبات متعدد الأهداف بكفاءة عبر خوارزميات البنديت القائمة على الاستكشاف الصرف" (Efficient Multi-Objective Prompt Optimization via Pure-Exploration Bandits)، تقترح طريقة أذكى للعثور على أفضل التعليمات للذكاء الاصطناعي عندما يتعين عليك الموازنة بين عدة أهداف في وقت واحد، مع مراعاة ضيق الوقت.

إليك تفصيل نهجهم باستخدام تشبيهات بسيطة:

1. المشكلة: معضلة "المذاق مقابل السرعة"

يشير المؤلفون إلى أن تقييم مطالبات الذاء الاصطناعي يشبه تقييم سيارة. لا يمكنك فقط النظر إلى مدى سرعتها (الدقة)؛ بل تحتاج أيضاً إلى فحص كمية الوقود التي تستهلكها (الإيجاز) أو ما إذا كانت آمنة (القيود).

  • الطريقة القديمة: حاولت الأساليب السابقة دمج كل هذه العوامل في درجة واحدة (مثل قول "السرعة ناقص تكلفة الوقود"). هذا غالباً ما يفتقر إلى الدقة. فأحياناً تريد أسرع سيارة، حتى لو كانت تستهلك الكثير من الوقود، طالما أنها لا تنفجر (قيد السلامة).
  • الهدف الجديد: تسعى الورقة للوصول إلى شيئين محددين:
    1. أفضل مطالبات قابلة للتنفيذ (Best Feasible Prompt): وهي الوصفة الأفضل على الإطلاق التي لا تزال تلبي حداً صارماً من السلامة أو السرعة (مثلاً: "جد ألذ طبق يستغرق أقل من 10 دقائق").
    2. مجموعة باريتو (Pareto Set): وهي قائمة "أفضل المقايضات الممكنة". هذه عبارة عن وصفات حيث لا يمكنك تحسين شيء واحد (المذاق) دون جعل شيء آخر أسوأ (السرعة). إنها قائمة بأفضل المنافسين الذين يمثلون التوازن الأمثل.

2. الحل: استراتيجية "قائمة التذوق" (Bandits)

يعامل المؤلفون هذه المشكلة كأنها لعبة عرض تسمى "المتعدد الأذرع" (Multi-Armed Bandit). تخيل صفاً من آلات القمار (المطالبات). لديك عدد محدود من العملات المعدنية (الميزانية) لسحب الأذرع. تريد العثور على أفضل آلة دون إضاعة كل عملاتك على الخاسرين.

لقد قدموا خوارزميتين جديدتين لإدارة هذه اللعبة:

أ. GENSEC: "لعبة الاستبعاد" للقيود

اعتبر هذا بمثبة "تصفيات خروج المغلوب" للعثور على أفضل مطالبات قابلة للتنفيذ.

  • كيف تعمل: تبدأ بـ 100 وصفة. تتذوق القليل من كل منها.
  • اللمسة المميزة: في كل جولة، تقوم فوراً باستبعاد الوصفات التي يتضح أنها بطيئة جداً (تخالف القيد) أو التي يتضح أن مذاقها أسوأ من الوصفة الرائدة الحالية.
  • السحر: بدلاً من معاملة كل وصفة كشيء فريد ومنفصل تماماً، تلاحظ هذه الخوارزمية أن الوصفات غالباً ما تشترك في "مكونات" (سمات). إذا كانت الوصفة (أ) والوصفة (ب) تستخدمان "الثوم"، وتعلمت شيئاً عن الثوم من الوصفة (أ)، يمكنك التنبؤ بشيء عن الوصفة (ب). هذا يسمح لهم بالتعلم بشكل أسرع، مثل الطاهي الذي يعرف أنه إذا كان طبق غني بالثوم مالحاً جداً، فمن المرجح أن يكون طبق آخر غني بالثوم مالحاً أيضاً.
  • النتيجة: وجدوا أن هذه الطريقة تستعيد 80-90% من الدرجة المثالية المحتملة، بينما الطرق القديمة (التذوق العشوائي فقط) لم تصل إلا إلى 20-50%.

ب. GENPSI: "صانع الخرائط" للمقايضات

صُممت هذه الخوارزمية للعثور على مجموعة باريتو (قائمة أفضل المقايضات).

  • كيف تعمل: بدلاً من البحث عن فائز واحد، تحاول رسم "الحدود" للاحتمالات. تسأل: "أي الوصفات مميزة لدرجة أنه لا يمكنك تحسين مقياس واحد دون الإضرار بمقياس آخر؟"
  • الاستراتيجية: تستخدم عملية استبعاد مماثلة ولكنها تنظر إلى "الفجوة" بين الوصفات. إذا كانت هناك وصفة تتفوق عليها وصفة أخرى في كل شيء (أقل جودة في كل المعايير)، يتم استبعادها. أما إذا كانت تمثل مقايضة فريدة (سرعة رائعة، ومذاق مقبول)، فإنها تبقى.
  • النتيجة: استعادت هذه الطريقة أكثر من 90% من "الحجم الفائق" (Hypervolume - وهو مصطلح تقني يعني المساحة الإجمالية للمقايضات الجيدة) مقار بالحقيقة الأرضية، بينما نجحت النماذج المرجعية في تحقيق حوالي 80% فقط.

3. "الخلطة السرية": التعلم من الروابط

جزء رئيسي من نجاحهم هو إدراك أن المطالبات ليست عشوائية؛ بل هي مرتبطة ببعضها البعض.

  • التشبيه: تخيل أنك تختبر 100 سيارة مختلفة. إذا اختبرت سيارة رياضية حمراء ووجدتها سريعة، فلست بحاجة لاختبار كل سيارة رياضية حمراء من الصفر. أنت تعلم أنها تشترك في نوع المحرك.
  • نهج الورقة: يستخدمون "خريطة سمات" (مثل بصمة الإصبع للمطالبة) لرؤية هذه الروابط. ومن خلال استخدام شبكة عصبية (MLP) لفهم هذه الأنماط المشتركة، تتعلم خوارزمياتهم بشكل أسرق بكثير من الطرق التي تعامل كل مطالبة كجزيرة منعزلة.

4. الإثبات: "اختبار المطبخ"

اختبر المؤلفون هذا في مطبخ حقيقي (باستخدام نماذج ذكاء اصطناعي حقيقية مثل Llama-3 و Gemma) مع وصفات حقيقية (تلخيص الأخبار).

  • الإعداد: كان عليهم تلخيص الأخبار (الدقة) مع الحفاظ على قصر الملخص (الإيجاز).
  • النتيجة: نجح "طهاة البنديت" (GENSEC و GENPSI) باستمرار في العثور على مطالبات أفضل، وأكثر أماناً، وأكثر توازناً من "المتذوق العشوائي" (Uniform) أو الطرق القياسية الأخرى، خاصة عندما كان لديهم وقت (ميزانية) ضئيل جداً للاختبار.

ملخص

باختصار، تقول هذه الورقة: "توقف عن التخمين العشوائي وتوقف عن النظر إلى رقم واحد فقط."

من خلال معاملة اختيار المطالبات كلعبة استراتيجية حيث تستبعد الخيارات السيئة مبكراً وتتعلم من التشابهات بين المطالبات المختلفة، يمكنك العثور على التوازن المثالي بين الدقة والسرعة والأمان بشكل أسرع بكثير وبمحاولات أقل. إنه يشبه امتلاك مساعد طاهٍ ذكي يعرف أنه إذا كان أحد الأطباق مالحاً جداً، فمن المرجح أن يكون الطبق التالي مالحاً أيضاً، مما يوفر عليك عناء تذوق كل طبق في كتاب الطهي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →