← أحدث الأبحاث
💬 NLP

Inference-Aware Prompt Optimization for Aligning Black-Box Large Language Models

تقدم هذه الورقة إطار عمل IAPO، وهو إطار عمل مبتكر يعمل على تحسين المطالبات واستراتيجيات توسيع الاستدلال (مثل أخذ عينات Best-of-N) بشكل مشترك لتحقيق توافق أفضل بين النماذج اللغوية الكبيرة ذات الصندوق الأسود وتفضيلات المستخدم والميزانيات الحسابية.

المؤلفون الأصليون: Saaduddin Mahmud, Mason Nakamura, Kyle Hollins Wray, Shlomo Zilberstein

نُشر 2026-02-11
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Saaduddin Mahmud, Mason Nakamura, Kyle Hollins Wray, Shlomo Zilberstein

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف طباخاً محترفاً ليطهو من أجل حفلة كبيرة. لديك طريقتان لضمان أن يكون الطعام مثالياً:

  1. الوصفة (المطالبة - The Prompt): يمكنك إعطاء الطباخ وصفة محددة للغاية.
  2. التذوق (توسيع الاستدلال - Inference Scaling): يمكنك أن تطلب من الطباخ طهي خمس نسخ مختلفة من الطبق، ثم اختيار الأفضل بينها.

حتى الآن، حاول معظم الناس حل هذه المشكلة بالتركيز على شيء واحد فقط. فإما أن يقضوا كل وقتهم في إتقان الوصفة، أو يكتفون بقول: "اصنع عشر نسخ واختبر الأفضل".

المشكلة؟ إنهما لا يتواصلان مع بعضهما البعض. فالوصفة التي تعمل بشكل مثالي لطبق سريع واحد قد تكون في الواقع وصفة "سيئة للغاية" إذا كان الطباخ يخطط لصنع عشر نسخ واختيار الأفضل. بعض الوصفات "مستقرة" ومتسقة، بينما البعض الآخر "عالي المخاطر وعالي المكافأة"؛ أي أنها قد تفشل كثيراً، ولكن عندما تنجح، تكون مذهلة.

تقدم هذه الورقة البحثية IAPO، وهي طريقة لتحسين كل من الوصفة وعملية التذوق في آن واحد.

الفكرة الجوهرية: "منظم الحفلات الذكي"

فكر في IAPO كـ منظم حفلات ذكي. بدلاً من مجرد اختيار وصفة، ينظر المنظم إلى حالتك الخاصة ("السياق"):

  • ميزانيتك: "ليس لدي سوى 50 دولاراً للمكونات".
  • تفضيلاتك: "أهتم بأن يكون الطعام صحياً أكثر من اهتمامي بكونه فاخراً".

المنظم الذكي لا يختار وصفة فحسب؛ بل يقرر: "بما أن ميزانيتك محدودة، سأستخدم هذه الوصفة البسيطة والموثوقة وسأصنع نسخة واحدة فقط. ولكن بما أن ميزانيتك ضخمة وتريد المثالية، فسأستخدم هذه الوصفة المعقدة والتجريبية وسأصنع 20 نسخة، ثم أختار الأفضل على الإطلاق".

السر الخفي: PSST (طريقة "التقليم")

كيف يتعلم المنظم أي وصفة وأي استراتيجية تذوق هي الأفضل دون إضاعة كل أموالك في اختبار كل تركيبة ممكنة؟ إنهم يستخدمون طريقة تسمى PSST (توسيع المطالبة عبر التقليم المتتالي).

تخيل أن لديك 100 وصفة مختلفة لتجربتها. ليس لديك المال لطهي جميع النسخ المائة لكل وصفة من الوصفات المائة.

بدلاً من ذلك، يقوم المنظم بـ "بطولة النكهات":

  1. الجولة الأولى: يطبخون كمية صغيرة جداً من كل وصفة.
  2. الاستبعاد: يستبعدون فوراً الـ 50% الأدنى من الوصفات التي كان مذاقها سيئاً.
  3. الجولة الثانية: يأخذون "الناجين" المتبقين ويطبخون لهم حصة أكبر قليلاً.
  4. الاستبعاد: يرمون النصف الأدنى مرة أخرى.
  5. النهائي: يستمرون في القيام بذلك حتى تبقى فقط الوصفة البطلة والكمية المثالية من "التذوق".

من خلال "تقليم" الخاسرين مبكراً، يوفرون مبلغاً هائلاً من المال (أو "الميزانية الحسابية") مع الاستمرار في العثور على أفضل طريقة لإشباع جوعك.

لماذا يهم هذا الأمر؟

في عالم الذكاء الاصطناًعي (النماذج اللغوية الكبيرة)، "الطهي" يكلف مالاً وكهرباء.

  • الطريقة القديمة: كان الناس إما بخلاء للغاية (نتائج سيئة) أو مسرفين للغاية (إنفاق الكثير من المال).
  • طريقة IAPO: يصبح الذكاء الاصطناعي "واعياً بالاستدلال". فهو يدرك أنه إذا طُلب منه "التفكير بعمق أكبر" (توليد عينات أكثر)، فعليه استخدام مجموعة مختلفة من التعليمات عما لو طُلب منه تقديم إجابة سريعة بلمسة واحدة.

باخت-القول: تعلم هذه الورقة البحثية الذكاء الاصطناعي كيف يكون فعالاً، مما يجعله أكثر ذكاءً عندما يكون لديه وقت للتفكير، وأكثر موثوقية عندما يحتاج إلى السرعة، كل ذلك مع احترام ميزانية المستخدم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →