How to Train Your Advisor: Steering Black-Box LLMs with Advisor Models
تقدم هذه الورقة "نماذج المستشار" (Advisor Models)، وهي طريقة لتدريب نماذج صغيرة مفتوحة الأوزان لتوليد نصائح لغوية طبيعية ديناميكية لكل حالة على حدة، مما يعمل بفعالية على توجيه وتعزيز أداء النماذج اللغوية الكبيرة الأمامية غير القابلة للوصول (black-box) من خلال التحسين البارامتري دون تعديل أوزانها.
المؤلفون الأصليون:Parth Asawa, Alan Zhu, Abigail O'Neill, Matei Zaharia, Alexandros G. Dimakis, Joseph E. Gonzalez
تخيل أن لديك طباخاً عبقرياً عالمياً (النموذج الصندوق الأسود - Black-Box Model، مثل GPT-5 أو Gemini) يعمل في مطبخ مغلق وعالي التأمين. لا يمكنك لمس المكونات، ولا يمكنك تغيير وصفاتهم، ولا يمكنك حتى رؤية كيف يقطعون الخضروات. يمكنك فقط إرسال ملاحظة إليه بطلبك (المطالبة - Prompt).
عادةً، إذا كنت تريد طبقاً معيناً، فعليك كتابة ملاحظة طويلة ومثالية. ولكن إذا ارتكبت خطأً في الملاحظة، فقد يصنع الطباخ طبقاً رائعاً، أو قد يرتبك. وإذا أردت من الطباخ أن يتكيف مع ذوقك الخاص في كل مرة، فإن كتابة ملاحظة مثالية جديدة لكل طلب أمر مرهق وغالباً ما يفشل.
نماذج المستشار (ADVISOR MODELS) هي بمثابة توظيف مساعد طباخ صغير وذكي (المستشار - Advisor) يقف تماماً خارج باب ذلك المطبخ المغلق.
إليك كيف يعمل الأمر، خطوة بخميل:
1. الإعداد: مهمة مساعد الطباخ
بدلاً من محاولتك كتابة الملاحظة المثالية للطباخ الرئيسي، تطلب من مساعد الطباخ أن ينظر إلى طلبك ويكتب نصيحة مخصصة للطباخ الرئيسي.
الطباخ الرئيسي (الصندوق الأسود): لا يزال يعمل بنفس الطريقة تماماً. لا يمكنك تغيير عقله أو تدريبه. هو فقط يتبع الملاحظة التي يتلقاها.
مساعد الطخاب (المستشار): هذا نموذج أصغر وأرخص، مفتوح المصدر. مهمته الوحيدة هي النظر في الطلب المحدد وقول: "مهلاً، بالنسبة لهذا الطلب تحديداً، يجب على الطباخ الرئيسي تجربة القيام بـ س، ص، و ز".
2. التدريب: التعلم من خلال الممارسة
كيف يتعلم مساعد الطخاب تقديم نصائح جيدة؟
الحلقة: تعطي مساعد الطخاب مهمة. يكتب مساعد الطخاب نصيحة. يقرأ الطباخ الرئيسي النصيحة ويطبخ الوجبة.
التقييم: إذا كانت الوجبة لذيذة (تم حل المهمة بشكل صحيح)، يمنح النظام مساعد الطخاب "إبهاماً للأعلى". إذا احترقت الوجبة، يحصل على "إبهام للأسفل".
الدرس: يتعلم مساعد الطخاب من هذه التقييمات. مع مرور الوقت، يتوقف عن تقديم نصائح غامضة مثل "اطبخ جيداً" ويبدأ في تقديم نصائح محددة وقابلة للتنفيذ مثل "تحقق من درجة حرارة الموقد" أو "استخدم 10 كلمات بالضبط لهذه المراجعة".
3. الخدعة السحرية: "مساعد الطباخ الرخيص" يساعد "الطباخ الغالي"
هذا هو الادعاء الأكبر للورقة البحثية. أنت لا تحتاج لتدريب مساعد الطخاب باستخدام الطباخ الرئيسي الغالي والعالمي.
يمكنك تدريب مساعد الطخاب باستخدام طباخ أرخص وأصغر (مثل GPT-4o mini).
بمجرد أن يتعلم مساعد الطخاب كيفية تقديم نصائح رائعة للطباخ الرخيص، يمكنك أخذ نفس مساعد الطخاب المدرب ووضعه أمام الطخاب الرئيسي الغالي والعالمي (مثل GPT-5).
النتيجة: فجأة يصبح الطباخ الغالي أفضل في مهام محددة، رغم أنه لم يتم تدريبه أبداً! النصائح واضحة ومفيدة جداً لدرجة أن الطباخ الكبير يفهمها تماماً.
أمثلة من الواقع من الورقة البحثية
اختبر المؤلفون نظام "مساعد الطخاب" هذا في ثلاثة مطابخ مختلفة:
مطبخ الضرائب (RuleArena Taxes):
المشكلة: الطباخ الرئيسي بارع في الطبخ العام ولكنه يرتبك بسبب قواعد الضرائب المعقدة.
الحل: تعلم مساعد الطخاب المدرب تقديم تعليمات محددة حول كيفية حساب الضرائب.
النتيجة: قفزت دقة الطباخ الرئيسي من 67% إلى 85%.
مطبخ إصلاح البرمجيات (SWE Agent):
المشكلة: كان الطباخ يستغرق خطوات كثيرة لإصلاح كود برمجي مكسور (مثل فحص كل درج في المطبخ).
الحل: تعلم مساعد الطخاب أن يقول: "لا تفحص الأدراج؛ فقط استخدم أمر البحث للعثور على الجزء المكسور".
النتيجة: أصلح الطباخ الكود أسرع بنسبة 24% دون ارتكاب المزيد من الأخطاء.
مطبخ الذوق الشخصي (التخصيص):
المشكلة: لديك 5 أصدقاء مختلفين. أحدهم يحب المراجعات القصيرة، والآخر يحب الطويلة، وآخر يكره المسائل الرياضية. الطباخ الرئيسي لا يعرف هذا.
الحل: تعلم مساعد الطخاب قراءة التفضيلات "الخفية" لكل صديق وإخبار الطباخ بما يجب فعله بالضبط.
النتيجة: تعلم النظام هذه التفضيلات الخفية بدقة شبه مثالية (94-99%)، بينما فشلت الطرق القياسية تماماً.
لماذا هذا مهم (وفقاً للورقة البحثية)
لا حاجة للجراحة: لا تحتاج لفتح دماغ الطباخ الرئيسي (تعديل أوزانه) لتحسينه. أنت فقط تعطيه تعليمات أفضل.
لا نسيان: نظرًا لأن دماغ الطباخ الرئيسي لا يتغير، فإنه لا ينسى كيفية القيام بالأشياء الأخرى. يظل جيداً في كل ما كان جيداً فيه أصلاً.
فعالية التكلفة: من الأرخص بكثير تدريب مساعد الطخاب الصغير على نموذج رخيص ثم "نقل" تلك المهارات إلى النموذج الغالي، بدلاً من محاولة تدريب النموذج الغالي مباشرة.
باختصار: نماذج المستشار (ADVISOR MODELS) هي طريقة لتدريب مساعد صغير وذكي لكتابة تعليمات أفضل لذكاء اصطناعي ضخم ومغلق، مما يجعل ذلك الذكاء الاصطماعي الضخم أكثر ذكاءً، وسرعة، وتخصيصاً دون المساس بشفرته الداخلية أبداً.
ملخص تقني: توجيه النماذج اللغوية الكبيرة ذات الصندوق الأسود باستخدام "نماذج المستشار" (ADVISOR MODELS)
بيان المشكلة
تُستخدم النماذج اللغوية الكبيرة (LLMs) الرائدة، مثل GPT-5 وClaude 4.5، بشكل متزايد كخدمات واجهة برمجة تطبيقات (API) ذات "صندوق أسد" (Black-box)، حيث لا يمكن الوصول إلى أوزان النموذج. هذه البنية تجعل الضبط الدقيق التقليدي (Fine-tuning) مستحيلاً. وبينما يوفر تحسين المطالبات الثابتة (مثل إيجاد مطالبة واحدة ثابتة لجميع الحالات) حلاً مؤقتاً، إلا أنه يفشل في التكيف مع المدخلات المتنوعة، ويواجه قيوداً تتعلق بطول السياق، ولا يمكنه التعامل بفعالية مع التخصص العميق (مثل اتباع القواعد المعقدة، أو اللغات ذات الموارد المحدودة) أو التخصيص الديناميكي (مثل تفضيلات المستخدمين المتباينة). تعتمد الطرق الحالية لتدريب نماذج خفيفة الوزن لتعديل المطالبات غالباً على خبراء بشريين للوسم، وتنتج مخرجات ثابتة لفئات كاملة من المشكلات، أو تستخدم مطالبات ناعمة (Soft prompts) غير قابلة للتفسير. هناك حاجة ماسة إلى طريقة لتحسين النماذج ذات الصندوق الأسود بارامترياً دون الحاجة للوصول إلى الأوزان، بحيث تكون قادرة على توليد إرشادات خاصة بكل حالة لتحسين الأداء مع الحفاظ على المتانة.
المنهجية: نماذج المستشار (ADVISOR MODELS)
يقدم البحث إطار عمل ADVISOR MODELS، وهو إطار يدرب نموذج "مستشار" خفيف الوزن ومفتوح الأوزان لتوليد نصائح لغوية طبيعية ديناميكية لكل حالة على حدة. يتم حقن هذه النصائح في سياق نموذج "طالب" (Student) ثابت وذات صندوق أسود لتوجيه سلوكه.
البنية الأساسية
خط الإنتاج (Pipeline): يقع المستشار بين مدخلات المستخدم وطالب الصندوق الأسود. يتلقى المستشار مطالبة المهمة (ويمكنه اختيارياً تلقي محاولات أولية من الطالب أو ملاحظات بيئية) ثم يولد إرشادات محددة.
التدريب عبر التعلم التعزيزي (RL): يعامل النظام هندسة المطالبات كمسألة تعلم تعزيزي.
يقوم المستشار بأخذ عينات من النصائح المرشحة.
يولد الطالب (الصندوق الأسود) مخرجاً مشروطاً بهذه النصيحة.
يتم حساب مكافأة خاصة بالمهمة بناءً على المخرج النهائي (مثل: الصحة، الكفاءة، أو التوافق مع التفضيلات).
يتم تحديث المستشار باستخدام "تحسين السياسة النسبي للمجموعات" (GRPO) بناءً على هذه المكافآت المرصودة فقط. لا يتطلب ذلك أي تدرجات (Gradients) من نموذج الصندوق الأسود.
متغيرات التصميم:
مرحلتان (2-Step): يولد المستشار نصيحة بناءً على مطالبة الإدخال؛ ثم يولد الطالب الاستجابة النهائية.
ثلاث مراحل (3-Step): يولد الطالب محاولة أولية؛ يقدم المستشار نصيحة للتحقق أو التصحيح؛ ثم يولد الطالب استجابة منقحة. يبسط هذا المتغير دور المستشار ليصبح دور "المُحقِّق"، وهو ما أثبت فعالية في المهام المعقدة مثل اتباع قواعد الضرائب.
متعدد الجولات (Multi-Turn): للمهام الوكيلية (Agentic tasks) (مثل هندسة البرمجيات)، يمكن للمستشار تقديم نصائح تكرارية بناءً على أفعال الطالب والملاحظات البيئية عبر جولات متعددة.
الآليات الرئيسية
التحسين البارامتري: على عكس المطالبات الثابتة، يتعلم المستشار سياسة لتوليد نصائح مخصصة لكل حالة.
القابلية للنقل (Transferability): يتم تدريب المستشارين على نماذج طلاب منخفضة التكلفة (مثل GPT-4o mini أو Gemini 2.5 Flash)، ويمكن نقلهم لتحسين النماذج الرائدة (مثل GPT-5 أو Gemini 3 Pro) دون الحاجة لإعادة التدريب.
المتانة (Robustness): بما أن أوزان نموذج الصندوق الأسود تظل دون تغيير، فإن النظام يتجنب "النسيان الكارثي" ويحافظ على الأداء في المهام غير التي تم التدريب عليها.
المساهمات الرئيسية
نموذج جديد: تقديم سياسة قابلة للتدريب (المستشار) لتوجيه النماذج الرائدة ذات الصندوق الأسود ديناميكياً، مما يعيد صياغة هندسة المطالبات من مسألة بحث ثابتة إلى مسألة "تعلم تقديم النصيحة".
مكاسب الأداء: إثبات أن ADVISOR MODELS تتفوق بشكل كبير على أدوات تحسين المطالبات الثابتة (مثل GEPA وProfile-Augmented Generation) في مهام الاستدلال المتخصص والتخصيص.
القابلية للنقل وكفاءة التكلفة: إثبات أن المستشارين الذين تم تدريبهم على نماذج رخيصة ينقلون تحسينات جوهرية إلى النماذج الرائدة، مما يتيح تحسيناً فعالاً من حيث التكلفة دون التفاعل المباشر مع واجهات برمجة التطبيقات (APIs) الباهظة أثناء التدريب.
المتانة: التحقق التجريبي من أن الطريقة تحسن قدرات محددة دون إضعاف الأداء العام في الاختبارات المعيارية الأخرى.
النتائج التجريبية
الاستدلال المتخصص
قيم المؤلفون ADVISOR MODELS في ثلاثة مجالات تفتقر فيها النماذج الرائدة إلى المعرفة المتخصصة:
RuleArena (الضرائب): المستشار المدرب على GPT-4.1 mini حسن دقة GPT-5.2 في تقديم الإقرارات الضريبية من 67.2% إلى 85.6% (+27.4%). فشلت أدوات التحسين الثابتة في مضاهاة خط الأساس المستقل.
كفاءة وكيل البرمجيات (SWE Agent): باستخدام Gemini 2.5 Flash كطالب، قلل المستရှင် المدرب متوسط الخطوات التي اتخذها Gemini 3 Pro لحل المشكلات البرمجية من 31.7 إلى 26.3 (انخفاض بنسبة 24.6%) مع الحفاظ على نفس معدل الحل.
MTOB (الترجمة الآلية): لترجمة لغة "كالامانغ" (Kalamang) ذات الموارد المحدودة، رفع المستشار أداء GPT-4o mini من درجة chrF بلغت 33.1 إلى 45.8، مقترباً من أداء الخبراء البشر (51.6).
التخصيص
في المهام التي تتطلب تعلم تفضيلات المستخدم الخفية (طول المراجعة، مستوى المراجعة، الحلول الرياضية):
حققت ADVISOR MODELS توافقاً شبه تام مع التفضيلات الكامنة (على سبيل المثال، 0.94 مكافأة لطول المراجعة، و99.6% دقة لمستوى المراجعة).
فشلت المحسنات الثابتة (GEPA, PAG) وحتى المطالبات المرجعية داخل السياق (التي توفر تفاصيل التفضيلات الكاملة) في مضاهاة هذا الأداء، حيث حققت غالباً تحسينات طفيفة فقط فوق خطوط الأساس.
نجحت المستشارات المدربة على GPT-4o mini في الانتقال لتخصيص مخرجات GPT-5.
دراسات الاستبعاد (Ablation Studies)
القابلية للنقل: نجحت المستشارات المدربة على عائلة نماذج واحدة (مثل GPT) في تحسين نماذج من عائلة أخرى (مثل Claude)، مما يثبت قابلية النصائح المولدة للتفسير.
المتانة: لم تظهر خطوط الإنتاج المدربة على مهام التخصيص أي تراجع في الدقة في اختبارات الرياضيات غير المرتبطة (MATH-500) عند تطبيقها على النماذج الرائدة.
الحدود: لا تقدم الطريقة أي مكاسب كبيرة في المجالات التي وصلت فيها النماذج الرائدة بالفعل إلى ذروة أدائها (مثل حل المسائل الرياضية القياسية)، مما يؤكد أن المستشار يتعلم فقط حيث توجد فجوات معرفية.
الأهمية والادعاءات
يفترض البحث أن ADVISOR MODELS تقدم حلاً عملياً وفعالاً من حيث التكلفة للتحدي المتزايد المتمثل في تخصيص نماذج الصندوق الأسود الرائدة. من خلال فصل عملية التحسين (تدريب المستشار) عن هدف الاستدلال (الطالب ذو الصندوق الأسود)، تتيح الطريقة:
التخصص: تعزيز القدرات في المجالات ذات البيانات التدريبية المسبقة الشحيحة (مثل قوانين الضرائب المحددة، أو اللغات ذات الموارد المحدودة).
التخصيص: تعلم تفضيلات المستخدم المعقدة والمحددة لكل حالة والتي لا تستطيع المطالبات الثابتة التقاطها.
الأمان والاستقرار: تجنب المخاطر المرتبطة بالضبط الدقيق المباشر، مثل النسيان الكارثي، من خلال إبقاء النموذج الأساسي ثابتاً.
يؤكد المؤلفون أنه بينما يظل التعلم التعزيزي المباشر على النماذج مفتوحة الأوزان هو "المعيار الذهبي" للأداء، فإن ADVISOR MODELS تستعيد معظم هذه المكاسب في بيئات الصندوق الأسود، مما يجعل التحسين عالي المستوى متاحاً دون الحاجة للوصول إلى أوزان واجهة برمجة التطبيقات. يشير العمل إلى نموذج جديد يصبح فيه "تعلم تقديم النصيحة" هو الآلية الأساسية لتكييف أنظمة الذكاء الاصطناዊ الرائدة مع الاحتياجات المحددة والمتطورة.