← أحدث الأبحاث
🤖 machine learning

Supplement Generation Training for Enhancing Agentic Task Performance

تقترح هذه الورقة "تدريب توليد الملحقات" (SGT)، وهي استراتيجية فعالة من حيث التكلفة تعمل على تدريب نموذج لغوي أصغر لتوليد نصوص تكميلية ديناميكية للنماذج التأسيسية الكبيرة، مما يعزز أداء المهام الوكيلية دون الحاجة إلى تدريب لاحق مكلف أو تعديل النموذج.

المؤلفون الأصليون: Young Min Cho, Daniele Bonadiman, Divya Bhargavi, Tamer Alkhouli, Salvatore Romeo, Dongwei Jiang, Khushbu Pahwa, Yubin Ge, Etsuko Ishii, Monica Sunkara, Yi Zhang

نُشر 2026-04-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Young Min Cho, Daniele Bonadiman, Divya Bhargavi, Tamer Alkhouli, Salvatore Romeo, Dongwei Jiang, Khushbu Pahwa, Yubin Ge, Etsuko Ishii, Monica Sunkara, Yi Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

المشكلة الكبرى: "العبقري المنهك"

تخيل أن لديك خبيراً عالمياً فذاً (لنسمِّه "المدير التنفيذي"). هذا الشخص يعرف كل شيء، يمكنه حل المسائل الرياضية المعقدة، كتابة الأكواد البرمجية، والإجابة على الأسئلة الفلسفية العميقة. ومع ذلك، هناك عقبتان كبيرتان:

  1. إنه مكلف: لا يمكنك استئجاره للعمل على كل مشكلة صغيرة تافهة.
  2. إنه مغلق: لا يمكنك تعليمه حِيلاً جديدة أو إعادة تدريبه لكل وظيفة جديدة لأنه نظام "مفتوح المصدر" (مثل الصندوق الأسود).

حالياً، إذا أردت استخدام هذا "المدير التنفيذي" لمهمة جديدة، عليك أن تكتب له مجموعة مثالية من التعليمات (Prompt). لكن كتابة التعليمات المثالية أمر صعب، وإذا تغيرت المهمة، عليك البدء من الصفر.

الحل: "المساعد الخارق"

يقترح مؤلفو هذه الورقة حلاً ذكياً. بدلاً من محاولة إعادة تدريب "المدير التنفيذي" المكلف، قاموا بتدريب "مساعد صغير، رخيص، وسريع" (نموذج ذكاء اصطناعي أصغر).

وظيفة المساعد ليست حل المشكلة بنفسه، بل وظيفته هي تحضير "المدير التنفيذي" للعمل.

فكر في الأمر كالتالي:

  • الطريقة القديمة: تسلم قضية قانونية معقدة مباشرة إلى المحامي (المدير التنفيذي) وتقول له: "حل هذه القضية". قد يغفل المحامي عن تفصيل ما لأن المعلومات السياقية لم تكن متاحة له.
  • الطريقة الجديدة (SGT): تسلم القضية إلى مساعد قانوني أولاً. يقرأ المساعد الملف، ويدرك أن المحامي يحتاج إلى ملخص محدد للأدلة، أو تحذيراً من أخطاء شائعة، أو خطة عمل خطوة بخطوة. يكتب المساعد هذه الملاحظات، ويرفقها بالملف، ثم يسلم الحزمة كاملة إلى المحامي.

سيقوم المحامي بحل القضية بشكل أفضل بكثير لأنه حصل على "ورقة غش" مثالية مصممة خصيصاً لتلك القضية بعينها.

كيف يتعلم المساعد؟ (التدريب)

تقدم الورقة طريقة تسمى "تدريب توليد الملحقات" (Supplement Generation Training - SGT). إليك كيف يعلمون المساعد:

  1. "الإحماء" (SFT): أولاً، يعرضون على المساعد أمثلة لأنواع مختلفة من الملاحظات التي يمكنه كتابتها (مثل: "هذا ملخص"، "هذه قائمة بالأخطاء التي يجب تجنبها"، "هذه خطة خطوة بخطوة"). هذا يعلم المساعد "تنسيق" كونه مفيداً.
  2. "التجربة والخطأ" (DPO): هذا هو الجزء السحري. يحاول المساعد كتابة ملاحظات لمشكلة ما، ويحاول "المدير التنفيذي" حلها.
    • إذا نجح المدير التنفيذي في حلها، يحصل المساعد على "نجمة ذهبية" (مكافأة).
    • إذا فشل المدير التنفيذي، يحصل المساعد على "علامة حمراء".
    • بمرور الوقت، يتعلم المساعد: "آه، عندما تتعلق المشكلة بالبرمجة، فإن كتابة 'قائمة بالأخطاء' هي الأفضل. وعندما تتعلق بالرياضيات، فإن 'الخطة الخطوة بخطوة' هي الأفضل".

يتعلم المساعد الاختيار الديناميكي لنوع الملحق المناسب للمشكلة المحددة، بدلاً من استخدام نفس الملحق لكل شيء.

النتائج: لماذا هذا مهم؟

اختبر الباحثون هذا النظام على خمس مهام صعبة مختلفة (مثل كتابة استعلامات قواعد البيانات، البرمجة، والإجابة على أسئلة عامة معقدة).

  • النتيجة: باستخدام هذا "المساعد الخارق" لتحضير "المدير التنفيذي"، أصبح النظام أفضل بنسبة 21% في حل المشكلات مقارنة بسؤال المدير التنفيذي مباشرة.
  • الكفاءة: قاموا بتدريب نموذج صغير جداً (1.7 مليار معلمة/Parameter) للقيام بهذا العمل التحضيري. وهذا أقل تكلفة وأسرع بكثير من محاولة إعادة تدريب النموذج الضخم (الذي قد يحتوي على مئات المليارات من المعلمات).

استراتيجية "البحث والتركيز"

أحد أروع الاكتشافات كان كيفية تعلم المساعد.

  • في البداية: حاول المساعد كل شيء. كتب ملخصات، وقوائم، وخطط، وأعاد صياغة الأسئلة بشكل عشوائي. كان يشبه طباخاً يتذوق كل التوابل.
  • لاحقاً: بدأ المساعد "بالتركيز". أدرك أنه بالنسبة لمهام البرمجة، فإن "التحذير من الأخطاء" هو أفضل توابل. وبالنسبة للألغاز المنطقية، فإن "مقارنة الإجابات الصحيحة والخاطئة" هي أفضل توابل.

لقد توقف عن التخمين وبدأ يتحول إلى خبير متخصص في تحضير "المدير التنفيذي".

الملخص

تدريب توليد الملحقات (SGT) هو وسيلة لجعل نماذج الذكاء الاصطناعي الكبيرة والمكلفة أكثر ذكاءً دون تغييرها. أنت تقوم بتدريب ذكاء اصطناعي صغير ورخيص ليعمل كـ "مدرب سياقي". يقرأ هذا المدرب سؤال المستخدم، ويحدد بالضبط نوع المساعدة الإضافية التي يحتاجها الذكاء الاصطناعي الكبير (مثل ملخص، أو تحذير، أو خطة)، ثم يكتب ذلك ويمرره. بعد ذلك، يستخدم الذكاء الاصطناğu الكبير هذه المساعدة الإضافية لتقديم إجابة أفضل بكثير.

إنه الفرق بين إرسال جنرال إلى المعركة بخريطة غامضة، وبين إرساله مع إيجاز تكتيكي مفصل ومحدث كتبه ضابط استخبارات متخصص.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →