← أحدث الأبحاث
💬 NLP

GFlowPO: Generative Flow Network as a Language Model Prompt Optimizer

تُعد GFlowPO إطار عمل لتحسين الأوامر النصية يتميز بكفاءة العينة، حيث يجمع بين شبكة تدفق توليدية خارج السياسة لضبط نموذج لغوي للأوامر النصية وبين آلية تحديث ذاكرة ديناميكية خالية من التدريب لتركيز البحث تدريجياً على الأوامر النصية ذات المكافأة العالية، متفوقاً بذلك على النماذج المرجعية للتحسين المنفصل الموجودة عبر مهام متنوعة.

المؤلفون الأصليون: Junmo Cho, Suhan Kim, Sangjune An, Minsu Kim, Dong Bok Lee, Heejun Lee, Sung Ju Hwang, Hae Beom Lee

نُشر 2026-02-04
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Junmo Cho, Suhan Kim, Sangjune An, Minsu Kim, Dong Bok Lee, Heejun Lee, Sung Ju Hwang, Hae Beom Lee

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت ذكي جداً ولكنه حرفي للغاية كيفية حل لغز ما. الروبوت قوي، لكنه يحتاج إلى مجموعة التعليمات الصحيحة (الـ "prompt") ليعطيك أفضل إجابة. المشكلة هي أن هناك مليارات الطرق الممكنة لكتابة تلك التعليمات، واختبار كل واحدة منها بطيء ومكلف.

إن العثور على التعليمات المثالية يشبه عادةً محاولة العثض على إبرة معينة في كومة قش ضخمة ومظلمة عن طريق التقاط حفنات عشوائية من القش. إذا التقطت حفنة ولم تكن هي الإبرة، فعليك التخلص منها والمحاولة مرة أخرى. هذا بطيء، وقد تفوتك أفضل الإبر لأنك تنظر فقط في البقعة التي التقطت منها للتو.

تقدم الورقة البحثية طريقة جديدة تسمى GFLOWPO لحل هذه المشكلة. فكر في الأمر كأنك تعطي الروبوت "خريطة ذكية" و"بنك ذاكرة" ليجد أفضل التعليمات بشكل أسرع بكثير.

إليك كيف يعمل ذلك، مقسماً إلى خطوتين رئيسيتين:

الخطوة 1: "المنقب الذكي" (GFlowNet)

معظم الطرق القديمة تشبه شخصاً لا يلتقط القش إلا من البقعة التي يقف فيها تماماً في اللحظة الحالية. إذا أسقط حفنة سيئة، فإنه ينساها فوراً ويمضي قدماً. وهذا ما يسمى بـ "التعلم القائم على السياسة" (on-policy learning)، وهو أمر غير فعال للغاية.

تستخدم GFLOWPO تقنية تسمى GFlowNet، وهي تشبه المنقب الذكي.

  • التشبيه: تخيل أن المنقب لديه حقيبة ظهر (مخزن إعادة التشغيل - "replay buffer"). في كل مرة يلتقط فيها حفنة من القش، يتحقق مما إذا كانت جيدة. حتى لو لم تكن هي الإبرة المثالية، فإنه يحتفظ بها في حقيبة ظهره.
  • الفائدة: لاحقاً، بدلاً من النظر فقط إلى ما يحمله في يده الآن، يمكنه سحب حفنات قديمة من حقيبة ظهره للتعلم منها. يمكنه المزج بين المحاولات القديمة ليفهم ما الذي يجعل الحفنة جيدة. وهذا يسمح له باستكشاف كومة القش بكفاءة أكبر دون إضاعة الوقت في إعادة اختبار أشياء يعرف بالفعل أنها سيئة.

الخطوة 2: "تحديث الذاكرة الديناميكي" (Dynamic Memory Update)

حتى مع وجود منقب ذكي، قد يعلق الروبوت في زاوية من كومة القش حيث تكون الإبر نادرة. إنه بحاجة إلى طريقة لتغيير استراتيجيته بناءً على ما تعلمه حتى الآن.

هنا يأتي دور الجزء الثاني، تحديث الذاكرة الديناميكي (DMU).

  • التشبيه: تخيل أن الروبوت لديه "ورقة غش" (الـ meta-prompt) تخبره بنوع الإبر التي يجب أن يبحث عنها.
    • الطريقة القديمة: كانت ورقة الغش ثابتة. كانت تقول فقط: "ابحث عن إبر حمراء"، ولا تتغير أبداً، حتى لو وجد الروبوت أن الإبر الزرقاء في الواقع أفضل.
    • طريقة GFLOWPO: يقوم الروبوت بتحديث ورقة الغش الخاصة به باستمرار. فهو يأخذ نوعين من الأمثلة ويكتبهما على الورقة:
      1. "الفائزون": أفضل الإبر التي وجدها حتى الآن (لتشجيعه على الاستمرار في البحث عن أشياء مشابهة لها).
      2. "مجموعة التنوع": مزيج عشوائي من محاولات مختلفة من حقيبة ظهره (للتأكد من أنه لن يعلق في مكان واحد ويفوت إبراً جيدة أخرى).
  • النتيجة: من خلال تحديث ورقة الغش بكل من "الفائزين" و"التنوع"، ينتقل الروبوت تدريجياً في بحثه نحو المناطق الأكثر واعدة، مع بقائه في نفس الوقت منتبهاً للاحتمالات الجديدة.

لماذا هذا مهم؟

اختبرت الورقة البحثية هذه الطريقة في مهام متنوعة، مثل:

  • تصنيف النصوص: تحديد ما إذا كانت مراجعة فيلم إيجابية أم سلبية.
  • استنتاج التعليمات: اكتشاف القاعدة الخفية وراء مجموعة من الأمثلة (مثل: "حول هذه الكلمات إلى صيغة الماضي").
  • الإجابة على الأسئلة: الإجابة على أسئلة ثقافية معقدة.

في كل هذه الاختبارات، وجدت GFLOWPO تعليمات أفضل وبسرعة أكبر من الطرق السابقة. لم يكن الأمر مجرد حظ؛ بل استخدمت "حقيبة ظهرها" للتعلم من أخطاء الماضي و"ورقة الغش المتجددة" للتركيز في البحث على أفضل المناطق.

باختصار: GFLOWPO هو نظام يساعد الذكاء الاصطناعي في العثور على أفضل التعليمات من خلال تذكر محاولاته الماضية (بدلاً من نسيانها) وتعديل دليل الإرشادات الخاص به باستمرار للتركيز على ما ينجح، وكل ذلك دون الحاجة إلى إعادة تدريبه من الصفر في كل مرة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →