← أحدث الأبحاث
💬 NLP

TextReg: Mitigating Prompt Distributional Overfitting via Regularized Text-Space Optimization

تقدم الورقة البحثية TextReg، وهو إطار تنظيم يعمل على الحد من الإفراط في التخصيص لتوزيع المطالبات في النماذج اللغوية الكبيرة من خلال التحكم في عدم كفاءة التمثيل عبر التدرجات النصية، مما يحسن بشكل كبير من تعميم خارج التوزيع مقارنة بطرق التحسين الحالية.

المؤلفون الأصليون: Lucheng Fu, Ye Yu, Yiyang Wang, Yiqiao Jin, Haibo Jin, B. Aditya Prakash, Haohan Wang

نُشر 2026-05-21
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Lucheng Fu, Ye Yu, Yiyang Wang, Yiqiao Jin, Haibo Jin, B. Aditya Prakash, Haohan Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا ذكيًا جدًا ولكنه حرفي التفكير كيفية حل لغز ما. أنت تعطيه مجموعة من التعليمات (مُلقّن/Prompt).

في الماضي، عندما حاول الباحثون تحسين هذه التعليمات تلقائيًا باستخدام ملاحظات الروبوت الخاصة، حدثت مشكلة غريبة. كانت التعليمات تصبح أطول وأطول، وتمتلئ بقواعد صغيرة ومحددة للغاية مثل: "إذا كان الرقم 7، افعل X"، و"إذا كان الشيء طماطم، افعل Y".

في البداية، بدا هذا رائعًا لأن الروبوت حقق درجات مثالية في الألغاز التدريبية. ولكن عندما أعطيته لغزًا جديدًا لم يره من قبل، فشل فشلاً ذريعًا. كان الأمر يشبه طالبًا حفظ إجابات اختبار تجريبي محدد لكنه لم يفهم الرياضيات، لذا لم يستطع حل مسألة مختلفة قليًا.

يسمي المؤلفون هذه الظاهرة "الإفراط في التخصيص التوزيعي للمُلقّن" (Prompt Distributional Overfitting). وببساطة، أصبحت التعليمات "عالقة" جدًا في الأمثلة التدريبية المحددة وفقدت قدرتها على التعامل مع العالم الحقيقي.

الحل: TextReg (المحرر الذكي)

يقدم البحث طريقة جديدة تسمى TextReg. فكر في TextReg كمحرر صارم وحكيم يراقب عملية كتابة التعليمات للروبوت ويمنعها من أن تصبح فوضوية.

إليك كيف يعمل TextReg، باستخدام ثلاثة تشبيهات بسيطة:

1. مرشح "التحقق المزدوج" (تطهير التدرج عبر الدليل المزدوج)

تخيل أن الروبوت يقترح قاعدة جديدة: "دائمًا اعتبر الطماطم من الخضروات."

  • الطريقة القديمة: قد يقبل الروبوت هذه القاعدة ببساطة لأنها نجحت مع مثال الطماطم المحدد في الاختبار التجريبي.
  • طريقة TextReg: يسأل TextReg سؤالين:
    1. "هل نجحت هذه القاعدة فقط بسبب هذه الطماطم المحددة؟" (فحص محلي)
    2. "هل رأينا هذه القاعدة تعمل مع فواكه أو أشياء أخرى من قبل؟" (فحص عالمي)
      إذا كانت القاعدة تعمل فقط مع الطماطم ولم تُشاهد في مكان آخر، فإن TextReg يرفضها. إنه يحتفظ فقط بالقواعد الواسعة والمفيدة، مثل "احسب جميع الفواكه."

2. "متتبع اللياقة" (تنظيم التعديل الدلالي)

في كل مرة تتغير فيها التعليمات، يتحقق TextReg من "صحة" المُلقّن. إنه ينظر إلى شيئين:

  • الطول: هل أصبحت التعليمات طويلة بشكل غير ضروري؟ (مثل إضافة الكثير من الكلمات إلى جملة).
  • النطاق: هل أصبحت التعليمات ضيقة جدًا؟ (مثل إضافة قاعدة تنطبق فقط على يوم محدد من الأسبوع).
    إذا أصبحت التعليمات طويلة جدًا أو محددة جدًا، يقوم TextReg بإنشاء "إشارة تصحيحية" تخبر الروبوت بتقليم الزوائد وتوسيع القواعد. إنه يشبه مدربًا شخصيًا يصرخ: "توقف عن إضافة الطعام غير الصحي إلى نظامك الغذائي!"

3. "إعادة الكتابة الموجهة" (تحديث المُلقّن الموجه بالتنظيم)

أخيرًا، عندما يعيد الروبوت كتابة التعليمات، فإنه لا يستمع فقط إلى ملاحظات المهمة (كيفية حل اللغز)، بل يستمع أيضًا إلى "متتبع اللياقة".

  • إذا قالت المهمة: "أضف قاعدة حول الطماطم"، ولكن متتبع اللياقة قال: "لا تجعلها محددة"، فإن TextReg يجبر الروبوت على إيجاد حل وسط. قد يعيد كتابة القاعدة لتكون حول "الخضروات" بشكل عام بدلاً من مجرد الطماطم.

النتائج: لماذا يهم ذلك؟

اختبر المؤلفون ذلك في مهام استدلالية متنوعة (مثل ألغاز المنطق والمسائل الرياضية). ووجدوا أن:

  • الطرق القديمة (مثل TextGrad أو REVOLVE) غالبًا ما أنشأت تعليمات طويلة وفوضوية عملت جيدًا في الاختبارات التجريبية ولكنها فشلت في النسخ الجديدة والأكثر صعوبة من نفس المهام.
  • TextReg أنشأ تعليمات أقصر وأنظف. ولأن القواعد كانت واسعة وغير مرتبطة بأمثلة محددة، فقد حقق الروبوت أداءً أفضل بكثير في المسائل الجديدة غير المرئية (ما يسميه الباحثون "التعميم خارج التوزيع" أو Out-of-Distribution generalization).

في الواقع، حسن TextReg الدقة بنسبة تصل إلى 16.5% مقارنة بالطرق السابقة في المهام الصعبة.

الخلاصة

يعامل TextReg كتابة التعليمات للذكاء الاصطناعي مثل كتابة كتاب مدرسي جيد. الكتاب المدرسي الجيد لا ينبغي أن يكتفي بسرد كل مثال صادفته على الإطلاق؛ بل يجب أن يعلم المبادئ العامة حتى تتمكن من حل المشكلات التي لم ترها من قبل. يضمن TextReg بقاء تعليمات الذكاء الاصطناعي مركزة على تلك المبادئ، مما يمنعها من حفظ الاختبار التجريبي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →