← أحدث الأبحاث
💻 computer science

SCRIBE: Structured Mid-Level Supervision for Tool-Using Language Models

إنَّ SCRIBE هو إطار عمل للتعلم التعزيزي يعمل على تعزيز النماذج اللغوية المستخدمة للأدوات من خلال تقديم إشراف هيكلي متوسط المستوى عبر نماذج مكافأة مشروطة بالمهارة، مما يحسن بشكل كبير دقة الاستنتاج ونجاح التفاعل متعدد الخطوات مع الأدوات عن طريق تقليل تباين المكافأة وإرساء تسلسل واضح من إتقان المهارة إلى التخطيط رفيع المستوى.

المؤلفون الأصليون: Yuxuan Jiang, Francis Ferraro

نُشر 2026-04-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuxuan Jiang, Francis Ferraro

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية حل لغز معقد، مثل مسألة رياضية تتطلب استخدام آلة حاسبة، أو مهمة تتطلب البحث في الإنترنت ثم كتابة تقرير. يتعين على الروبوت اتخاذ خطوات عديدة للوصول إلى الإجابة.

المشكلة الكبرى في تدريب هذه الروبوتات هي "اللوم" (Blame). إذا فشل الروبوت في النهاية تمامًا، فكيف ستعرف لماذا؟

  • هل كان لديه خطة سيئة؟
  • هل ارتكب خطأً مطبعيًا سخيفًا في أمر الأداة؟
  • هل أساء فهم نتيجة ما؟

عادةً، نحن نعطي الروبوت مجرد "إبهام للأعلى" أو "إبهام للأسفل" في النهاية فقط. لكن هذا يشبه إخبار طالب رسب في امتحان نهائي: "لقد رسبت"، دون إخباره بأي فصل دراسي ذاكره بشكل خاطئ. إنه لا يعرف ما الذي يجب إصلاحه.

تقدم هذه الورقة البحثية طريقة تدريب جديدة تسمى SCRIBE. وإليك كيف تعمل، باستخدام تشبيهات بسيية:

1. المشكلة: "المعلم الغامض"

في الوقت الحالي، عندما ندرب هذه الوكلاء من الذكاء الاصطناعي، فإننا نستخدم "حكمًا" (ذكاء اصطناعي آخر) لتقييم عملهم خطوة بخطوة. لكن هذا "الحكم" غالبًا ما يكون غير متسق.

  • التشبيه: تخيل معلمًا يصحح اختبار رياضيات ويقول: "عمل جيد، لقد حصلت على الإجابة الصحيحة!" حتى لو استخدم الطالب خدعة سحرية للوصول إليها وتخطى كل المنطق. أو قد يقول: "عمل سيء!" بسبب خطأ إملائي صغير، رغم أن الرياضيات كانت مثالية.
  • النتيجة: يصاب الروبوت بالارتباك. لا يعرف ما إذا كان ينبغي عليه التركيز على التخطيط بشكل أفضل أم مجرد الكتابة بسرعة أكبر.

2. الحل: "مكتبة المهارات" (SCRIBE)

يغير SCRIBE قواعد اللعبة من خلال تقديم مشرف متوسط المستوى. بدلاً من ترك "الحكم" يخمن ما هو جيد أو سيء، يمنح SCRIBE الحكم "كتيب قواعد" محددًا لكل نوع من أنواع الخطوات التي يتخذها الروبوت.

  • التشبيه: تخيل رحلة الروبوت كسلسلة من "التحديات الصغيرة".
    • التحدي أ: "العثور على الأداة المناسبة".
    • التحدي ب: "قراءة البيانات بشكل صحيح".
    • التحدي ج: "دمج النتائج".
  • الابتكار: قبل أن يبدأ الروبوت، يحتوي النظام على مكتبة من "نماذج المهارات الأولية" (Skill Prototypes). هذه النماذج تشبه "أوراق الغش" أو "معايير التقييم" (Rubrics) لكل نوع من أنواع التحديات.
    • إذا كان الروبوت يقوم بـ "التحدي أ"، فإن الحكم لا يخمن فحسب؛ بل يسحب "كتيب قواعد اختيار الأدوات". هذا الكتيب يحدد بالضبط ما الذي يجعل اختيار الأداة جيدًا (مثل: "هل تحقق من المعلمات/Parameters؟").
    • إذا كان الروبوت يقوم بـ "التحدي ب"، يستخدم الحكم "كتيب قواعد قراءة البيانات".
      بإجبار الحكم على استخدام هذه الكتب المحددة، يصبح التقييم عادلاً ومتسقًا. وهذا يوقف مشكلة "الخدعة السحرية" ومشكلة "الخطأ الإملائي".

3. الموجه (The Router): "شرطي المرور"

لجعل هذا يعمل، يحتاج النظام إلى معرفة أي كتيب قواعد يجب استخدامه في أي لحظة.

  • التشبيه: تخيل شرطي مرور عند تقاطع مزدحم. بينما يتحرك الروبوت عبر خطواته، ينظر "الموجه" (شرطي المرور) إلى ما يفعله الروبوت ويوجهه إلى المسار الصحيح (نموذج المهارة الصحيح).
  • يضمن هذا أن يتم تقييم الروبوت دائمًا وفقًا للمعايير الصحيحة لتلك اللحظة المحددة.

4. الاكتشاف المفاجئ: "تعلم المشي قبل الجري"

أكثر النتائج إثارة للاهتمام في الورقة البحثية هي كيفية تعلم الروبوت.

  • التشبيه: لا يمكنك تعليم طفل كيف يركض ماراثون بمجرد الصراخ في وجهه "اركض أسرع!" عند خط النهاية. عليك أولًا تعليمه كيفية التوازن، ثم كيفية المشي، ثم كيفية الهرولة.
  • النتيجة: وجد الباحثون أنه من خلال التركيز على إتقان المهارات متوسطة المستوى (خطوات "المشي" و"التوازن")، أصبح الروبوت تلقائيًا أفضل في التخطيط عالي المستوى (استراتيجية "الماراثون").
  • لم يكن الروبوت بحاجة إلى تعلم كيفية وضع استراتيجيات كبرى بشكل صريح. بمجرد إتقانه للمهارات الصغيرة والمحددة (مثل استخدام أداة بشكل صحيح)، ظهرت القدرة على التخطيط لحلول معقدة متعددة الخطوات بشكل طبيعي. أصبح "المشي" موثوقًا للغاية لدرجة أن "الجري" حدث من تلقاء نفسه.

5. النتيجة: روبوت أفضل

عندما اختبروا هذه الطريقة:

  • الرياضيات: تحسن نموذج صغير في درجات الرياضيات بشكل ملحوظ (من 43% إلى 63% في اختبار صعب).
  • الأدوات: أصبح الروبوت أفضل بكثير في استخدام الأدوات في محادثات معقدة متعددة الخطوات، حيث ضاعف معدل نجاحه في بعض المجالات.
  • العمل الجماعي: وجدوا أن SCRIBE يعمل جنبًا إلى جنب مع الطرق الأخرى التي تعالج الأخطاء منخفضة المستوى (مثل الأخطاء المطبعية). إنه يشبه وجود ميكانيكي يصلح المحرك (مستوى منخفض) بينما يقوم مدرب بتعليم السائق استراتيجيات أفضل (مستوى متوسط). معًا، يصنعون سيارة بطلة.

الملخص

SCRIBE هو إطار عمل للتدريب يتوقف عن التخمين ويبدأ في التقييم باستخدام كتيب قواعد. من خلال تقسيم المشكلات الكبيرة إلى مهارات أصغر ومحددة جيدًا، وتقييم كل مهارة باستخدام قائمة مرجعية محددة، يتعلم الذكاء الاصطناعي أن يكون أكثر موثوقية. والجزء الأفضل؟ من خلال إصلاح الخطوات الصغيرة، يتعلم الذكاء الاصطناعي بشكل طبيعي كيف يفكر بشكل أكبر ويخطط بشكل أفضل دون الحاجة إلى تعليمات إضافية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →