← أحدث الأبحاث
💻 computer science

PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization

تقترح الورقة البحثية نموذج PAIR، وهو نموذج مكافأة داخلي مدرك للبادئة يجمع بين مسبار للحالة الخفية مجمد ورأس خفيف يعتمد على الانتباه لتوليد مكافآت كثيفة ومنخفضة التكلفة على مستوى الخطوة لتحسين الوكيل متعدد الدورات، مما يتغلب بفعالية على قيود مكافآت النتيجة المتفرقة وتدهور المسبارات تحت تأثير تلوث البادئة.

المؤلفون الأصليون: Wonjoong Kim, Yeonjun In, Sangwu Park, Dongha Lee, Chanyoung Park

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Wonjoong Kim, Yeonjun In, Sangwu Park, Dongha Lee, Chanyoung Park

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم مساعد آلي (روبوت) كيفية حل لغز معقد، مثل حجز رحلة طيران، وحجز فندق، وطلب عشاء في خطوة واحدة. يتعين على الروبوت اتخاذ خطوات عديدة، واتخاذ قرارات واستخدام أدوات على طول الطريق.

المشكلة الكبرى في طرق التعليم الحالية هي أن الروبوت لا يتلقى سوى عبارة "عمل جيد!" أو "حاول مرة أخرى" في نهاية العملية بأكملها. إذا ارتكب الروبوت خطأ في الخطوة الأولى، فإنه لن يعرف ذلك حتى ينهي الخطوة العاشرة ويفشل في المهمة بأكملها. الأمر يشبه لعب لعبة فيديو حيث لا تحصل إلا على شاشة "انتهت اللعبة" في النهاية، دون أي تلميح حول القفزة التي أخطأت فيها.

يقدم هذا البحث طريقة جديدة لتعليم هذه الروبوتات تسمى PAIR (نموذج المكافأة الداخلي المدرك للبادئة - Prefix-Aware Internal Reward Model). وإليك كيف تعمل، باستخدام تشبيهات بسيطة:

المشكلة: "المحقق المرتبك"

لإعطاء الروبوت ملاحظات أثناء العملية (خطوة بخوة)، حاول الباحثون النظر داخل عقل الروبوت (حالات الكمبيوتر الداخلية الخاصة به) لمعرفة ما إذا كان يفعل الشيء الصحيح.

وجدوا نوعين من "إشارات الدماغ":

  1. "الحكواتي" (الحالات المخفية): تتحقق هذه الإشارة مما إذا كانت الخطوة الحالية منطقية بناءً على ما حدث من قبل. إنه يشبه المحقق الذي يهتم فقط بما إذا كانت الدليل الحالي يتناسب مع القصة التي كتبها بالفعل.
    • العيب: إذا ارتكب الروبوت خطأً في وقت سابق (تلوثت القصة)، فإن "الحكواتي" سيصاب بالارتباك. سيعتقد: "أوه، هذه الخطوة الجديدة تتناسب تماماً مع القصة الخاطئة، لذا لا بد أنها جيدة!" إنه يكافئ الروبوت عن طريق الخطأ على الاستمرار في مسار خاطئ.
  2. "المهندس الهيكلي" (أنماط الانتباه): تنظر هذه الإشارة إلى كيفية تركيز الروبوت لانتباهه. هي لا تهتم بالقصة؛ بل تهتم بالهيكل. هل ينظر الروبوت إلى الأدوات الصحيحة؟ هل يتجاهل الضجيج غير ذي الصلة؟
    • نقاط القوة: حتى لو كانت القصة فاسدة، لا تزال هذه الإشارة قادرة على تحديد ما إذا كان الروبوت ينظر إلى الأشياء الصحيحة. إنها قوية ومتينة.
    • نقاط الضعف: في القصة المثالية والنظيفة، لا تكون هذه الإشارة بدقة "الحكواتي".

الحل: "المدرب ذو المرحلتين" (PAIR)

أدرك المؤلفون أن أياً من الإشارتين ليس مثالياً بمفرده. "الحكواتي" رائع عندما تسير الأمور على ما يرام، لكنه يفشل عند حدوث الأخطاء. أما "المهندس" فهو ثابت ولكنه أقل دقة في المهام النظيفة.

لذا، قاموا ببناء PAIR، وهو مدرب من مرحلتين:

  1. المرحلة الأولى: فحص الاعتقاد. يسأل المدرب أولاً "الحكواتي" (مسبار الحالة المخفية): "هل تتناسب هذه الخطوة مع القصة الحالية؟" وهذا يعطي درجة أولية سريعة.
  2. المرحلة الثانية: فحص الواقع. ثم يسأل المدرب "المهندس" (مسبار الانتباه): "انتظر، بالنظر إلى كيفية تركيزك، هل تقوم حقاً بحل المشكلة، أم أنك تتبع فقط قصة مكسورة؟"

كيف يعملان معاً:

  • إذا كانت القصة نظيفة: يوافق "المهندس" مع "الحكواتي". عندها يقبل المدرب الدرجة.
  • إذا كانت القصة مكسورة (ملوثة): يقول "الحكواتي": "هذا يبدو جيداً لأنه يتناسب مع الخطأ!" ولكن "المهندس" يقول: "لا، أنت تنظر إلى الأشياء الخاطئة!" هنا يستمع المدرب إلى "المهندس" ويصحح الدرجة، ليخبر الروبوت: "في الواقع، كانت تلك الخطوة سيئة، حتى لو بدت صحيحة!"

لماذا يعد هذا أمراً هاماً

قبل PAIR، للحصول على ملاحظات خطوة بخطوة، كان عليك القيام بواحد من ثلاثة أشياء مكلفة:

  • تشغيل اللعبة بأكملها 100 مرة لمعرفة ما الذي ينجح (بطيء ومضيع للوقت جداً).
  • استدعاء إنسان أو ذكاء اصطناعي فائق الذكاء لتقييم كل خطوة (مكلف وبطيء جداً).
  • معرفة الإجابة الدقيقة مسبقاً لتصحيح الخطوات (وهو أمر مستحيل في كثير من مهام العالم الحقيقي).

تغير PAIR قواعد اللعبة لأنها:

  • مجانية: تستخدم إشارات دماغ الروبوت نفسه. لا تحتاج لاستدعاء أي شخص آخر أو تشغيل عمليات محاكاة إضافية.
  • فورية: تحدث في لمح البصر أثناء تفكير الروبوت.
  • صادقة: تكشف الأخطاء حتى عندما يتبع الروبوت مساراً خاطئاً بكل ثقة.

النتيجة

عندما اختبروا ذلك على روبوتات تحاول استخدام أدوات من العالم الحقيقي (مثل حجز الرحلات أو البحث في قواعد البيانات)، ساعد PAIR هذه الروبوتات على التعلم بشكل أسرع وحل المزيد من المشكلات مقارنة بأي طريقة أخرى. الأمر يشبه إعطاء طالب معلم يمكنه رصد الخطأ أثناء كتابته للمقال، بدلاً من الانتظار حتى ينتهي من المقال ليقول له: "لقد فشلت".

باختصار، PAIR هو "جهاز كشف كذب" داخلي ذكي لوكلاء الذكاء الاصطناعي، يساعدهم على تصحيح أخطائهم في الوقت الفعلي، دون الحاجة إلى مساعدة خارجية مكلفة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →