← أحدث الأبحاث
💬 NLP

RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents

تقترح الورقة البحثية RICE-PO، وهو إطار عمل لتحسين السياسات خالٍ من الناقد (critic-free) يقوم بتحويل تفاعلات الاسترجاع إلى إشارات تعلم محلية باستخدام الأفعال القابلة للتنفيذ ذات عدم اليقين العالي كمرتكزات لتعيين الائتمان لخطوات الاستدلال الكامنة، مما يؤدي إلى تحسين تدريب وكلاء الاستدلال التفاعلي على معايير مثل BRIGHT وBEIR.

المؤلفون الأصليون: Mingchen Li, Hansi Zeng, Zhuo Qian, Jiatan Huang, Hamed Zamani, Hong Yu

نُشر 2026-05-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mingchen Li, Hansi Zeng, Zhuo Qian, Jiatan Huang, Hamed Zamani, Hong Yu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم روبوت ذكي كيف يجد الإجابة المثالية لسؤال صعب للغاية. الروبوت لا يكتفي بمجرد كتابة استعلام بحث واحد ويأمل في الأفضل، بل يعمل كالمحقق: يبحث، يقرأ ما يجده، يفكر فيما ينقصه، يكتب استعلام بحث جديد، ثم يبحث مرة أخرى. إنه يفعل ذلك في حلقة مستمرة حتى يجد الإجابة.

المشكلة الكبيرة التي يتناولها البحث هي كيفية تعليم الروبوت أي من خطواته كانت جيدة حقاً.

المشكلة: "الصندوق الأسود" للتفكير

في لعبة المحقق هذه، يمتلك الروبوت نوعين من التحركات:

  1. تحركات "الفعل" (القابلة للتنفيذ): وهي استعلامات البحث الفعلية التي يكتبها. يمكن لمحرك البحث أن يخبر الروبوت فوراً: "عمل جيد! لقد وجدت هذه العملية 10 مقالات رائعة"، أو "عمل سيء! لم تجد هذه العملية أي شيء". هذا النوع سهل القياس.
  2. تحركات "التفكير" (الكامنة): وهي الأفكار الداخلية التي تراود الروبوت قبل كتابة استعلام البحث. قد يفكر: "أنا بحاجة للبحث عن السنة التي حدث فيها هذا"، أو "يجب أن أتحقق من خلفية المؤلف". محرك البحث لا يمكنه رؤية هذه الأفكاء؛ هو فقط يرى استعلام البحث النهائي.

معضلة تحديد المسؤولية (Credit Assignment Dilemma):
إذا وجد الروبوت في النهاية المقال المثالي، فكيف نعرف أي فكرة هي التي أدت إلى هذا النجاح؟

  • هل الفكرة "تحقق من المؤلف" هي التي تسببت في النجاح؟
  • أم أن الروبوت حالفه الحظ فقط مع استعلام البحث النهائي، وكانت الأفكار السابقة خاطئة في الواقع؟

إذا أعطينا الروبوت "نجمة ذهبية" فقط على النتيجة النهائية وقلنا له: "عمل رائع على كل فكرة قمت بها"، فقد يتعلم الروبوت دروساً خاطئة. قد يبدأ بالتفكير: "أوه، لقد كنت مخطئاً، لكنني حصلت على نجمة ذهبية رغم ذلك، لذا سأستمر في فعل ذلك بنفس الطريقة". وهذا ما يسمى بـ سوء تخصيص المسؤولية (credit misassignment).

الحل: RICE-PO (المدرب الذكي)

يقترح المؤلفون طريقة تدريب جديدة تسمى RICE-PO. بدلاً من النظر فقط إلى النتيجة النهائية، تعمل هذه الطريقة كمدرب ذكي يراقب جلسات تدريب الروبوت ويعطيه ملاحظات في اللحظة ذاتها.

إليك كيف يعمل RICE-PO، باستخدام تشبيه بسيط:

1. إيجاد "اللحظات المتذبذبة" (مرتكزات عدم اليقين)

المدرب لا يراقب كل ثانية. بدلاً من ذلك، يبحث المدرب عن اللحظات التي يبدو فيها الروبوت غير متأكد.

  • التشبيه: تخيل أن الروبوت يحاول الاختيار بين استعلامي بحث: أحدهما "تاريخ كيوتو" والآخر "تكنولوجيا الطاقة المتجددة". إذا كان الروبوت واثقاً جداً، فسيختار أحدهما ببساطة. ولكن إذا كان مرتبكاً ويولد العديد من الخيارات المختلفة والغريبة، يقول المدرب: "حسناً، هذه لحظة حرجة. لننتظر ونحلل الأمر".
  • في البحث: استخدموا "الإنتروبيا" (مقياس الارتباك/الفوضى) لاختيار هذه اللحظات عالية المخاطر.

2. محاكاة "ماذا لو؟" (السيناريوهات المضادة المحلية)

بمجرد أن يحدد المدرب "لحظة متذبذبة"، فإنه لا ينتظر انتهاء الروبوت، بل يقوم بتشغيل محاكاة سريعة.

  • التشبيه: يقول المدرب: "حسناً، كنت تفكر في 'كيوتو'. ولكن ماذا لو، في تلك اللحظة تحديداً، فكرت في 'طوكيو' بدلاً منها؟ دعنا نتظاهر بأنك فعلت ذلك، ونرى ما هو استعلام البحث الذي كنت ستكتبه، ونتحقق مما إذا كان هذا الاستعلام سيجد نتائج أفضل".
  • في البحث: يقومون بتوليد عدة فروع "ماذا لو" من نفس التاريخ لمعرفة ما إذا كان تغيير الفكرة سيغير فعلياً نتيجة البحث.

3. "فحص الاستقرار" (الانتشار المقيّد)

هذا هو الجزء الأهم. يسأل المدرب سؤالين قبل إعطاء الائتمان (التقدير) لـ الفكرة:

  • السؤال أ (التأثير): هل غيرت الفكرة استعلام البحث فعلياً؟ (إذا فكر الروبوت في "كيوتو" مقابل "طوكيو" ولكنه كتب نفس استعلام البحث تماماً، فإن الفكرة لم تكن مهمة. لا ائتمان هنا).
  • السؤال ب (الاستقرار): هل استمرت فائدة تلك الفكرة حتى النهاية؟ (أحياناً تؤدي فكرة ما إلى استعلام بحث رائع، ولكن بعد ذلك يرتكب الروبوت خطأً فادحاً في الخطوة التالية يفسد كل شيء. إذا كانت النتيجة النهائية سيئة بسبب الخطوة التالية، فلا ينبغي أن نعطي ائتماناً للفكرة الأولى).
  • في البحث: يقيسون "الاستقرار المتبقي" (residual stability). إذا ظل المكافأة المحلية (الناتجة عن البحث المباشر) متسقة حتى النهاية، يقول المدرب: "نعم، هذه الفكرة كانت هي البطل. امنحها الائتمان!" وإذا أفسدت الخطوات المستقبلية الأمر، يقول: "لا، لا تمنح هذه الفكرة الائتمان بعد".

النتيجة

باستخدام هذه الطريقة، يتعلم الروبوت بشكل أسرع بكثير.

  • الطريقة القديمة: "لقد وجدت الإجابة الصحيحة! عمل جيد على كل شيء". (يصاب الروبوت بالارتباك بشأن ما نجح فعلياً).
  • طريقة RICE-PO: "لقد كنت مرتبكاً هنا، لكن فكرتك المحددة أدت إلى استعلام بحث أفضل، وهذه الميزة صمدت حتى النهاية. تلك الفكرة المحددة كانت رائعة. افعل ذلك مجدداً".

لماذا يهم هذا الأمر؟

اختبر المؤلفون هذه الطريقة على مجموعتي بيانات كبيرتين (BRIGHT و BEIR)، وهما بمثابة مكتبات ضخمة للأسئلة الصعبة.

  • وجدوا أن RICE-PO ساعدت الروبوت (حتى الروبوتات الأصغر والأرخص) في إيجد إجابات أفضل من الطرق السابقة.
  • أثبتوا أنك لست بحاجة إلى ذكاء اصطناعي "قاضٍ" باهظ الثمن لإخبارك بما يجب فعله؛ فبنية عملية البحث نفسها (حقيقة أن الاستعلامات قابلة للاختبار) توفر كل التعليقات التي يحتاجها الروبوت.

باخت-صار: RICE-PO هي وسيلة لتعليم وكلاء الذكاء الاصطناعي كيفية التعلم من تاريخ البحث الخاص بهم من خلال التحقق بعناية مما إذا كانت أفكارهم قد تسببت في نجاحهم، بدلاً من مجرد التخمين بناءً على النتيجة النهائية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →