← أحدث الأبحاث
🤖 AI

Verifiable Process Rewards for Agentic Reasoning

تقدم هذه الورقة البحثية "مكافآت العمليات القابلة للتحقق" (VPR)، وهو إطار عمل يستفيد من الأوراكل (oracles) الموضوعية لتوليد إشراف كثيف على مستوى الخطوة الواحدة لتعلم التعزيز، مما يحسن من عملية تخصيص الائتمان في الاستدلال الوكيل طويل المدى، ويُظهر أداءً وتعميماً فائقين عبر مختلف معايير الاستدلال مقارنة بالتغذية الراجعة المتفرقة على مستوى النتيجة.

المؤلفون الأصليون: Huining Yuan, Zelai Xu, Huaijie Wang, Xiangmin Yi, Jiaxuan Gao, Xiao-Ping Zhang, Yu Wang, Chao Yu, Yi Wu

نُشر 2026-05-12
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Huining Yuan, Zelai Xu, Huaijie Wang, Xiangmin Yi, Jiaxuan Gao, Xiao-Ping Zhang, Yu Wang, Chao Yu, Yi Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية لعب لعبة معقدة، مثل حل أحجية ضخمة أو التنقل في متاهة.

الطريقة القديمة: مشكلة "الدرجة النهائية"
تقليديًا، عندما نعلم هذه الروبوتات (نماذج اللغات الكبيرة)، فإننا نعطيها التغذية الراجعة فقط في النهاية تمامًا. الأمر يشبه معلمًا يترك طالبًا يؤدي اختبار رياضيات مكونًا من 100 سؤال، ثم ينتظر حتى ينتهي ليقول له: "لقد حصلت على تقدير جيد (B)".

  • المشكلة: الروبوت لا يعرف أي الإجابات كانت صحيحة أو خاطئة بالتحديد. هل فشل بسبب السؤال رقم 5؟ أم بسبب السؤال رقم 99؟ إذا حصل على تقدير "جيد"، فربما كان محظوظًا في الأسئلة الصعبة لكنه أخطأ في الأسئلة السهلة. هذا يجعل من الصعب جدًا على الروبوت تعلم كيفية تحسين تفكيره خطوة بخطوة.

الفكرة الجديدة: "المدرب الفوري"
يقترح مؤلفو هذه الورقة البحثية، من جامعة تسينغ هوا، طريقة جديدة تسمى مكافآت العملية القابلة للتحقق (VPR).

بدلاً من الانتظار للحصول على الدرجة النهائية، يعمل نظام VPR كمدرب صارم وموضوعي يراقب كل حركة يقوم بها الروبوت ويعطي تغذية راجعة فورية.

  • كيف يعمل: يقوم الروبوت بحركة ما. يقوم المدرب بالتحقق منها مقابل "كتاب قواعد" (برنامج كمبيوتر أو برنامج حل رياضي) يعرف الحقيقة المطلقة.
    • إذا اتبعت الحركة القواعد، يقول المدرب: "عمل جيد!" (+1 نقطة).
    • إذا كسرت الحركة القواعد، يقول المدوي: "حركة سيئة!" (-1 نقطة).
  • السحر: يحدث هذا في كل دور بمفرده، وليس فقط في النهاية. يتعلم الروبوت بالضبط أي الخطوات كانت جيدة وأيها كانت سيئة، مما يسم يسمح له بتصحيح استراتيجيته في الوقت الفعلي.

ثلاث طرق اختبروا بها ذلك
اختبر الباحثون هذا "المدرب الفوري" (VPR) في ثلاثة أنواع مختلفة من الألعاب لإثبات نجاحه:

  1. إكس أو (لعبة الاستراتيجية):

    • المدرب: برنامج كمبيوتر فائق الذكاء (MCTS) ينظر للمستقبل ليرى أفضل التحركات الممكنة.
    • الدرس: يتعلم الروبوت ليس فقط القيام بحركة تبدو جيدة الآن، بل القيام بتحركات تؤدي للفوز في اللعبة لاحقًا. يتوقف عن القيام بـ "حركات سخيفة" تبدو جيدة للحظة ولكنها تؤدي للخسارة في اللعبة.
  2. سودوكو (أحجية المنطق):

    • المدرب: برنامج حل منطقي يتحقق مما إذا كان الرقم يناسب قواعد الشبكة.
    • الدرس: إذا حاول الروبوت وضع الرقم "5" في مكان يُسمح فيه بوجود الرقم "5" بالفعل، يقول المدرب فورًا: "لا!". هذا يعلم الروبوت أن يكون متسقًا مع الأحجية بأكملها، وليس فقط مع المربع الحالي.
  3. كنس الألغام (لعبة التخمين):

    • المدرب: حاسبة احتمالات تعرف بالضبط أين يمكن أن تكون الألغام بناءً على الأرقام التي ظهرت.
    • الدرس: يتعلم الروبوت حساب المخاطر. إذا كانت هناك خلية لديها احتمال 90% بأن تكون لغمًا، يقول المدرب: "لا تنقر على ذلك!". هذا يعلم الروبوت التعامل مع عدم اليقين بحذر.

ما وجدوه

  • تعلم أفضل: الروبوتات التي تدربت باستخدام "المدرب الفوري" (VPR) تعلمت بشكل أسرع وأصبحت أفضل بكثير في الألعاب مقارنة بتلك التي تدربت بطريقة "الدرجة النهائية" القديمة.
  • تفكير أذكى: لم يصبح الروبوتات أفضل فقط في الألعاب المحددة التي مارسوها. بل أصبحوا أفضل في مهام الاستدلال العامة أيضًا. إنه يشبه طالبًا يتدرب على أحاجي المنطق وفجأة يصبح أفضل في كتابة المقالات أو حل المسائل الكلامية لأنه تعلم كيف يفكر خطوة بخطوة.
  • العيب: يجب أن يكون "المدرب" مثاليًا. إذا كان كتاب القواعد الذي يستخدمه المدرب يحتوي على أخطاء أو غير صحيح، سيتعلم الروبوت دروسًا خاطئة ويصبح في الواقع أسوأ. جودة المدرب هي كل شيء.

باخت مختصره
تظهر هذه الورقة البحثية أنه إذا تمكنت من بناء نظام يتحقق من عمل الروبوت خطوة بخطوة بدقة 100%، يمكنك تعليمه كيف يستدل بشكل أفضل بكثير مما لو أخبرته فقط إذا فاز أو خسر في النهاية. إنها تحول عملية التعلم من لعبة "خمن وتحقق" إلى درس تعليمي موجه وخطوة بخطوة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →