← أحدث الأبحاث
💬 NLP

Process Rewards with Learned Reliability

تقدم هذه الورقة البحثية BetaPRM، وهو نموذج مكافأة عمليات توزيعي يتنبأ بكل من احتمالات النجاح على مستوى الخطوة وموثوقيتها لتمكين تخصيص الحوسبة التكيفي، مما يحسن بشكل كبير مقايضة الدقة مقابل عدد الرموز (accuracy-token tradeoff) في استدلال "الأفضل من N" (Best-of-N) من خلال ضبط الحوسبة ديناميكيًا بناءً على ثقة التنبؤ.

المؤلفون الأصليون: Jinyuan Li, Langlin Huang, Chengsong Huang, Shaoyang Xu, Donghong Cai, Yuyi Yang, Wenxuan Zhang, Jiaxin Huang

نُشر 2026-05-18
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Jinyuan Li, Langlin Huang, Chengsong Huang, Shaoyang Xu, Donghong Cai, Yuyi Yang, Wenxuan Zhang, Jiaxin Huang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك معلم تقوم بتصحيح مقال رياضي طويل ومتعدد الخطوات لطالب. أنت تريد تقديم ملاحظات على كل خطوة، وليس فقط على الإجابة النهائية. هذا هو بالضبط ما تفعله نماذج مكافأة العمليات (Process Reward Models - PRMs) للذكاء الاصطنا artificial: فهي تعمل كمدرب خطوة بخطوة، تخبر الذكاء الاصطناعي: "عمل جيد في الخطوة 1"، أو "هذا يبدو خاطئاً في الخطوة 2".

ومع ذلك، تشير الورقة البحثية إلى خلل في كيفية عمل هؤلاء المدربين حالياً. فهم يعطون رقماً واحداً (مثل درجة 8/10) ويتصرفون وكأن هذا الرقم مؤكد بنسبة 100%. ولكن في الواقع، قد يكون المدرب يخمن. إذا سلك الذكاء الاصطناعي مساراً غريباً يبدو جيداً في الظاهر ولكنه قد يؤدي إلى طريق مسدود، فإن المدرب القديم لا يزال يعطيه درجة عالية، والذكاء الاصطناعي يثق به بشكل أعمى.

يقترح المؤلفون مدرباً جديداً يسمى BETAPRM؛ فهو لا يعطي درجة فحسب، بل يعطي درجة ومستوى ثقة معها.

إليك التفاصيل باستخدام تشبيهات بسيطة:

1. المشكلة: المدرب "المخمن"

تخيل أنك تحاول التنبؤ بما إذا كانت رمية العملة ستكون "صورة".

  • الطريقة القديمة (PRM القياسي): ترمي العملة 8 مرات، وتأتي على وجه "الصورة" 5 مرات. يقول المدرب القديم: "الاحتمالية هي بالضبط 62.5%". إنه يعامل هذه العينة الصغيرة كحقيقة كاملة وغير قابلة للتغيير.
  • المشكلة: إذا رميت العملة 8 مرات أخرى، فقد تحصل على 4 صور أو 6 صور. المدرب القديم لا يعرف هذا. إنه يعامل الـ "62.5%" كحقيقة صلبة، رغم أنها مبنية على عينة صغيرة مليئة بالضجيج. هذا يجعل الذكأ الاصطناعي مفرط الثقة في المواقف غير المؤكدة.

2. الحل: المدرب "الصادق" (BETAPREM)

يغير BETAPREM قواعد اللعبة. فبدلاً من إعطاء رقم واحد، فإنه يعطي نطاقاً من الاحتمالات ويخبرك بمدى تأكده من هذا النطاق.

  • التشبيه: تخيل أن المدرب يمسك بشريط مطاطي.
    • مركز الشريط: هو الدرجة المتوقعة (مثلاً: "هذه الخطوة من المرجح أن تكون صحيحة بنسبة 70%").
    • ضيق الشريط: هو الموثوقية.
      • الشريط الضيق (ثقة عالية): المدرب متأكد جداً. الشريط المطاطي مشدود بقوة حول علامة الـ 70%. إذا رميت العملة مرة أخرى، فمن المرجح أن تظل قريبة من الـ 70%.
      • الشريط الواسع (ثقة منخفضة): المدرب غير متأكد. الشريط المطاطي ممدد بشكل واسع، ليغطي كل شيء من 40% إلى 90%. المدرب يقول: "أعتقد أنها 70%، لكن قد أكون مخطئاً تماماً".

من خلال تعلم هذا "الضيق" (الذي تسميه الورقة التركيز)، يتعلم النموذج أن يقول: "أنا واثق من هذه الخطوة"، أو "أنا فقط أخمن هنا، لذا لا تثق بي كثيراً".

3. كيف يتعلم: تدريب "مونت كارلو"

كيف يتعلم المدرب ليكون صادقاً؟

  • تستخدم الورقة طريقة تسمى استمرارات مونت كارلو (Monte Carlo continuations). تخيل أن الذكاء الاصطناعي يحاول حل مشكلة، ثم يتوقف عند الخطوة 3، وبعد ذلك يحاول إنهاء المشكلة 16 مرة مختلفة من تلك النقطة تحديداً.
  • بعض هذه المحاولات الـ 16 تنجح، وبعضها يفشل.
  • المدرب القديم: ينظر إلى المحاولات الـ 16، ويعد النجاحات (مثلاً 10)، ويحفظ "10/16 = 0.625" كحقيقة مطلقة.
  • BETAPREM: ينظر إلى المحاولات الـ 16 ويفكر: "حسناً، رأيت 10 نجاحات. هذه علامة جيدة، ولكن بما أنني رأيت 16 محاولة فقط، فهناك الكثير من العشوائية. يجب أن أبقي شريطي المطاطي واسعاً لأخذ هذا الضجيج في الاعتبار".

إنه يستخدم أداة رياضية تسمى توزيع بيتا-بينوميال (Beta-Binomial) لتعلم هذا التوازن بين الدرجة وعدم اليقين.

4. القوة الخارقة: تخصيص الحوسبة التكيفي (ACA)

تقدم الورقة طريقة جديدة لاستخدام هذا "المدرب الصادق" تسمى تخصيص الحوسبة التكيفي (Adaptive Computation Allocation - ACA).

فكر في هذا الأمر كأنه ميزانية لرحلة بالسيارة. لديك كمية محددة من الوقود (أو المال) للعثور على أفضل طريق.

  • الطريقة القديمة (ميزانية ثابتة): ترسل 16 سيارة مختلفة للبحث عن أفضل طريق، مهما كان الأمر. حتى لو كانت السيارة رقم 1 هي الفائزة بوضوح بعد الميل الأول، فإنك لا تزال ترسل السيارات الـ 15 الأخرى لمجرد الأمان. هذا يهدر الوقود.
  • الطريقة الجديدة (ACA):
    1. ترسل مجموعة صغيرة من السيارات (مثلاً 4).
    2. تتحقق من "المدرب الصادق" (BETAPREM).
    3. السيناريو أ (ثقة عالية): المدرب يقول: "السيارة رقم 1 هي الفائزة، وأنا متأكد جداً (شريط ضيق) من أنه لا توجد سيارة أخرى يمكنها هزيمتها".
      • الإجراء: توقف فوراً! وفر الوقود. لست بحاجة لإرسال السيارات الـ 12 الأخرى.
    4. السيناريو ب (ثقة منخفضة): المدرب يقول: "السيارة رقم 1 تبدو جيدة، لكن شريطي المطاطي واسع. لست متأكداً مما إذا كانت السيارة رقم 2 أو 3 قد تكون أفضل بالفعل".
      • الإجراء: لا تتوقف. أرسل المزيد من السيارات لاستكشاف المسارات غير المؤكدة.

النتائج

اختبرت الورقة هذا على أربعة نماذج ذكاء اصطناعي وأربعة معايير رياضية.

  • اختيار أفضل: من خلال الثقة في درجات "الشريط المطاطي الضيق" أكثر، اختار الذكاء الاصطناعي الإجابات الصحيحة في كثير من الأحيان مقارنة بالطريقة القديمة.
  • توفير الوقود: وفرت الطريقة الجديدة (ACA) ما يصل إلى 33.57% من قدرة الكمبيوتر (الرموز/Tokens) اللازمة لحل المشكلات. لقد توقفت عن إضاعة الوقت في المشكلات التي كانت إجابتها واضحة بالفعل، وركزت وقتها فقط عندما كانت غير متأكدة حقاً.

الملخص

BETAPREM هو مدرب أذكى لا يعطيك درجة فحسب، بل يخبرك بمدى الثقة في تلك الدرجة. ومن خلال معرفة متى يخمن، يمكن للذكاء الاصطناعي التوقف عن إهدار الطاقة في المشكلات السهلة وتركيز قدراته الذهنية فقط على المشكلات الصعبة وغير المؤكدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →