← أحدث الأبحاث
💻 computer science

OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning

تقترح الورقة البحثية "تحسين السياسة الموجهة بالعرّاف" (OPPO)، وهو إطار عمل للتعلم المعزز يستفيد من التكرار القيمي البايزي لاستخلاص مزايا مستوى الرمز (token-level) من نسب الاحتمال المشروطة بالعرّاف، مما يلغي الحاجة إلى شبكات قيم متعلمة ويتفوق بشكل كبير على الأساليب الحالية مثل GRPO في معايير الاستدلال المعقدة.

المؤلفون الأصليون: Yu Li, Rui Miao, Tian Lan, Zhengling Qi

نُشر 2026-05-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yu Li, Rui Miao, Tian Lan, Zhengling Qi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم طالباً كيفية حل مسألة رياضية طويلة ومعقدة للغاية. يكتب الطالب حلاً خطوة بخطوة على ورقة من الورق. في النهاية تماماً، تتحقق أنت من الإجابة النهائية. إذا كانت صحيحة، تمنحه نجمة ذهبية. وإذا كانت خاطئة، تضع له علامة "X" حمراء.

المشكلة في الطرق الحالية
تعمل معظم طرق تدريب الذكاء الاصطناعي الحالية (مثل خوارزمية "GRPO" الشهيرة) مثل المعلم الذي ينظر فقط إلى الدرجة النهائية. عندما يحصل الطالب على نجمة ذهبية، يقول المعلم: "عمل رائع! لقد أبليت بلاءً حسناً في كل خطوة من خطوات ذلك الحل". وعندما يحصل على علامة "X" حمراء، يقول: "عمل سيئ! لقد أخطأت في كل خطوة".

هذا الأسلوب غير فعال. في حل يتكون من 500 خطوة، ربما كانت 5 خطوات فقط هي "اللحظات المحورية" التي قام فيها الطالب باستنتاج عبقري أو ارتكب خطأً حرجاً. أما الـ 495 خطوة الأخرى فكانت مجرد عمليات نسخ روتينية أو انتقالات بديهية. ومن خلال الثناء أو العقاب على كل خطوة بالتساوي، يشتت المعلم الدرس. يصاب الطالب بالارتباك حول أي الخطوات كانت مهمة حقاً.

الحل الجديد: OPPO
تقدم ورقة البحث طريقة جديدة تسمى OPPO (تحسين السياسة الموجهة من قبل العراف/الخبير). فكر في OPPO كمساعد تدريس ذكي جداً، لا يكتفي بالنظر إلى الدرجة النهائية فحسب، بل يراقب تغير "ثقة" الطالب مع كل كلمة يكتبها.

إليك كيف تعمل OPPO، باستخدام تشبيه بسيط:

1. "العراف" (مفتاح الإجابة)

تخيل أن المعلم لديه مفتاح إجابة سري (العراف). بينما يكتب الطالب كل خطوة، يتحقق المعلم سراً: "إذا استمر الطالب من هذه النقطة تحديداً، فما هو احتمال أن يحصل في النهاية على الإجابة الصحيحة؟"

2. "الاعتقاد المستمر" (مقياس الثقة)

بدلاً من الانتظار حتى النهاية، تقوم OPPO بتحديث مقياس الثقة بعد كل كلمة يكتبها الطالب.

  • البداية: يبدأ المقياس بتخمين محايد بنسبة 50/50.
  • الخطوة 1: يكتب الطالب خطوة جيدة. يتحقق المعلم من مفتاح الإجابة ويقول: "حسناً، بناءً على هذا، ارتفحت فرصة النجاح إلى 60%".
  • الخطوة 2: يكتب الطالب خطوة مربكة. يقول المعلم: "همم، هذا يخفض الفرصة إلى 40%".
  • الخطوة 3: يقوم الطالب باستنتاج عبقري. يقفز المعلم بالفرصة إلى 90%.

هذا يخلق تقديراً مستمراً لاحتمالية النجاح يتغير مع كل رمز (كلمة/رقم) يولده النموذج.

3. "تخصيص الائتمان" (من يستحق الثناء؟)

هذا هو الجزء السحري. تستخدم OPPO مقياس الثقة المستمر هذا لتقرر من يستحق النجمة الذهبية.

  • اللحظات المحورية: عندما يتأرجح مقياس الثقة بجنون (على سبيل المثال، من 40% إلى 90%)، تدرك OPPO أن هذه كانت لحظة حرجة. لذا، تمنح ائتماناً (أو لائمة) هائلاً لتلك الخطوة المحددة.
  • اللحظات المملة: عندما يكون مقياس الثقة عالقاً بالفعل عند 99% (الطالب سيفوز بالتأكيد) أو 1% (سوف يخسر بالتأكيد)، تدرك OPPO أن الخطوات التالية لا تهم كثيراً. لذا، تمنحها ائتماناً صفرياً.

لماذا هذا أفضل؟

  • الطريقة القديمة: "لقد حصلت على نجمة ذهبية، لذا فإن كل كلمة كتبتها كانت جيدة". (ضجيج زائد).
  • طريقة OPPO: "لقد حصلت على نجمة ذهبية. أول 100 كلمة كانت جيدة، لكن الكلمة رقم 101 كانت الحركة العبقرية التي أنقذت الموقف. هذه هي الكلمة التي سنثني عليها".

طريقتان لتشغيل "المعلم"

تقترح الورقة طريقتين للحصول على "مقياس الثقة السري" هذا:

  1. العراف الذاتي (Self-Oracle): يحاول الذكاء الاصطناعي تخمين مفتاح الإجابة باستخدام عقله الخاص. إنها عملية سريعة وغير مكلفة، مثل طالب يراجع واجبه مقابل مفتاح إجابة وضعه بنفسه.
  2. عراف المعلم (Teacher-Oracle): يستخدم الذكاء الاصطناعي نموذجاً آخر أكبر وأذكى ومجمداً للتحقق من الخطوات. هذا يشبه وجود بروفيسور دكتوراه يصحح الواجب المنزلي. إنه أبطأ ولكنه أكثر دقة.

النتائج

اختبر الباحثون هذه الطريقة في مسائل الرياضيات والعلوم والبرمجة.

  • المسائل القصيرة: كانت الطريقة الجديدة أفضل قليلاً.
  • المسائل الطويلة والمعقدة: كانت الطة الجديدة أفضل بشكل ملحوظ.

وهذا منطقي، لأن المسائل الطويلة تحتوي على المزيد من "الخطوات المملة" حيث تضيع الطريقة القديمة الوقت في منح الائتمان، وتحتوي أيضاً على المزيد من "الخطوات المحورية" حيث تتألق طريقة OPPO من خلال تركيز الانتباه بالضبط حيث تبرز الحاجة إليه.

الملخص

OPPO تشبه المدرب الذي لا يعامل مباراة مدتها ساعتان كحدث واحد فقط. بدلاً من ذلك، يراقب المباراة لحظة بلحظة، ويحدد اللحظة الدقيقة التي قام فيها اللاعب بحركة غيرت مجرى اللعبة. يتوقف عن الثناء على اللاعب لأنه ربط حذاءه (وهو أمر كان ضرورياً ولكنه ليس السبب في فوزه) ويبدأ في الثناء على التمريرة المحددة التي أدت إلى تسجيل الهدف. هذا يجعل عملية التعلم أسرع وأذكى بكثير، خاصة للمهام الطويلة والصعبة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →