← أحدث الأبحاث
🤖 AI

CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning

تقدم الورقة البحثية CoRE، وهي طريقة للتعلم التعزيزي في وقت الاختبار تستبدل التصويت بالأغلبية الهش بمكافآت إجماع قائمة على الرسوم البيانية مشتقة من ديناميكيات المكرر لتوفير إشارات متدرجة وذاتية الإشراف تعمل على تحسين الدقة وسرعة التقارب عبر مختلف النماذج والمعايير.

المؤلفون الأصليون: Ambuj Mehrish, Sebastiano Vascon

نُشر 2026-08-11
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Ambuj Mehrish, Sebastiano Vascon

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالماً يحاول فيه روبوت فائق الذكاء تعلم كيفية حل لغز معقد، ولكن لا يوجد أحد هناك ليخبره ما إذا كان قد أصاب الإجابة أم لا. هذه هي الحياة اليومية لنماذج الذكاء الاصطناعي الحديثة عندما تواجه أسئلة جديدة غير مصنفة. لكي تتعلم، تحتاج هذه النماذج عادةً إلى معلم يقول لها: "أحسنت!" أو "حاول مرة أخرى!" بناءً على مفتاح إجابة صحيح. ولكن ماذا يحدث عندما لا يكون هناك مفتاح إجابة؟ هنا يأتي دور مجال يسمى التعلم المعزز في وقت الاختبار (Test-Time Reinforcement Learning). إنها خدعة ذكية حيث يحاول الذكاء الاصطناعي تعليم نفسه من خلال توليد محاولات عديدة ومختلفة (تسمى "roll-outs") لنفس المشكلة، ثم النظر في عمله الخاص ليعرف ما الذي يجب أن يصدقه.

الطريقة القياسية للقيام بذلك تشبه التصويت في فصل دراسي. إذا أنتج الذكاء الاصطناعي 64 إجابة مختلفة، فإنه ببساطة يقوم بجمعها. إذا قالت 35 إجابة "42" و29 إجابة "17"، فإن الذكاء الاصطناعي يفترض أن "42" هي الحقيقة لأنها حصدت أكبر عدد من الأصوات. ثم يكافئ كل محاولة قالت "42" ويعاقب البقية. هذا يعمل بشكل جيد معظم الوقت، ولكنه يحتوي على عيب قاتل: إنه يعامل التخمين المحظوظ بنفس قدر معاملة الحل العبقري والمبني على منطق سليم، ويتجاهل احتمال أن يكون "الأغلبية" مخطئين بثقة. إذا كانت هناك مجموعة صغيرة من المحاولات الذكية والواثقة تقول "17"، بينما تصرخ مجموعة أكبر من المرتبكين قائلة "42"، فإن نظام التصويت سيقمع الأقلية الذكية. هذا البحث يسأل: هل يمكننا بناء طريقة أذكى ليستمع بها الذكاء الاصطناعي إلى نفسه، طريقة تهتم بكيفية اتفاق الإجابات، وليس فقط بعدد الإجابات التي اتفقت؟


المشكلة في صندوق الاقتراع

تخيل مجموعة من المحققين يحاولون حل جريمة. في الطريقة القديمة (طريقة "تصويت الأغلبية")، يكتفون برفع أيديهم. إذا أشار 60 محققًا إلى الخادم و40 إلى البستاني، فإن الخادم هو المذنب. ولكن ماذا لو كان الـ 60 الذين أشاروا إلى الخادم جميعهم مرتبكون، بينما الـ 40 الذين أشاروا إلى البستاني هم في الواقع الوحيدون الذين قرأوا الأدلة بشكل صحيح؟ سيقوم نظام التصويت بمعاقبة المحققين الأذكياء ومكافأة المرتبكين، مما يجعل الفريق بأكمله أقل ذكاءً بمرور الوقت.

هذا هو بالضبط ما يحدث لنماذج الذكاء الاصطناعي التي تستخدم التعلم المعزز القياسي في وقت الاختبار. فهي تولد مجموعة من الإجابات، وتحصي الفائزين، وتفترض أن الفائز هو المصيب. إذا ارتكب الذكاء الاصطناعي خطأً منهجياً كان شائعاً بالصدفة، فإنه يعزز هذا الخطأ. الأمر يشبه ديمقراطية مكسورة حيث يفوز الصوت الأعلى، حتى لو كان يصرخ بهراء.

دخول CoRE: طاولة المحققين المستديرة

يقترح مؤلفا هذا البحث، أمبوج ميرهيش وسباستيانو فاسكون، طريقة جديدة تسمى CoRE (المكافآت القائمة على الإجماع عبر التوازن - Consensus Rewards via Equilibrium). بدلاً من مجرد عد الرؤوس، يعامل CoRE محاولات الذكاء الاصطناعي كشبكة معقدة من العلاقات.

إليك كيف يعمل ذلك، باستخدام تشبيه بسيط:
تخيل أن محاولات الذكاء الاصطناعي الـ 64 هي أشخاص يجلسون في غرفة.

  1. الرسم البياني (The Graph): بدلاً من مجرد الصراخ بالإجابات، يشكل هؤلاء الأشخاص شبكة ضخمة من الاتصالات. يتصل شخصان ببعضهما إذا أعطيا نفس الإجابة. لكن الاتصال ليس مجرد "نعم/لا"، بل يتم وزنه بناءً على مدى تشابه منطقهما (هل استخدما نفس المنطق؟) ومدة ثقتهما في كلامهما (هل تحدثا بيقين؟).
  2. التوازن (The Equilibrium): يقوم النظام بعد ذلك بتشغيل محاكاة رياضية تسمى "ديناميكيات المكرر" (replicator dynamics). فكر في هذا كلعبة الكراسي الموسيقية حيث يبدأ الأشخاص الذين يحظون بأكبر قدر من الدعم من جيرانهم الواثقين والمنطقيين في الوقوف وتشكيل دائرة ضيقة وقوية. "المجموعة المهيمنة" هي المجموعة التي تمتلك أكبر قدر من الدعم المتبادل.
  3. المكافأة (The Reward): بدلاً من إعطاء درجة بسيطة "ناجح" أو "راسب" لكل من صوّت للفائز، يعطي CoRE درجة متدرجة. إذا كانت إجابتك جزءاً من دائرة منطقية واثقة ومتماسكة، فستحصل على مكافأة عالية. وإذا كنت جزءاً من مجموعة ضعيفة ومرتبكة، فستحصل على مكافأة منخفضة. حتى لو كنت في الأقلية، إذا كانت مجموعتك هي الأكثر تماسكاً وثقة، فقد يختارك CoRE كفائز.

ما وجدوه

اختبر الباحثون طريقة "CoRE" الجديدة مقابل طريقة "تصويت الأغلبية" القديمة عبر سبعة نماذج مختلفة من الذكاء الاصطناعي وخمسة معايسات (benchmarks) في الرياضيات والعلوم. أجروا التجارب باستخدام ثلاثة بذور عشوائية مختلفة (أي ثلاث ظروف بداية مختلفة) للتأكد من أن النتائج حقيقية.

كانت النتائج واعدة للغاية:

  • درجات أفضل: في المتوسط، حسنت النماذج التي تستخدم CoRE دقتها بمقدار 21.7 نقطة مقارنة بنقطة بدايتها بدون أي تعلم. أما طريقة التصويت القديمة فلم تتحسن سوى بمقدار 20.4 نقطة.
  • الفوز في المعارك المتنازع عليها: السحر الحقيقي حدث عندما كانت الإجابات منقسمة. في الحالات التي كان فيها الذكاء الاصطناعي غير متأكد وكان "التصويت" متقارباً، تفوق CoRE على طريقة التصويت بما يصل إلى 7.5 نقطة. لقد نجح في إنقاذ "الأقلية الذكية" التي كان نظام التصويت سيتجاهلها.
  • تعلم أسرع: لم يصبح CoRE أفضل فحسب، بل وصل إلى ذلك بشكل أسرع. فقد وصل إلى نفس مستوى الدقة النهائي لطريقة التصويت في عدد خطوات أقل بنسبة تتراوح بين 54% إلى 70%. وهذا يشير إلى أن المكافآت المتدرجة والدقيقة من CoRE تعطي الذكاء الاصطناعي إشارة أكثر وضوحاً وفائدة للتعلم.

"منطقة الاستعادة"

يوضح البحث أيضاً متى يعمل هذا بأفضل شكل. وجدوا "منطقة استعادة" محددة. إذا كان الذكاء الاصطناعي سيئاً للغاية بحيث لا يستطيع حل المشكلة على الإطلاق، أو جيداً للغاية بحيث يتفق الجميع تماماً، فإن CoRE يعمل تماماً مثل طريقة التصويت القديمة (وهذا جيد). ولكن في المنطقة الوسطى الفوضوية — حيث توجد مجموعة صغيرة من الإجابات الصحيحة والواثقة تقاتل ضد مجموعة أكبر من الإجابات الخاطئة والواثقة — يتألق CoRE.

أثبت المؤلفون رياضياً أنه إذا كانت الإجابات الصحيحة أكثر ثقة ولو قليلاً من الإجابات الخاطئة، يمكن لـ CoRE قلب الطاولة واختيار الإجابة الصحيحة، حتى لو كانت هي الأقلية. الأمر يشبه قاضياً حكيماً يدرك أن المحققين الأربعين الذين لديهم حجة صلبة هم أكثر جدارة بالثقة من الستين محققاً الذين كانوا يخمنون فقط.

الخلاصة

يشير هذا البحث إلى أننا لسنا بحاجة إلى التخلص من نظام التصويت تماماً؛ ففي الواقع، يتضمن CoRE التصويت كحالة خاصة. ولكن من خلال إضافة طبقة من "الذكاء الاجتماعي" — عبر النظر في كيفية دعم الإجابات لبعضها البعض ومدى ثقتها — يمكننا تحويل التصويت الهش والقائم على "الكل أو لا شيء" إلى نظام مكافآت ذكي ومعاير.

يلاحظ المؤلفون بحذر أن هذا ليس عصا سحرية تصلح كل شيء. إذا كان الذكاء الاصطناعي تائهاً تماماً (عند "أرضية الكفاءة")، فلا يمكن لـ CoRE ابتكار إجابة صحيحة من العدم. ولكن بالنسبة للمشكلات الصعبة حيث يكون الذكاء الاصطناعي على وشك أن يكون على صواب ولكنه يرتبك بسبب الحشد، يقترح CoRE طريقة للاستماع إلى صوت العقل الهادئ والواثق بدلاً من مجرد الصرخة الأعلى. إنه يحول مجرد تعداد بسيط للرؤوس إلى محادثة متطورة، مما يساعد نماذج الذكاء الاصطناعي على التعلم بشكل أسرع وأذكى من أخطائها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →