← أحدث الأبحاث
🤖 machine learning

Near-Future Policy Optimization

تقترح الورقة البحثية طريقة "تحسين السياسة للمستقبل القريب" (NPO)، وهي طريقة تعلم تعزيزي ذات سياسة مختلطة تستفيد من نقاط التفتيش المستقبلية للنموذج نفسه كإشارات تدريب عالية الجودة ومنخفضة التباين لتسريع التقارب وتحسين الأداء، إلى جانب نسخة تكيفية تسمى "AutoNPO" تعمل على تحسين هذه العملية تلقائياً.

المؤلفون الأصليون: Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

نُشر 2026-04-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم طالباً كيفية حل المسائل الرياضية المعقدة. لديك كتاب مدرسي (النموذج الذكي)، وتريد أن تجعله أكثر ذكاءً.

في عالم الذكاء الاصطناعي، هناك طريقة شائعة تسمى التعلم التعزيزي بالمكافآت القابلة للتحقق (RLVR). فكر في هذا كحلقة "جرب، افشل، تعلم". يحاول الطالب حل مسألة، وإذا أصاب، يحصل على نجمة ذهبية. وإذا أخطأ، يحاول مرة أخرى. الهدف هو الحصول على أكبر عدد ممكن من النجوم الذهبية.

ومع ذلك، هناك مشكلة في هذه الطريقة: الطالب يعلق في مكانه.

  • في البداية: لا يعرف الطالب ما يكفي لحل المسائل الصعبة، لذا نادراً ما يحصل على نجوم ذهبية. إنه عالق في مرحلة "البداية الباردة".
  • لاحقاً: يصبح الطالب جيداً في أنواع معينة من المسائل، لكنه يتوقف عن التطور. يصطدم بـ "سقف" حيث يكتفي بتكرار نفس الاستراتيجيات، حتى لو لم تكن تلك الاستراتيجيات مثالية.

الحلول القديمة (ولماذا فشلت)

حاول الباحثون إصلاح ذلك بجلب مساعدة خارجية، لكن كلا الخيارين كان بهما عيوب:

  1. "المعلم العبقري" (المعلمون الخارجيون): تجلب معلماً فائق الذكاء ليري الطالب كيفية حل المسألة.
    • المشكلة: المعلم ذكي جداً. طريقة تفكيره مختلفة تماماً عن طريقة تفكير الطالب، مما يسبب ارتباكاً للطالب. الأمر يشبه محاولة تعليم طفل صغير فيزياء الكم؛ لا يستطيع الطالب استيعاب الدرس لأن الفجوة كبيرة جداً.
  2. "الواجبات القديمة" (المسارات السابقة): تجعل الطالب يراجع واجباته الناجحة من الأسبوع الماضي.
    • المشكلة: الواجبات سهلة للغاية. لقد تعلم الطالب هذا المحتوى بالفعل، لذا فهي لا تدفعه لتعلم أي شيء جديد أو أصعب. هو فقط يستمر في فعل ما يعرفه بالفعل.

الفكرة الجديدة: "تحسين السياسة للمستقبل القريب" (NPO)

توصل مؤلفو هذه الورقة البحثية إلى حل عبقري وبسيط: دع الطالب يتعلم من "نفسه المستقبلية".

تخيل آلة زمن. قم بإيقاف تدريب الطالب اليوم. ثم قم بتسريع الزمن به 20 خطوة نحو المستقبل، حيث تعلم قدراً أكبر قليلاً. خذ هذا "الطالب المستقبلي"، واجعله يحل المسائل الصعبة، ثم أحضر تلك الحلول إلى "الطالب الحالي".

هذا هو NPO.

لماذا يعتبر هذا هو الحل "المثالي" (الذي يقع في المنطقة الوسطى بين التطرفين)؟

  • ليس بعيداً جداً (مثل العبقري الخارجي): "الطالب المستقبلي" يسبقك بفارق ضئيل فقط. طريقة تفكيره تشبه إلى حد كبير "الطالب الحالي"، لذا فإن الدروس سهلة الاستيعاب.
  • ليس قريباً جداً (مثل الواجبات القديمة): "الطالب المستقبلي" تعلم بعض الحيل الجديدة ويمكنه حل المسائل التي يفشل فيها "الطالب الحالي". إنه يقدم تحدياً مناسباً تماماً.

كيف يعمل الأمر في الممارسة العملية

اختبر الباحثون هذا بطريقتين:

  1. "الدفعة المبكرة": في البداية، يكون الطالب في حالة صراع. يقوم النظام بسحب "طالب مستقبلي" من فترة زمنية تسبق الوقت الحالي ببضع دقائق فقط من التدريب. هذا يعطي الطالب الحالي دفعة قوية، مما يساعده على التعلم بشكل أسرع مما لو كان بمفرده.
  2. "كسر السقف": لاحقاً، عندما يصطدم الطالب بسقف (يتوقف عن التطور)، يقوم النظام بسحب "طالب مستقبلي" من مرحلة متقدمة جداً. هذا الطالب اكتشف الحيل الصعبة. ومن خلال عرض هذه الحلول على الطالب الحالي، يتم كسر هذا السقف ودفع الطالب إلى مستوى أعلى من الذكاء.

لقد بنوا أيضاً نظام AutoNPO. هذا يشبه مدرباً ذكياً يراقب الطالب. إذا رأى المدرب أن الطالب عالق أو يشعر بالملل، يقرر المدرب تلقائياً: "حسناً، لنأتي بالطالب المستقبلي لتقديم درس سريع"، دون الحاجة لتدخل بشري.

النتائج

عندما اختبروا ذلك على نموذج ذكاء اصطناٍ قوي (Qwen3-VL) يحل مسائل رياضية وألغازاً بصرية:

  • السرعة: تعلم الذكاء الاصطناعي بشكل أسرع بنحو 2.1 مرة في البداية.
  • المهارة: وصل الذكاء الاصطناعي إلى درجة نهائية أعلى من أي طريقة أخرى، حيث حل مسائل أكثر صعوبة.
  • الكفاءة: لم يكن بحاجة إلى حاسوب خارق أو معلم مختلف؛ كان يحتاج فقط إلى النظر إلى نسخة نفسه المستقبلية قليلاً.

استعارة الصورة الكبيرة

فكر في تسلق جبل.

  • الذكاء الاصطناعي القياسي هو متسلق يحاول إيجاد الطريق للأعلى بمفرده. أحياناً يضيع في الضباب (المرحلة المبكرة)، وأحياناً يعلق على حافة مسطحة (المرحلة المتأخرة).
  • المعلمون الخارجيون يشبهون مروحية تسقط خريطة من سلسلة جبال أخرى. الخريطة مثالية، لكن التضاريس مختلفة تماماً بحيث لا يستطيع المتسلق استخدامها.
  • المسارات السابقة تشبه النظر إلى خريطة أسفل الجبل. إنها مألوفة، لكنها لا تساعدك على التسلق عالياً.
  • NPO يشبه المتسلق وهو ينظر إلى نسخة من نفسه تسبقه بخطوات قليلة، وقد وجدت للتو موطئ قدم جديد. إنه الدليل المثالي لأنه يعرف بالضبط أين يقف المتسلق، ويعرف أيضاً إلى أين يتجه بعد ذلك.

باختصار: أفضل طريقة للتعلم ليست بالاستماع إلى عبقري أو إعادة قراءة ملاحظاتك القديمة؛ بل هي التعلم من الشخص الذي أوشكت أن تصبح عليه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →