← أحدث الأبحاث
💬 NLP

You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories

تقدم هذه الورقة البحثية RELEX، وهي طريقة فعالة حوسبياً تستفيد من الاكتشاف القائل بأن مسارات أوزان RLVR قابلة للتنبؤ للغاية ومنخفضة الرتبة لاستقراء نقاط تفتيش النماذج المستقبلية عبر الانحدار الخطي، محققةً أداءً يضاهي أو يتجاوز التدريب الكامل باستخدام جزء ضئيل فقط من الخطوات من خلال تصفية ضوضاء التحسين العشوائية.

المؤلفون الأصليون: Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Chengsong Huang, Jiaxin Huang, Yu Meng

نُشر 2026-05-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Chengsong Huang, Jiaxin Huang, Yu Meng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

المشكلة الكبرى: تدريب الذكاء الاصطناعي يشبه تسلق جبل

تخيل أنك تريد تعليم نموذج لغوي كبير (ذكاء اصطناعي) كيفية حل المسائل الرياضية المعقدة. حالياً، أفضل طريقة للقيام بذلك هي عملية تسمى RLVR (التعلم التعزيزي مع المكافآت القابلة للتحقق).

فكر في RLVR كأنك ترسل الذكاء الاصطناعي في رحلة تنزه طويلة ومكلفة جداً صعوداً نحو قمة "العبقرية الرياضية".

  • التكلفة: تتطلب هذه الرحلة أياماً من وقت الحوسبة القوي (ساعات GPU).
  • العملية: يقوم الذكاء الاصطناعي بآلاف الخطوات الصغيرة، ويتحقق من عمله عند كل نقطة تفتيش.
  • الهدف: أنت تريد للذكاء الاصطناعي أن يصل إلى القمة تماماً (أفضل أداء)، لكن الرحلة طويلة ومكلفة للغاية لدرجة أنك تود التوقف في منتصف الطريق و"تخمين" مكان القمة فقط.

الاكتشاف: الرحلة مستقيمة بشكل مثير للدهشة

لاحظ الباحثون في هذه الورقة شيئاً غريباً حول كيفية تعلم الذكاء الاصطناعي. لقد نظروا إلى "آثار الأقدام" (التغيرات في أوزان دماغ الذكاء الاصطناعي) التي تُترك خلفها أثناء هذه الرحلة.

وجدوا أمرين مذهلين:

  1. المسار عبارة عن خط مستقيم: على الرغم من أن الذكاء الاصطناعي يتحرك في مساحة ثلاثية الأبعاد ضخمة ومعقدة، إلا أن مسار تحسنه الفعلي بسيط للغاية. الأمر يشبه المشي عبر غابة كثيفة ولكنك تتحرك في اتجاه واحد مستقيم فقط.
  2. الوتيرة يمكن التنبؤ بها: السرعة التي يتحسن بها الذكاء الاصطناعي على طول هذا الخط المستقيم هي سرعة خطية تقريباً. إذا رسمت رسماً بيانياً لتقدمه، فسيظهر كخط مستقيم كالمسطرة، وليس منحنى متعرجاً أو فوضوياً.

التشبيه: تخيل أنك تقود سيارة عبر مدينة ضبابية. عادة، تتوقع أن يكون الطريق متعرجاً وملتوياً. لكن الباحثين وجدوا أنه بالنسبة لهذا النوع المحدد من تدريب الذكاء الاصطناعي، فإن الطريق هو في الواقع طريق سريع مستقيم تماماً، والسيارة تتسارع بمعدل ثابت يمكن التنبؤ به.

الحل: RELEX (طريقة "الكرة البلورية")

بناءً على هذا الاكتشاف، ابتكر المؤلفون طريقة تسمى RELEX (الاستقراء بالتعلم التعزيزي - Reinforcement Learning Extrapolation).

بدلاً من جعل الذكاء الاصطناعي يكمل رحلة التنزه كاملة المكونة من 500 خطوة، تقول طريقة RELEX: "دعونا نراقب أول 75 خطوة فقط (حوالي 15% من الرحلة). بما أننا نعلم أن المسار خط مستقيم والسرعة ثابتة، يمكننا رياضياً التنبؤ بدقة أين ستكون السيارة عند الخطوة 500، أو 1,000، أو حتى 2,000."

كيف تعمل (خدعة "إزالة الضجيج"):
عملية تعلم الذكاء الاصطناعي مشوبة ببعض الضجيج، مثل التشويش في الراديو.

  • الضجيج: معظم الهزات الصغيرة والعشوائية في دماغ الذكاء الاصطناعي هي مجرد "تشويش" أو أخطاء لا تساعده فعلياً في أن يصبح أكثر ذكاءً.
  • الإشارة: "العبقرية" الحقيقية مخبأة في ذلك الخط المستقيم الواحد (يسمى مسار الرتبة 1 أو Rank-1 trajectory).
  • السحر: تستخدم RELEX مرشحاً رياضياً (SVD) لتجاهل كل التشويش العشوائي والنظر فقط في ذلك الخط المستقيم الواحد. ثم ترسم خطاً مستقيماً عبر الخطوات الأولى وتمدد هذا الخط للأمام.

النتائج: أسرع، أرخص، وبنفس الجودة

اختبر الباحثون هذه الطريقة على ثلاثة نماذج مختلفة من الذكاء الاصطناعي (Qwen2.5-Math، Qwen3-4B، و Qwen3-8B).

  • الادعاء: من خلال تدريب الذكاء الاصطناعي لمدة 15% إلى 20% فقط من الوقت المعتاد، يمكن لـ RELEX التنبؤ بنقطة تفتيش تقدم أداءً يساوي، أو أحياناً يتفوق على، النموذج الذي تم تدريبه بالكامل.
  • الدليل: اختبروا هذه النماذج "المتنبأ بها" في اختبارات الرياضيات. سجلت النماذج المتنبأ بها نتائج مطابقة تقريباً للنماذج التي أكملت الرحلة الكاملة والمكلفة.
  • الميزة الإضافية: لأن الطريقة تقوم بتصفية "الضجيج"، فإن النماذج المتنبأ بها أحياناً تتعامل بشكل أفضل مع المسائل الرياضية الجديدة وغير المرئية (الاختبارات خارج النطاق - out-of-domain benchmarks) مقارنة بالنماذج المدربة بالكامل.

لماذا يهم هذا (وفقاً للورقة البحثية)

  • لا حاجة لتعلم جديد: لا تحتاج RELEX لتدريب ذكاء اصطناعي جديد للتنبؤ بالمستقبل. إنها تقوم فقط بعملية حسابية بسيطة (الانحدار الخطي - linear regression) على البيانات التي تملكها بالفعل.
  • إنها "تقليلية" (Minimalist): تثبت الورقة أنك لست بحاجة لتنبؤات معقدة وفخمة. خط مستقيم بسيط يكفي لأن مسار تعلم الذكاء الاصطناعي هو بطبيعته بهذا القدر من البساطة.
  • إزالة الضجيج الطيفي (Spectral Denoising): تعمل الطريقة بشكل جيد لأنها تعمل مثل سماعات إلغاء الضجيج. فهي تجرد عملية التدريب من الأجزاء العشوائية والفوضوية التي عادة ما تفسد التنبؤات، تاركة فقط إشارة التحسن النقية.

الملخص

تخيل أنك تشاهد إطلاق صاروخ. عادة، يجب أن تشاهده طوال الطريق حتى يصل إلى الفضاء لتعرف ما إذا كان قد نجح أم لا. تقول هذه الورقة: "انتظروا، الصاروخ يطير في خط مستقيم تماماً وبسرعة ثابتة. إذا شاهدناه لدقيقة واحدة فقط، يمكننا حساب مكانه بدقة في الساعة القادمة، وسيكون ناجحاً تماماً كما لو أننا انتظرنا طوال الوقت."

طريقة RELEX هي تلك الآلة الحاسبة. إنها توفر كميات هائلة من الوقت والمال من خلال إدراك أن تدريب الذكاء الاصطناعي، رغم أنه يبدو فوضوياً، يتبع في الواقع مساراً بسيطاً وقابلاً للتنبؤ به للغاية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →