تقدم هذه الورقة RLSD، وهو نموذج تدريب مبتكر يجمع بين الإشارات المستقرة والموجهة لتعلم التعزيز مع المكافآت القابلة للتحقق (RLVR) وبين تعديلات المقدار دقيقة التفاصيل من التقطير الذاتي في السياسة المتبعة (on-policy self-distillation)، مما يتغلب على مشكلات تسرب المعلومات وعدم الاستقرار الموجودة في نهج التقطير الذاتي الصرف، مع تحقيق تقارب واستقرار تدريب فائقين.
تخيل أنك تقوم بتدريب طالب عبقري لكنه يفتقر للخبرة (نموذج ذكاء اصطناعي) لحل مسائل رياضية معقدة. أنت تريد منه أن يتحسن في التفكير والاستنتاج، وليس مجرد حفظ الإجابات.
هناك طريقتان رئيسيتان حاول الناس من خلالهما تعليم هذا الطالب مؤخرًا:
1. المدرب الذي يكتفي بـ "صح/خطأ" (RLVR):
كيف تعمل: يحاول الطالب حل مسألة ما. وفي النهاية تمامًا، تقول له: "صحيح!" أو "خطأ".
المشكلة: هذا يشبه مدربًا لا يصرخ إلا بكلمات مثل "عمل جيد!" أو "عمل سيء!" بعد انتهاء المباراة بأكملة. لا يعرف الطالب أي خطوة محددة كانت عبقرية وأيها كانت خطأً. يحصل على إشارة غامضة وعليه أن يخمن ما الذي يجب تحسينه.
2. المعلم الذي يقدم "الإجابة المثالية" (التقطير الذاتي داخل السياسة / OPSD):
كيف تعمل: يحاول الطالب حل مسألة ما. وفي هذه الأثناء، نسخة "معلم" من نفس الطالب (لديه وصول إلى مفتاح الإجابات السري) يراقب ويقول: "بالنسبة لهذه الكلمة تحديدًا، كان يجب أن تقول هذا".
المشكلة: المعلم لديه ورقة غش (مفتاح الإجابة) لا يملكها الطالب. إذا حاول الطالب جاهدًا نسخ كلمات المعلم بدقة، فإنه يبدأ في حفظ ورقة الغش بدلًا من تعلم كيفية التفكير. وعندما يخوض اختبارًا حقيقيًا بدون ورقة الغش، يصاب بالارتباك لأنه تدرب على الاعتماد على معلومات لا يملكها في الواقع.
الاكتشاف: لماذا تفشل طريقة "المعلم"؟
اكتشف مؤلفو هذه الورقة فخًا خفيًا في طريقة "المعلم".
التشبيه: تخيل طالبًا يؤدي اختبارًا. المعلم يهمس بالإجابة للطالب أثناء كتابته. يكتب الطالب الإجابة بشكل مثالي.
الفخ: مع مرور الوقت، يتوقف الطالب عن تعلم كيفية حل المسألة. بدلاً من ذلك، يتعلم كودًا سريًا: "عندما أرى السؤال X، يجب أن أكتب الإجابة Y لأن المعلم أخبرني بذلك".
النتيجة: عندما يتوقف المعلم عن الهمس (أثناء الاختبار الحقيقي)، يصاب الطالب بالذعر. يحاول تخمين ما الذي كان المعلم سيهمس به، مما يؤدي إلى الهلوسة وتراجع الأداء. تطلق الورقة على هذا اسم "تسرب المعلومات المميزة" (Privileged Information Leakage). الطالب يسرب معلومات لا يُفترض به امتلاكها.
الحل: RLSD (طريقة "بطاقة النتائج الذكية")
اقترح المؤلفون طريقة جديدة تسمى RLSD (التعلم التعزيزي مع التقطير الذاتي). لقد أدركوا أنهم ليسوا بحاجة للتخلص من "المعلم"؛ بل يحتاجون فقط لتغيير كيفية حديث المعلم.
بدلاً من إخبار الطالب بماذا يقول (الكلمات المحددة)، يخبر المعلم الطالب فقط مدى أهمية كل كلمة.
إليك كيف تعمل، خطوة بخوة:
1. الاتجاه يأتي من المدرب (البيئة)
القاعدة: القرار النهائي بشأن ما إذا كانت الإجابة الكاملة "جيدة" أم "سيئة" يأتي حصريًا من البيئة (الإجابة الصحيحة للمسألة الرياضية).
التشبيه: لا يزال المدرب يطلق صافرة النهاية في المباراة. إذا فاز الفريق، يحصل الجميع على "عمل جيد". إذا خسروا، يحصل الجميع على "حاول بجهد أكبر". هذا يضمن عدم تعلم الطالب الاتجاه الخاطئ.
2. المقدار يأتي من المعلم (التقطير الذاتي)
القاعدة: ينظر المعلم (الذي يرى الإجابة السرية) إلى عمل الطالب ويخصص "درجة ائتمان" لكل كلمة بمفردها.
التشبيه:
السيناريو أ (المسار الصحيح): الطالب يحل مسألة رياضية. يكتب "2 + 2 = 4". يرى المعلم أن هذه خطوة حاسمة نحو الإجابة الصحيحة ويقول: "رائع! هذه الكلمة تحصل على مكافأة ضخمة!"
السيناريو ب (المسار الخاطئ): الطالب يكتب "2 + 2 = 5". يرى المعلم أن هذا خطأ فادح ويقول: "هذه الكلمة تحصل على عقوبة ضخمة!"
السيناريو ج (الحشو): الطالب يكتب "دعونا نفكر في هذا...". يقول المعلم: "هذا جيد، لكنه ليس مهمًا للغاية. فقط مكافأة صغيرة".
3. الخدعة السحرية: فصل الاتجاه عن المقدار
هذا هو الابتكار الجوهري.
الطريقة القديمة (OPSD): كان المعلم يقول: "قل هذه الكلمة". (هذا أجبر الطالب على نسخ ورقة الغش).
الطريقة الجديدة (RLSD): يقول المدرب: "لق لقد فزتم!" (الاتجاه). ويقول المعلم: "لقد قمت بعمل رائع في الخطوة 3، لكن الخطوة 5 كانت ضعيفة" (المقدار).
يتعلم الطالب: "أنا بحاجة للاستمرار في فعل الأشياء التي تؤدي إلى الفوز، ويجب أن أبذل جهدًا إضافيًا في الخطوات المحددة التي يرى المعلم أنها مهمة".
لماذا يعد هذا تغييراً جذرياً؟
لا غش: بما أن المعلم لا يخبر الطالب أبدًا بماذا يقول، بل يخبره فقط بمقدار الاهتمام بما قاله، فلا يمكن للطالب تسريب الإجابة السرية. إنه يتعلم المنطق، وليس ورقة الغش.
تعلم سريع جداً: يحصل الطالب على ملاحظات تفصيلية حول كل كلمة (مثل نظام GPS يعطي توجيهات خطوة بخطوة) بدلاً من مجرد درجة نهائية. وهذا يجعله يتعلم بشكل أسرع بكثير.
الاستقرار: لا ينهار الطالب لاحقًا (مثل طريقة المعلم القديمة) لأنه دائمًا مرتبط بإشارة "الصح/الخطأ" الحقيقية من المدرب.
تشبيه ملخص: دليل لعبة الفيديو
RLVR (الطريقة القديمة): تلعب لعبة فيديو. تموت. تقول اللعبة "انتهت اللعبة". تحاول مرة أخرى. ليس لديك أدنى فكرة عن العدو الذي قتلك.
OPSD (المعلم المعطل): تلعب اللعبة. نسخة منك في "وضع الإله" (ترى المستقبل) تهمس: "اقفز هنا! لا تطلق النار هناك!". تحفظ الهمسات. ولكن عندما تلعب بدون الهمسات، تفشل لأنك لم تتعلم ميكانيكا اللعبة، بل حفظت النص فقط.
RLSD (الطريقة الجديدة): تلعب اللعبة. تقول اللعبة "انتهت اللعبة" (المدرب). ولكن يظهر لك إعادة عرض توضح خريطة حرارية: "لقد مت لأنك أخطأت في هذه القفزة (منطقة حمراء). لقد نجوت لأنك تفاديت هذا الليزر (منطقة خضراء)". تتعلم القفز والمراوغة بشكل أفضل، دون الحاجة إلى النص.
باخت تختصار: تأخذ RLSD أفضل الأجزاء من وجود معلم ذكي ولوحة نتائج واضحة، تجمع بينهما، وتصلح العيب الذي يجعل الطلاب يبدؤون في الغش عبر حفظ أسرار المعلم. النتيجة هي ذكاء اصطناعي يتعلم التفكير بشكل أسرع، وأكثر استقرارًا، ودون ارتباك.
إليك ملخص تقني مفصل لورقة البحث "Self-Distilled RLVR" (RLSD).
1. بيان المشكلة
تتناول الورقة مشكلة عدم الاستقرار الحرجة في التقطير الذاتي عبر السياسة الواحدة (On-Policy Self-Distillation - OPSD)، وهو نموذج تدريب شائع للنماذج اللغوية الكبيرة (LLMs).
السياق: في OPSD، يعمل نموذج واحد كطالب ومعلم في آن واحد. نسخة "المعلم" تكون مشروطة بـ معلومات مميزة (r)، مثل مسار استدلال تم التحقق منه أو الإجابة الصحيحة، بينما لا يرى "الطالب" سوى المدخل (x). الهدف هو استخدام إشارات المعلم الكثيفة على مستوى الرمز (token-level) لتوجيه تعلم الطالب.
نمط الفشل: رغم المكاسب الأولية في الأداء، يعاني OPSD من تسرب شديد للمعلومات المميزة وعدم استقرار في التدريب. يتعلم النموذج "الغش" ضمنيًا عن طريق تشفير الارتباطات بين المدخل (x) والمعلومات المميزة (r) في معلماته. أثناء الاستنتاج (حيث لا تتوفر r)، يستدعي النموذج صراحةً هذه المراجع غير المرئية، مما يؤدي إلى ذروة سريعة في الأداء يتبعها تدهور منهجي.
السبب الجذري: يجادل المؤلفون بأن مطابقة التوزيع القياسية في OPSD هي عملية غير محددة جيدًا (ill-posed) تحت حالة عدم تماثل المعلومات. يُجبر الطالب على مطابقة توزيع شرطي P(y∣x,r) يعتمد على r التي لا يستطيع رؤيتها. هذا يخلق فجوة معلومات متبادلة غير قابلة للاختزال، تدفع النموذج لتعلم ارتباطات زائفة بين x→r بدلاً من الاستدلال الحقيقي.
2. المنهجية: RLSD (RLVR مع التقطير الذاتي)
يقترح المؤلفون RLSD، وهو نموذج تدريب جديد يفصل بين اتجاه التحديثات عن مقدار التحديثات، مستفيدًا من نقاط القوة في كل من التعلم التعزيزي بالجوائز القابلة للتحقق (RLVR) والتقطير الذاتي.
المفهوم الجوهري
بدلاً من استخدام المعلم كهدف توليدي لمطابقة التوزيع (مما يسبب التسرب)، يعيد RLSD توظيف المعلم كـ مقيم ائتمان على مستوى الرمز (token-level credit evaluator) ضمن إطار عمل تدرج السياسة (policy gradient).
الخطوات الخوارزمية
اتجاه على مستوى التسلسل (RLVR):
يولد النموذج مسارًا y.
يقدم المُتحقق (verifier) مكافأة ثنائية R(x,y) (0 أو 1).
يتم حساب ميزة (advantage) على مستوى التسلسل A (على سبيل المثال، عبر تحسين السياسة النسبية للمجموعات - GRPO). هذا يحدد اتجاه التحديث: موجب للمسارات الصحيحة، وسالب للمسارات غير الصحيحة. هذا يربط عملية التحسين بالبيئة، مما يضمن الموثوقية.
المقدار على مستوى الرمز (التقطير الذاتي):
يحسب النموذج كسب المعلومات المميزة (Δt) لكل رمز yt: Δt=sg(logPT(yt∣x,r)−logPS(yt∣x)) حيث PT هو المعلم (المشروط على r) و PS هو الطالب (المشروط على x فقط). يضمن التوقف عند التدرج (sg) أن تكون Δt وزنًا ثابتًا.
يمثل هذا الكسب مدى قيام المعلومات المميزة بتعديل اعتقاد النموذج حول الرمز.
يتم بناء وزن على مستوى الرمز wt: wt=exp(sign(A)⋅Δt)=(PS(yt)PT(yt))sign(A)
التفسير:
إذا كان المسار صحيحًا (A>0)، فإن الرموز المدعومة بالمعلومات المميزة (PT>PS) تحصل على ائتمان إيجابي أعلى.
إذا كان المسار غير صحيح (A<0)، فإن الرموز غير المفضلة من قبل المعلومات المميزة (PT<PS) تحصل على لوم سلبي أعلى.
الميزة النهائية على مستوى الرمز هي A^t=A⋅clip(wt,1−ϵ,1+ϵ).
تُستخدم هذه لتحديث السياسة، لتحل محل الميزة الموحدة المستخدمة في GRPO القياسي.
مبادئ التصميم الرئيسية
تثبيت الاتجاه (Direction Anchoring): يتم تحديد اتجاه التحديث بصرامة بواسطة مكافأة البيئة (A)، مما يمنع المعلومات المميزة من قلب إشارة التدرج.
تعديل المقدار (Magnitude Modulation): تقوم المعلومات المميزة فقط بتغيير شدة التحديث لرموز محددة، مما يسمح بالتمييز الدقيق دون تغيير هدف التعلم الأساسي.
لا يوجد فقدان مساعد (No Auxiliary Loss): لا يتطلب RLSD نموذج معلم خارجي أو دوال فقدان مساعدة؛ فهو يحتاج فقط إلى تمريرة أمامية إضافية لحساب لوغاريتمات (logits) المعلم.
3. المساهمات الرئيسية
التشخيص النظري لـ OPSD:
أثبت أن هدف OPSD يحتوي على فجوة معلومات متبادلة غير قابلة للاختزال (I(Yt;R∣X,Y<t)>0) بسبب عدم تماثل المعلومات.
أظهر أن هذه الفجوة تجعل التدرج يحتوي على حد انحراف يعتمد على المسار، مما يدفع النموذج لتشفير ارتباطات x→r، مما يؤدي للتسرب وانهيار الأداء.
وضع ثلاثية المستحيل (Impossibility Trilemma) للتقطير الذاتي المشترك المعلمات: لا يمكن تحقيق الاستقرار في الهدف، والتحسن المستدام، والتدريب الخالي من التسرب في آن واحد تحت مطابقة التوزيع.
اقتراح RLSD:
قدم نموذجًا يوحد RLVR والتقطير الذاتي باستخدام المعلم فقط لـ تحديد مقدار تخصيص الائتمان بدلاً من مطابقة التوزيع.
قدم برهانًا رسميًا بأن RLSD محصن هيكليًا ضد تسرب المعلومات المميزة لأن اتجاه التدرج منفصل عن إشارة المعلومات المميزة.
التحقق التجريبي:
أثبت أن RLSD يحقق سقف تقارب أعلى واستقرارًا فائقًا مقارنة بـ GRPO و OPSD.
أظهر تفوق RLSD على النماذج المرجعية في مهام الاستدلال متعدد الوسائط المعقدة.
4. النتائج التجريبية
قيم المؤلفون RLSD على نموذج Qwen3-VL-8B-Instruct عبر خمسة اختبارات معايير للاستدلال متعدد الوسائط (MMMU, MathVista, MathVision, ZeroBench, WeMath).
الأداء: حقق RLSD أعلى متوسط دقة (56.18%)، متفوقًا على النموذج الأساسي بنسبة 4.69% وعلى GRPO القياسي بنسبة 2.32%.
سرعة التقارب: تجاوز RLPD نموذج GRPO الذي تم تدريبه لضعف عدد الخطوات، وذلك في 200 خطوة فقط، مما يدل على سرعة تقارب أكبر.
الاستقرار: على عكس OPSD، الذي بلغ ذروته مبكرًا ثم تدهور، حافظ RLSD على ديناميكيات تدريب مستقرة وتجنب مرحلة "انهيار الأداء".
تحليل تخصيص الائتمان: أكدت التصورات (الخرائط الحرارية) أن RLSD خصص بشكل صحيح ائتمانًا عاليًا لخطوات الاستدلال الحاسمة (مثل خطوات الحساب) ولومًا عاليًا للأخطاء (مثل الخطأ في قراءة رسم بياني)، بينما طبق GRPO ائتمانًا موحدًا وأظهر OPSD علامات على التسرب.
5. الأهمية
حل مشكلة التسرب: تقدم الورقة حلاً نظريًا وعمليًا صارمًا لمشكلة تسرب المعلومات طويلة الأمد في التقطير الذاتي، مما يسمح بالاستخدام الآمن للمعلومات المميزة (مثل الإجابات المرجعية) أثناء التدريب دون المساس بسلامة الاستنتاج.
الكفاءة: يعد RLSD بديلاً "جاهز للاستبدال" (drop-in replacement) لـ GRPO القياسي، حيث لا يتطلب نماذج معلم خارجية، مما يقلل بشكل كبير من العبء الحسابي مع توفير إشراف كثيف على مستوى الرمز.
تحول في النموذج (Paradigm Shift): يتحدى الرؤية السائدة بأن التقطير الذاتي يجب أن يعتمد على مطابقة التوزيع. من خلال إعادة صياغة دور المعلم كـ معدل للمقدار بدلاً من هدف توليدي، يفتح المؤلفون مسارًا جديدًا لتدريب نماذج استدلال مستقرة وعالية الأداء.
القابلية للتعميم: رغم التحقق منه في الاستدلال متعدد الوسائط، فإن إطار العمل قابل للتطبيق في أي إعداد RLVR توجد فيه نتائج قابلة للتحقق، مما يوفر بديلًا قويًا لـ RL ضعيف المكافأة (sparse-reward RL) والتقطير الذاتي غير المستقر.