← أحدث الأبحاث
💬 NLP

SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models

تقدم هذه الورقة البحثية "تدرج السياسة الساندويتشي" (Sandwiched Policy Gradient - SPG)، وهي طريقة جديدة للتعلم التعزيزي تستخدم كلاً من الحدود العليا والدنيا للاحتمالية اللوغاريتمية للتغلب على عدم قابلية الحساب في نماذج اللغة الانتشارية، متفوقة بشكل كبير على النماذج المرجعية الحالية في اختبارات الاستدلال الرياضي والمنطقي.

المؤلفون الأصليون: Chenyu Wang, Paria Rashidinejad, DiJia Su, Song Jiang, Sid Wang, Siyan Zhao, Cai Zhou, Shannon Zejiang Shen, Feiyu Chen, Tommi Jaakkola, Yuandong Tian, Bo Liu

نُشر 2026-04-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chenyu Wang, Paria Rashidinejad, DiJia Su, Song Jiang, Sid Wang, Siyan Zhao, Cai Zhou, Shannon Zejiang Shen, Feiyu Chen, Tommi Jaakkola, Yuandong Tian, Bo Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

الصورة الكبيرة: طريقة جديدة لتعليم الذكاء الاصطناعي التفكير

تخيل أن لديك طالباً ذكياً جداً (الذكاء الاصطناعي)، وهو بارع في كتابة القصص، لكنه يكتبها كلمة بكلمة، مثل الطابع. هذه هي طريقة عمل معظم نماذج الذكاء الاصطناعي اليوم (وتسمى Autoregressive أو النماذج ذاتية الانحدار).

مؤخراً، ظهر نوع جديد من الطلاب يسمى نموذج الانتشار (Diffusion Model). بدلاً من الكتابة كلمة بكلمة، ينظر هذا الطالب إلى صفحة بيضاء مليئة بالخربشات (الضجيج/Noise) ويحاول "تنظيفها" دفعة واحدة للكشف عن القصة النهائية. هذا أسرع بكثير لأنهم يستطيعون إصلاح العديد من الكلمات في وقت واحد.

ومع ذلك، هناك مشكلة: كيف نعلم هذا "طالب التنظيف" ليصبح أفضل في الرياضيات أو المنطق؟

في الماضي، استخدمنا طريقة تسمى التعلم التعزيزي (Reinforcement Learning - RL). فكر في هذا كمعلم يعطي الطالب درجة (مكافأة) بعد انتهائه من الاختبار.

  • إذا كانت الإجابة صحيحة، يقول المعلم: "عمل رائع! افعل المزيد من هذا!"
  • إذا كانت الإجابة خاطئة، يقول المعلم: "عمل سيء! توقف عن فعل ذلك!"

المشكلة مع نماذج الانتشار هي أن المعلم لا يستطيع بسهولة حساب الدرجة لإجابة معينة بينما لا يزال الطالب في مرحلة "تنظيف" الضجيج. الأمر يشبه محاولة تقييم لوحة فنية بينما الفنان لا يزال يمزج الألوان على اللوحة. ولأن المعلم لا يستطيع رؤية الدرجة الدقيقة، فإنه يضطر للتخمين. الطرق السابقة قدمت "أفضل تخمين"، ولكنه كان خاطئاً في كثير من الأحيان، مما أدى إلى تعلم الطالب دروساً خاطئة.

الحل: استراتيجية "الساندوتش"

يقترح مؤلفو هذه الورقة البحثية طريقة تعليم جديدة تسمى SPG (Sandwiched Policy Gradient).

تخيل أن المعلم يحاول تقدير "الجودة الحقيقية" لإجابة الطالب، لكنه لا يستطيع رؤيتها مباشرة. بدلاً من ذلك، يستخدم ساندوتش (شطيرة):

  1. الخبز السفلي (الحد الأدنى - Lower Bound): عندما يحصل الطالب على إجابة جيدة (مكافأة عالية)، يستخدم المعلم "تقديراً آمناً ومتحفظاً" (الحد الأدنى). يقول المعلم: "نحن نعلم أن هذا جيد بهذا القدر على الأقل. فلنشجعه!"
  2. الخبز العلوي (الحد الأعلى - Upper Bound): عندما يحصل الطالب على إجابة سيئة (مكافأة منخفضة)، يستخدم المعلم "تقديراً صارماً ومتشائماً" (الحد الأعلى). يقول المعلم: "نحن نعلم أن هذا بالتأكيد ليس أفضل من هذا. فلنمنعه من فعله!"

من خلال "وضع الجودة الحقيقية غير المرئية بين ساندوتش" (أي حصرها بين أرضية آمنة وسقف صارم)، يمكن للمعلم توجيه الطالب بدقة أكبر بكثير مما سبق.

  • الطريقة القديمة: كان المعلم ينظر فقط إلى الخبز السفلي لكل شيء. وهذا يعني أنهم كانوا طيبين جداً تجاه الإجابات السيئة ولم يعاقبوها بما يكفي.
  • طريقة SPG: يستخدم المعلم الخبز السفلي للإجابات الجيدة، ويقلب الساندوتش لاستخدام الخبض العلوي للإجابات السيئة. هذا يخلق توازناً مثالياً.

السر الصغير: القناع المعتمد على الكتل (Block-Wise Masking)

كانت هناك مشكلة أخرى. عندما حاول المعلم تخمين جودة الإجابة، كان ينظر إلى عمل الطالب بطريقة عشوائية وفوضوية. كان الأمر يشبه مطالبة طالب بإصلاح جملة عن طريق مسح كلمات عشوائية واحدة تلو الأخرى، مما أربك الطالب.

قدم المؤلفون استراتيجية القناع المعتمد على الكتل (Block-Wise Masking).

  • التشبيه: تخيل أن الطالب يكتب قصة. بدلاً من مسح كلمات عشوائية من الصفحة بأكملها، يطلب منه المعلم التركة في فقرة واحدة في كل مرة.
  • يحافظ المعلم على بداية القصة نظيفة، ويمسح الفقرة الوسطى (الكتلة)، ويحافظ على النهاية نظيفة.
  • يساعد هذا الطالب على فهم السياق بشكل أفضل. الأمر يشبه التدرب على أغنية من خلال التركيز على مقطع موسيقي واحد محدد بدلاً من نوتات عشوائية مبعثرة عبر الورقة الموسيقية بأكملة. هذا يجعل عملية التعلم أكثر استقراراً وكفاءة.

النتائج: أذكى، أسرع، وأكثر دقة

اختبرت الورقة البحثية هذا "المعلم الساندوتش" في أربعة تحديات صعبة:

  1. GSM8K & MATH500: مسائل رياضية لفظية معقدة.
  2. Countdown: لعبة حيث يتعين عليك استخدام الأرقام للوصول إلى هدف معين.
  3. Sudoku: لغز الأرقام الشهير.

النتائج:
لقد اكتسح منهج SPG المنافسة.

  • في Sudoku، حسّن الدقة بنسبة هائلة بلغت 27% مقارم أفضل طريقة سابقة.
  • في Countdown، ارتفع بنسبة 18%.
  • في المسائل الرياضية، تحسن بنسبة 3-4%.

في عالم الذكاء الاصطناعي، تحسن بنسبة 3% في المسائل الرياضية هو أمر ضخم. هذا يعني أن الذكاء الاصطناعي أصبح فجأة أكثر موثوقية في حل الألغاز المنطقية.

الملخص

  • المشكلة: نماذج الذكاء الاصطناعي من نوع "الانتشار" سريعة ولكن من الصعب تدريبها باستخدام المكافآت لأننا لا نستطيع حساب "درجتها" بسهولة.
  • الحل: ساندوتش SPG. نستخدم "أرضية آمنة" لتشجيع الإجابات الجيدة و"سقفاً صارماً" لمعاقبة الإجابات السيئة، مما يعطي الذكاء الاصطناعي إشارة أوضح للتحسن.
  • الحيلة: نعلم الذكاء الاصطناعي في كتل (أجزاء) بدلاً من قطع عشوائية، مما يجعل عملية التدريب أكثر سلاسة.
  • النتيجة: يصبح الذكاء الاصطناعي أذكى بكثير في الرياضيات والمنطق، مما يثبت أن نهج "الساندوتش" هذا هو مستقبل تدريب نماذج الذكاء الاصطناوية السريعة والمتوازية.

باختصار، وجد المؤلفون طريقة لإعطاء طالب الذكاء الاصطناعي (السريع والمشتت) تعليمات أكثر وضوحاً، مما حوله إلى عبقري في الرياضيات والمنطق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →