GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
يُعد GoLongRL إطار عمل مفتوح المصدر يعزز التعلم المعزز للسياقات الطويلة من خلال مجموعة بيانات موجهة نحو القدرات تضم 23 ألف عينة متنوعة من التعلم المعزز من التغذية الراجعة البشرية (RLVR) وخوارزمية TMN-Reweight المبتكرة لتحسين المهام المتعددة غير المتجانسة، محققاً أداءً يضاهي النماذج الرائدة مغلقة المصدر.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم طالب ذكي جداً لكنه يعاني من قصر فترة الانتباه، كيف يقرأ ويفهم مكتبة ضخمة من الكتب، وليس مجرد صفحة واحدة. هذا هو تحدي "السياق الطويل" (long-context) في الذكاء الاصطناوي. تقدم ورقة البحث GoLongRL وصفة جديدة لتدريب هذه النماذج، مع التركيز على مشكلتين رئيسيتين: ماذا تعلمهم (البيانات) و كيف تصحح واجباتهم المنزلية (الخوارزمية).
إليك التفاصيل باستخدام تشبيهات بسيطة:
1. المشكلة: الطريقة القديمة كانت ضيقة للغاية
كانت الطرق السابقة لتعليم الذكاء الاصطناعي قراءة الكتب الطويلة تشبه تدريب طالب فقط على ألغاز "أين الإبرة في كومة القش؟".
- المشكلة: كانوا ينشئون بيانات تجعل الذكاء الاصطناعي يبحث عن حقائق محددة مخبأة في نصوص طويلة. وبينما ساعد هذا الذكاء الاصطناعي في إيجاد "الإبر"، إلا أنه لم يعلمه كيفية تلخيص "كومة القش" بأكملها، أو ترتيب الأجزاء الأكثر أهمية، أو فهم القصص المعقدة.
- النتيجة: أصبح الذكاء الاصطناعي جيداً في إيجاد حقائق محددة، لكنه كان سيئاً في مهارات أخرى مثل تلخيص رواية أو تنظيم تقرير فوضوي. كان الأمر يشبه طالباً يمكنه إيجاد كلمة محددة في القاموس، لكنه لا يستطيع كتابة مقال.
2. الحل: "منهج دراسي" قائم على القدرات
قرر مؤلفو GoLongRL التوقف عن مجرد صنع "عمليات بحث عن إبر" وبدلاً من ذلك بناء منهج دراسي شامل يعتمد على 9 مهارات يحتاجها القارئ الذكي.
- مجموعة البيانات (الكتب المدرسية): قاموا ببناء مجموعة بيانات جديدة تضم 23,000 مسألة تدريبية.
- كتب حقيقية، وليست وهمية: بدلاً من تأليف قصص وهمية، استخدموا كتباً حقيقية، وأوراقاً أكاديمية، ووثائق قانونية. وطلبوا من الذكاء الاصطناعي توليد أسئلة حول هذه النصوص الحقيقية. هذا يضمن أن يتعلم الذكاء الاصطناعي التعامل مع الطريقة الطبيعية والفوضوية التي يكتب بها البشر.
- المهارات التسعة: تغطي مجموعة البيانات مهام متنوعة مثل:
- الاسترجاع الدقيق: إيجاد حقيقة محددة.
- التلخيص: تكثيف فصل طويل في بضع جمل.
- الترتيب: تحديد أي من نتائج البحث المتعددة هي الأكثر فائدة.
- الاستنتاج: حل مسائل رياضية موجودة داخل تقرير مالي.
- التشبيه: تخيل بدلاً من إعطاء طالب 10,000 اختبار متطابق لـ "ابحث عن الكرة الحمراء"، تعطي له مزيجاً من 10,000 اختبار: بعضها يطلب منه إيجاد كرة حمراء، وبعضها الآخر يطلب منه تلخيص اللعبة، وبعضها يطلب منه ترتيب اللاعبين، وبعضها يطلب منه حل مسألة رياضية عن النتيجة.
النتيجة: حتى بدون حيل رياضية معقدة، فإن مجرد استخدام هذا "المنهج الدراسي" الأفضل جعل الذكاء الاصطناعي يتفوق في الأداء على منافس من الفئة الأولى من النماذج مغلقة المصدر (QwenLong-L1.5).
3. الخوارزمية: نظام "التصحيح العادل" (TMN-Reweight)
بمجرد امتلاك منهج دراسي متنوع، فأنت بحاجة إلى طريقة لتصحيح أداء الطالب بشكل عادل. كان لطريقة التصحيح القياسية (المسماة GRPO) عيب عند التعامل مع أنواع مختلفة من الأسئلة.
- المشكلة: تخيل اختباراً في الرياضيات حيث تحصل الإجابة الصحيحة على 100 نقطة، واختباراً في الفهم القرائي حيث تحصل الإجابة الصحيحة على نقطة واحدة فقط. إذا خلطت بينهما، فستسيطر أسئلة الرياضيات على عقل الطالب، وسيتجاهل القراءة. أيضاً، إذا كان السؤال صعباً للغاية، فقد يرتبك نظام التصحيح القياسي ويعطي الطالب ائتماناً كبيراً بسبب تخمين محظوظ أو ائتماناً قليلاً جداً بسبب اقترابه من الإجابة دون إصابتها.
- الحل (TMN-Reweight): ابتكر المؤلفون نظام تصحيح جديداً يتكون من خطوتين:
- تساوي الفرص (التطبيع على مستوى المهمة): قاموا بتعديل الدرجات بحيث تبدو الدرجة "المثالية" في مسألة رياضية مساوية للدرجة "المثالية" في مسألة ترتيب. هذا يمنع الذكاء الاصطناعي من تجاهل المهام الصعبة لمجرد أن أرقامها تبدو أصغر.
- التركيز على الجهد المبذول (إعادة الوزن التكيفي مع الصعوبة):
- إذا أجاب الطالب على سؤال سهل بشكل صحيح، يقول المعلم: "عمل جيد، لكنك كنت تعرف هذا بالفعل"، ويعطي مكافأة صغيرة.
- إذا أجاب الطالب على سؤال صعب بشكل صحيح (وهو أمر نادر)، يقول المعلم: "واو، كان ذلك صعباً! عمل رائع في اكتشاف ذلك!" ويعطي مكافأة ضخمة.
- إذا أخطأ الطالب في سؤال صعب، لا يغضب المعلم؛ بل يكتفي بالقول: "لنحاول مرة أخرى"، ويقلل العقوبة حتى لا يشعر الطالب بالإحباط.
التشبيه: الأمر يشبه مدرباً لا يكتفي فقط بعدّ النقاط. المدرب يعدل النتيجة بناءً على مدى صعوبة اللعبة ويركز الثناء الإضافي على اللعبات التي كان من الصعب تنفيذها. هذا يساعد الذكاء الاصطناوي على التعلم بشكل أسرع وأكثر توازناً عبر جميع المهارات.
4. النتائج: طالب متكامل المهارات
عندما اختبروا هذه الطة الجديدة:
- أفضل في كل شيء: تحسن الذكاء الاصطناعي بشكل ملحوظ في جميع المهارات التسعة، وليس فقط في مهارات "إيجاد الإبر".
- لا توجد مقايضات: عادةً، عندما تدرب طالباً ليكون بارعاً في شيء واحد (مثل قراءة الكتب الطويلة)، فإنه يصبح أسوأ في أشياء أخرى (مثل المنطق العام أو الذاكرة). هذه الطريقة حسنت بالفعل مهارات الاستنتاج العام والذاكرة لدى الذكاء الاصطناعي أثناء تعليمه قراءة السياق الطويل.
- مفتوح المصدر: أصدر المؤلفون "المنهج الدراسي" بالكامل (مجموعة البيانات)، و"خطة التدريس" (الكود)، و"معيار التصحيح" (الخوارزمية) ليتمكن أي شخص من استخدامها.
الملخص
GoLongRL يشبه ترقية تعليم الذكاء الاصطناعي من تدريب ممل ومتكرر (البحث عن الإبر) إلى منهج دراسي غني ومتنوع (القراءة، التلخيص، الترتيب، والاستنتاج) مقترن بنظام تصحيح ذكي وعادل يعرف متى يضغط على الطالب ومتى يمنحه استراحة. النتيجة هي ذكاء اصطناعي ليس مجرد باحث عن الحقائق، بل مفكر حقيقي في النصوص الطويلة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.