IRIS: Interpolative Rényi Iterative Self-play for Large Language Model Fine-Tuning
تقترح الورقة البحثية إيريس (IRIS)، وهو إطار عمل موحد للضبط الدقيق عبر اللعب الذاتي يستفيد من معامل تباعد ريني (Rényi divergence) القابل للتعديل باستمرار لتكييف أوزان الأهمية ديناميكيًا عبر مراحل التدريب، مما يجعله يتفوق على الأساليب الحالية ويحقق نتائج متفوقة بعدد أقل بكثير من العينات المشروحة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم طالباً (الذكاء الاصطناعي) كيف يكتب مقالات مثالية.
الطريقة القديمة: المعلم الصارم
تقليدياً، لجعل الذكاء الاصطناعي أفضل، تحتاج إلى معلم بشري يقوم بتصحيح آلاف المقالات. يقول المعلم: "هذه الجملة جيدة، وتلك سيئة". هذا ما يسمى الضبط الدقيق الخاضع للإشراف (SFT).
- المشكلة: توظيف معلمين بشر أمر مكلف وبطيء. وبمجرد أن يتعلم الذكاء الاصطناعي من المقالات المتاحة، فإنه يصطدم بـ "سقف". لا يمكنه التحسن أكثر من ذلك لأنه نفد منه التعليقات البشرية.
فكرة "اللعب الذاتي": الطالب ضد نفسه
لكسر هذا السقف، اخترع الباحثون اللعب الذاتي (Self-Play). تخيل أن الذكاء الاصطناعي لاعب شطرنج؛ بدلاً من اللعب ضد إنسان، يلعب ضد نسخة أقدم قليلاً من نفسه.
- الخصم: يقوم الذكاء الاصطناعي بإنشاء مقال "مزيف" (مثل طالب يحاول الغش).
- اللاعب الرئيسي: يحاول الذكاء الاصطناعي الحالي تمييز الفرق بين المقال البشري "الحقيقي" ومقاله "المزيف".
- الهدف: إذا استطاع الذكاء الاصطناعي التمييز بينهما، فإنه يتعلم ما الذي يجعل المقال البشري مميزاً ويحاول الكتابة بشكل يشبهه أكثر.
هذا يعمل بشكل جيد، ولكن به عيب. فكر في الأمر كأنها لعبة "ساخن وبارد" (Hot and Cold).
- في بداية التدريب: يكون الذكاء الاصطناعي سيئاً جداً في الكتابة. الفرق بين مقاله المزيف والمقال الحقيقي كبير جداً (بارد جداً). يتعلم الذكاء الاصطناعي بسرعة.
- في نهاية التدريب: يصبح الذكاء الاصطناعي بارعاً حقاً. تبدأ المقالات المزيفة في الظهور وكأنها مطابقة تماماً للمقالات الحقيقية. تنخفض "درجة الحرارة" إلى الصفر. يصاب الذكاء الاصطناعي بالارتباك لأن الإشارة أصبحت ضعيفة جداً لتمييز أيهما هو الآخر. يتوقف عن التعلم أو يبدأ في ارتكاب الأخطاء.
المشكلة في الحلول الحالية
حاول العلماء إصلاح ذلك بتغيير قواعد اللعبة، لكنهم امتلكوا قاعدة واحدة فقط طوال اللعبة:
- القاعدة (أ) (القاعدة اللطيفة): جيدة في البداية عندما يكون الذكاء الاصطناعي مرتبكاً، لكنها ناعمة للغاية عندما يحتاج الذكاء الاصطناعي إلى الدقة.
- القاعدة (ب) (القاعدة الصارمة): رائعة في النهاية عندما يكون الذكاء الاصطناعي شبه مثالي، لكنها قاسية ومربكة في البداية.
لقد ظلوا عالقين في استخدام "قاعدة واحدة تناسب الجميع"، مما يعني أن الذكاء الاصطناعي كان إما يتعلم ببطء شديد أو يشعر بالإحباط.
الحل: IRIS (المدرب الذكي)
تقدم الورقة البحثية IRIS (الاستكمال التكراري لـ Rényi في اللعب الذاتي). فكر في IRIS كـ مدرب ذكي لا يستخدم كتاب قواعد واحداً. بدلاً من ذلك، يمتلك المدرب "مفتاح ضبط" (Dial) يعدل صعوبة اللعبة في الوقت الفعلي.
تشبيه "مفتاح الضبط"
تخيل أن الذكاء الاصطناعي يتعلم الرسم.
- المرحلة المبكرة (مفتاح الضبط مضبوط على "الضربات العريضة"): يكون الذكاء الاصطناعي فوضوياً. يقول المدرب: "لا تقلق بشأن التفاصيل الصغيرة! فقط تأكد من أن لوحتك تبدو نوعاً ما مثل منظر طبيعي حقيقي". يتم تشجيع الذكاء الاصطناعي على الاستكشاف وتجربة العديد من الأساليب المختلفة. هذا يشبه استخدام قاعدة واسعة ومتسامحة.
- المرحلة المتأخرة (مفتاح الضبط مضبوط على "التفاصيل الدقيقة"): أصبح الذكوز الاصطناعي الآن رساماً ماهراً. يقول المدرب: "حسناً، الآن انظر إلى ضربات الفرشاة الصغيرة. إذا لم تكن لوحتك بشرية مثالية، فنحن بحاجة لإصلاح ذلك فوراً". يركز الذكاء الاصطناعي بكثافة على الاختلافات الصغيرة. هذا يشبه استخدام قاعدة دقيقة وصارمة.
يقوم IRIS بتدوير هذا المفتاح تلقائياً.
- عندما يكون الذكاء الاصطناعي بعيداً عن المثالية، يستخدم إعداداً "واسعاً" للحفاظ على سرعة التعلم.
- ومع اقتراب الذكاء الاصطناعي من المثالية، ينتقل بسلاسة إلى إعداد "الضبط الدقيق" لصقل التفاصيل النهائية.
لماذا يعد هذا أمراً كبيراً؟
- إنه مرن: على عكس الطرق الأخرى التي تلتزم بـ "قاعدة" واحدة (مثل أن تكون صارمة فقط أو لطيفة فقط)، فإن IRIS يغير رأيه مع تعلم الذكاء الاصطناعي.
- إنه فعال: تظهر الورقة أن IRIS يمكنه جعل النموذج المدرب على كمية صغيرة من البيانات البشرية (26,000 مقال) يتفوق في الأداء على النماذج المدربة على كمية هائلة من البيانات (200,000 مقال) باستخدام الطرق القديمة. إنه يشبه طالباً يتعلم من مكتبة صغيرة مختارة بعناية أكثر من طالب يقرأ موسوعة كاملة لكنه لا يعرف كيف يركز.
- إنه مستقر: يمنع الذكاء الاصطناعي من "الارتباك" في المراحل المتأخرة من التدريب، مما يضمن استمرار تحسنه حتى النهاية.
باختصار
IRIS هو طريقة تدريب جديدة للذكاء الاصطناعي تعمل كمدرب ذكي. بدلاً من استخدام مجموعة واحدة جامدة من القواعد لتعليم الذكاء الاصطناعي، يقوم باستمرار بتعديل أسلوب التدريس الخاص به — بدءاً من التشجيع الواسع وينتهي بالتصحيح الدقيق. وهذا يسمح للذكاء الاصطناعي بالتعلم بشكل أسرع، واستخدام بيانات بشرية أقل، والوص{ل إلى مستوى أعلى من الذكاء من أي وقت مضى.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.