Prescriptive Scaling Laws for Data Constrained Training
تقترح هذه الورقة قانون قياس توجيهي جديد يأخذ في الاعتبار تكرار البيانات وفرط التخصيص في الأنظمة المقيدة بالبيانات، مظهرةً أنه بعد نقطة معينة، يكون زيادة سعة النموذج أكثر فعالية من تكرار البيانات بشكل إضافي، وأن اضمحلال الأوزان القوي يخفف بشكل كبير من فرط التخصيص.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم طالب من أجل امتحان كبير. لديك مكتبة محدودة من الكتب المدرسية (بيانات عالية الجودة)، ولكن لديك إمداد غير محدود من الوقت والطاقة (القدرة الحوسبية).
لفترة طويلة، كانت القاعدة السائدة في الذكاء الاصطناعي هي: "استمر فقط في قراءة صفحات جديدة". افترضت قاعدة تشينتشيلا (Chinchilla law) الشهيرة أن كل جملة تقرأها هي جملة جديدة وفريدة تمامًا. لقد أخبرتك بالضبط كم عدد الكتب التي يجب قراءتها مقابل حجم دماغك لتحقيق أفضل درجة.
ولكن في العالم الحقيقي، الكتب المدرسية الجيدة نادرة. غالبًا ما تنفد منك الصفحات الجديدة وتضطر للبدء في قراءة نفس الكتب مرارًا وتكرارًا. القواعد القديمة لم تكن تعرف كيف تتعامل مع هذا الأمر؛ فقد ظنت أن قراءة نفس الصفحة مرتين هي بنفس جودة قراءة صفحة جديدة، أو على الأقل أنها ستستمر في التحسن قليلًا إلى الأبد.
المشكلة: فخ "الإفراط في القراءة"
اكتشف مؤلفو هذه الورقة أن قراءة نفس البيانات عدة مرات هو مثل طالب يحفظ نوع الخط والأخطاء المطبعية في الكتاب بدلاً من فهم المفاهيم. يُسمى هذا "الإفراط في التخصيص" (Overfitting).
إذا أجبرت طالبًا على قراءة نفس الـ 100 صفحة 16 مرة، فسيتوقف عن تعلم أشياء جديدة ويبدأ في الارتباك أو يصبح جامدًا. وكلما كان الطالب (نموذج الذكاء الاصطناعي) أكبر، زادت سرعة وقوعه في هذا الفخ. لقد فشلت القواعد القديمة في التنبؤ بأنه عند نقطة معينة، تجعل القراءة المتكررة للمزيد من البيانات الطالب أسوأ حالاً.
الحل: كتاب قواعد جديد
أنشأ المؤلفون قاعدة جديدة بسيطة (قانون توسع) تضيف "جزاءً" على التكرار. فكر في الأمر كملحوة من معلم في الهامش: "في كل مرة تعيد فيها قراءة صفحة، تفقد قليلًا من قدرتك على تعلم أشياء جديدة".
لدى قاعدتهم الجديدة ثلاثة أجزاء:
- الأرضية: بعض الأشياء صعبة التعلم بطبيعتها (مثل تخمين الكلمة التالية في جملة).
- حجم الدماغ: إذا كان دماغك صغيرًا جدًا، فلن تتمكن من استيعاب كل الأنماط.
- جزاء التكرار: إذا قرأت نفس البيانات عدة مرات، فستصبح "باهتًا" أو "راكدًا".
الاكتشاف الكبير: توقف عن القراءة، وابدأ في التفكير
النتيجة الأكثر إثارة للدهشة تتعلق بكيفية إنفاق وقتك (القدرة الحوسبية).
- النصيحة القديمة: "إذا نفدت منك الكتب، استمر فقط في قراءة نفس الكتب مرارًا وتكرارًا".
- النصيحة الجديدة: "بمجرد أن تقرأ الكتب بضع مرات، توقف".
تظهر الورقة أنه إذا كان لديك مكتبة ثابتة من الكتب، فهناك "نقطة مثالية" لعدد المرات التي تقرأ فيها هذه الكتب. إذا كان لديك الكثير من الوقت (القدرة الحوسبية) ولكن مكتبة صغيرة، فإن أفضل حركة ليست الاستمرار في قراءة نفس الكتب 20 مرة. بدلاً من ذلك، يجب عليك بناء دماغ أكبر (نموذج أكبر) وقراءة الكتب مرات أقل.
الأمر يشبه إدراك أن قضاء 10 ساعات في إعادة قراءة فصل واحد هو مضيعة للوقت. من الأفضل قضاء هذا الوقت في بناء دماغ أكبر وأذكى يمكنه فهم الفصل في قراءة أو قراءتين فقط.
السلاح السري: "انضباط" أقوى
اختبرت الورقة أيضًا تقنية تسمى "تضاؤل الأوزان" (weight decay) (وهي طريقة لمنع النموذج من أن يصبح واثقًا جدًا في نفسه أو جامدًا). وجدوا أن استخدام نسخة قوية جدًا من هذا "الانضباط" يشبه إعطاء الطالب طريقة دراسة أفضل.
- فهي تقلل من جزاء "الركود" بنسبة 70%.
- وهذا يعني أن الطالب يمكنه التعامل مع قراءة نفس الكتب مرات أكثر دون أن يصاب بالارتباك.
- وهذا يفسر لماذا، في حالات ندرة البيانات، يعمل استخدام الانضباط القوي (الذي كان يُعتقد سابقًا أنه قاسٍ للغاية) بشكل أفضل من الطرق القياسية.
باختصار
تخبرنا هذه الورقة أننا في عالم الذكاء الاصطناعي، البيانات هي العائق، وليس القدرة الحوسبية.
- لا تبالغ في التدريب: تكرار البيانات كثيرًا يضر بالأداء، خاصة بالنسبة للنماذج الكبيرة.
- اجعل النموذج أكبر، لا أطول: عندما تنفد منك البيانات الجديدة، أنفق قدرتك الحوسبية على جعل النموذج أكبر، وليس على قراءة نفس البيانات مرات أكثر.
- استخدم انضباطًا قويًا: رفع مستوى "تضاؤل الأوزان" يساعد النماذج على مقاومة ارتباك إعادة قراءة البيانات، مما يسمح لها بالتعلم بشكل أكثر فعالية من الموارد المحدودة.
لقد أثبت المؤلفون ذلك من خلال تدريب أكثر من 300 نموذج مختلف وإظهار أن كتاب القواعد الجديد الخاص بهم يتنبأ بأفضل النتائج بشكل أفضل بكثير من القواعد القديمة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.