A projection-based framework for gradient-free and parallel learning
تقدم هذه الورقة PJAX، وهو إطار عمل قائم على JAX يعيد صياغة تدريب الشبكات العصبية كمسألة جدوى قابلة للتوازي وخالية من التدرج باستخدام مؤثرات إسقاط تكرارية، مما يقدم بديلاً مقنعاً للتحسين التقليدي القائم على التدرج مع مزايا في التعامل مع العمليات غير القابلة للاشتقاق وتمكين التوازي الهائل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول حل لغز ضخم ومعقد، مثل أحجية ثلاثية الأبعاد عملاقة أو مكعب روبيك، ولكنك لا تعرف الصورة النهائية.
الطريقة القديمة (التعلم القائم على التدرج - Gradient-Based Learning)
تتعلم معظم نماذج الذكاء الاصطناً الحالية باستخدام طريقة تسمى "الانتشار العكسي" (backpropagation). فكر في هذا الأمر كمتسلق يحاول العثور على قاع وادٍ ضبابي (الحل الأمثل). يشعر المتسلق بالمنحدر تحت قدميه (التدرج/gradient) ويأخذ خطوة نحو الأسفل. يستمر في فعل ذلك، خطوة بخوة، حتى يصل إلى نقطة منخفضة.
- المشكلة: أحياناً يعلق المتسلق في منخفض صغير (نهاية صغرى محلية) ليس هو القاع الحقيقي. وأحياناً يكون المسار شديد الانحدار أو مسطحاً جداً بحيث يضيع المتسلق أو يتحرك ببطء شديد. أيضاً، لكي يعرف المتسلق اتجاه "الأسفل"، يتعين عليه إرسال إشارة من أسفل الوادي وصولاً إلى قمته، وهو أمر بطيء ويتطلب مساراً محدداً ومتماثلاً للغاية.
الطريقة الجديدة (التعلم القائم على الإسقاط - Projection-Based Learning)
يقترح مؤلفو هذه الورقة استراتيجية مختلفة تماماً. بدلاً من محاولة البحث عن قاع الوادي، هم يعاملون التدريب كـ مسألة إمكانية تحقيق (feasibility problem).
تخيل أن لديك غرفة مليئة بالجدران، وكل جدار له قاعدة محددة.
- الجدار (أ) يقول: "يجب أن يكون المكعب الأحمر بجانب المكعب الأزرق".
- الجدار (ب) يقول: "يجب أن يكون المكعب الأخضر فوق المكقب الأحمر".
- الجدار (ج) يقول: "يجب أن يكون الوزن الإجمالي 50 كجم".
هدفك ليس التزحلق على تلة؛ بل هو العثور على ترتيب واحد فقط للمكعبات حيث يتم استيفاء قاعدة كل جدار في نفس الوقت.
كيف يعمل الأمر: استعارة "الإسقاط" (The Projection Metaphor)
يسمي المؤلفون طريقتهم "القائمة على الإسقاط". وإليكم كيف تعمل:
- التقسيم: يقومون بتقسيم اللغز الضخم (الشبكة العصبية) إلى قطع صغيرة وبسيطة تسمى "الدوال الأولية" (مثل عمليات رياضية بسيطة: جمع الأرقام، أو ضربها، أو تحديد ما إذا كان الرقم موجباً).
- الإصلاح المحلي: بدلاً من النظر إلى اللغز بأكمله، ينظرون إلى جدار واحد فقط (قاعدة واحدة). إذا لم تتناسب المكعبات مع قاعدة هذا الجدار، فإنهم "يسقطون" (project) المكعبات على الجدار. تخيل تسليط ضوء على المكعبات؛ الظل الذي تلقيه على الجدار هو الموضع "الصحيح" لتلك القاعدة المحددة.
- قوة التوازي: هذا هو الجزء السحري. بما أن كل جدار يهتم فقط بجيرانه المباشرين، يمكنك إصلاح الجدار (أ)، والجدار (ب)، والجدار (ج) جميعهم في وقت واحد. ليس عليك الانتظال حتى ينتهي الجدار (أ) قبل البدء في الجدار (ب). هذا يشبه وجود فريق من 100 شخص يقومون بإصلاح أجزاء مختلفة من منزل في آن واحد، بدلاً من شخص واحد يقوم بإصلاح السقف، ثم المطبخ، ثم الحمام، واحداً تلو الآخر.
- التكرار: يقومون بهذا مراراً وتكراراً. في كل مرة، يقومون بتحريك المكعبات لتناسب القواعد المحلية بشكل أفضل. في النهاية، تستقر المكعبات في موضع يستوفي جميع القواعد في آن واحد. هذا هو الذكاء الاصطناي المدرب الخاص بك.
لماذا هذا الأمر رائع (وفقاً للورقة البحثية)
- لا حاجة لـ "المنحدر": لست بحاجة لحساب "المنحدر" (gradient). وهذا يعني أنه يمكنك استخدام قواعد "متعرجة" أو غير مستمرة (غير قابلة للاشتقاق)، مثل مفتاح يكون إما "تشغيل" أو "إيقاف". الطريقة القديمة تعاني مع هذه القواعد؛ أما هذه الطريقة الجديدة فتتعامل معها بسهولة.
- المحاكاة البيولوجية: في الدماغ، لا ترسل الخلايا العصبية "إشارة خطأ" عالمية من نهاية الفكرة إلى بدايتها. إنها فقط تعدل نفسها بناءً على ما يفعله جيرانها المباشرين. هذه الطريقة الجديدة تحاكي هذا التعديل المحلي من جار لجار.
- السرعة: بما أن الجميع يعملون بالتوازي، يمكن أن يكون هذا أسرع بكثير على شرائح الكمبيوتر الحديثة (GPUs/TPUs) المصممة للقيام بالعديد من الأشياء في وقت واحد.
المقايضة: تكلفة "الذاكرة"
تعترف الورقة بأن هناك عقبة. للقيام بذلك، يجب على الكمبيوتر تذكر موضع كل "حافة" في اللغز عند كل خطوة.
- الاستعارة: في الطريقة القديمة، أنت تتذكر فقط الموقع الحالي للمتسلق. في هذه الطريقة الجديدة، عليك تذكر موضع كل مكعب في الغرفة، وكل اتصال بينها، لكل شخص في فريقك.
- النتيجة: هذا يستخدم ذاكرة كمبيوتر (RAM) أكبر بكثير. اضطر المؤلفون إلى تقليص بعض النماذج الاختبارية لتناسب ذاكرة حواسيبهم، بينما كانت الطريقة القديمة تستطيع التعامل مع نماذج أكبر بسهء أكبر.
النتائج
بنى المؤلفون أداة برمجية تسمى PJAX (Projection JAX) لاختبارها. جربوها على أنواع مختلفة من الألغاز:
- الأنماط البسيطة (MLPs)
- التعرف على الصور (CNNs)
- التنبؤ باللغة (RNNs)
وجدوا أنه بينما لا تزال "الطريقة القديمة" (باستخدام محسنات Adam أو SGD) هي البطل في السرعة الخام والدقة النهائية في كثير من الحالات، إلا أن هذه الطريقة الجديدة "القائمة على الإسقاط" تعمل بشكل جيد بشكل مدهش. إنها بديل قابل للتطبيق لأنها:
- تتعلم دون الحاجة إلى التدرجات (gradients).
- تتعامل مع القواعد "المتعرجة" التي تربك الطرق الأخرى.
- تتعلم بكفاءة عالية على الأجهزة المتوازية، خاصة لمهام نمذجة اللغة حيث تعاني الطريقة القديمة من مشكلة "تلاشي التدرجات" (نسيان بداية الجملة).
باخت ملخص
تقول الورقة: "توقف عن محاولة التزحلق على تلة للعثور على الإجابة. بدلاً من ذلك، عامل المشكلة كمجموعة من القواعد المحلية. أصلح كل قاعدة محلياً وفي وقت واحد، وفي النهاية، سيتجه النظام بأكمله إلى مكانه الصحيح". إنها طريقة جديدة لتدريب الذكاء الاصطناعي تكون أكثر توازياً، وأكثر مرونة مع أنواع مختلفة من الرياضيات، ولكنها حالياً تتطلب ذاكرة أكبر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.