← أحدث الأبحاث
🤖 machine learning

SG-Blend: Learning an Interpolation Between Improved Swish and GELU for Robust Neural Representations

تقدم الورقة البحثية SG-Blend، وهي دالة تنشيط تكيفية لكل طبقة تتعلم الاستيفاء الأمثل بين متغير "Swish" جديد مصحح الانحياز (SSwish) ودالة GELU، مما يظهر انخفاضًا في تباين التدريب وأداءً فائقًا عبر مهام معالجة اللغات الطبيعية والرؤية الحاسوبية مقارنة بدوال التنشيط الثابتة القياسية.

المؤلفون الأصليون: Gaurav Sarkar, Syed Affan Daimi, Jay Gala, Subarna Tripathi

نُشر 2026-09-11
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Gaurav Sarkar, Syed Affan Daimi, Jay Gala, Subarna Tripathi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

يعتمد التعلم العميق، وهو التقنية الكامنة وراء الذكاء الاصطناهي الحديث، على شبكات واسعة من المسارات الرياضية التي تعالج المعلومات طبقة تلو الأخرى. ولكي تعمل هذه الشبكات، فإنها تحتاج إلى مفاتيح خاصة تسمى "دوال التنشيط". تقرر هذه المفاتيح مقدار المعلومات التي تمر من طبقة إلى الطبقة التالية، مما يشكل قدرة الشبكة على تعلم الأنماط المعقدة. لسنوات طويلة، اعتمد الباحثون على عدد قليل من المفاتيح القياسية، مثل "Swish" و"GELU"، والتي تعمل كإعدادات افتراضية لكل نماذج الذكاء الاصطناعي الحديثة تقريبًا. ومع ذلك، فإن هذه المفاتب القياسية تتسم بالجمود؛ فهي تطبق نفس الشكل والسلوك تمامًا على كل طبقة في الشبكة، بغض النظر عما إذا كانت تلك الطبقة في البداية أو المنتصف أو النهاية من العملية. هذا النهج الموحد يخلق مشكلة: فبينما قد تعمل الشبكة بشكل جيد في المتوسط، إلا أن أداءها يمكن أن يتأرجح بشدة اعتمادًا على كيفية تهيئتها العشوائية، مما يجعل من الصعب الوثوق بالنتائج أو إعادة إنتاجها باستمرار.

اقترح فريق من الباحثين حلاً جديدًا يسمى "SG-Blend"، وهو مفتاح مرن يسمح لكل طبقة في الشبكة العصبية بإيجاد توازنها المثالي الخاص بين سلوكين مختلفين. فبدلاً من إجبار كل طبقة على استخدام نفس الإعداد الجامد، تسمح هذه الطريقة الجديدة لكل طبقة بأن تتعلم مدى تفضيلها لنوع معين من المفاتيح على الآخر. وقد وجد الباحثون أنه من خلال منح كل طبقة هذا القدر الصغير من الحرية، تصبح الشبكة بأكملها أكثر استقرارًا بشكل ملحوظ. وفي الاختبارات التي أجريت على النماذج اللغوية، قللت هذه الطريقة من عدم قابلية النتائج للتنبؤ بنسبة اثنين وأربعين بالمائة مقارنة بالطريقة القياسية، مع تحقيق أعلى درجات الدقة في الوقت ذاته. والاكتشاف الرئيسي هو أن الأداء الأفضل لا يأتي من اختيار مفتاح واحد مثالي، بل من السماح للشبكة بالانتقال السلس، أو المزج، بين خيارين معروفين، مما يسمح للطبقات المبكرة بالتصرف بشكل مختلف عن الطبقات العميقة.

إن الفكرة الجوهرية وراء هذا العمل هي أن الطبيعة الجامدة لدوال التنشيط الحالية تخلق عدم توافق مع كيفية بناء الشبكات العصبية الحديثة. في الشبكات القديمة، ساعد نوع مختلف من "التطبيع" (normalization) في تنعيم تدفق المعلومات، مما غطى على عيوب هذه المفاتيح الثابتة. ولكن في البنى الأحدث والأكثر عمقًا المستخدمة في اللغة والرؤية، اختفت تأثيرات التنعيم هذه. وبدونها، تسبب المفاتيح الثابتة عدم استقرار في تدفق المعلومات أثناء انتقالها عبر طبقات الشبكة المتعددة. وقد لاحظ الباحثون أن عدم الاستقرار هذا يؤدي إلى تباين عالٍ، مما يعني أنه إذا قمت بتشغيل تجربة تدريب واحدة مرتين بنقاط بداية عشوائية مختلفة قليًا، فقد تحصل على نتيجتين مختلفتين تمامًا. قد ينتج عن إحدى التجربتين نموذج عالي الدقة، بينما قد تفشل التجربة الأخرى في التعلم بفعالية، لمجرد أن المفاتيح الثابتة لم تستطع التكيف مع الاحتياجات المحددة لكل طبقة.

ولحل هذه المشكلة، قدم الفريق آلية جديدة تجمع بين نسخة مصححة من مفتاح "Swish" ومفتاح "GELU". لم يكتفوا بمجرد خلطهما عشوائيًا؛ بل أنشأوا نظامًا حيث تمتلك كل طبقة في الشبكة مجموعة صغيرة خاصة بها من "المقابض" القابلة للضبط. يتحكم أحد المقابض في مدى ميل الطبقة نحو أسلوب "Swish"، ويتحكم مقبض آخر في حدة الانتقال، بينما يضبط الثالث المستوى الأساسي للإشارة. وأثناء التدريب، تتعلم الشبكة ضبط هذه المقابض تلقائيًا. واكتشف الباحثون أن الشبكة تستقر طبيعيًا في حالة تختار فيها معظم الطبقات حلاً وسطًا، حيث تمزج بين الأسلوبين بنسب متساوية تقريبًا. وهذا يشير إلى أن لا "Swish" الخالص ولا "GELU" الخالص هو الإجابة المثالية لكل جزء من الشبكة؛ بل إن الحالة المثلى هي مزيج مخصص يختلف قليلاً من طبقة إلى أخرى.

تم قياس نتائج هذا النهج عبر عدة مهام مختلفة. ففي دراسة تضمنت تحليل المشاعر في مراجعات الأفلام، طابقت الطريقة الجديدة ذروة دقة النماذج الموجودة حاليًا، لكنها فعلت ذلك بثبات أكبر بكثير. وبينما أظهرت الطريقة القياسية فجوة واسعة بين أفضل وأسوأ نتائجها عبر بدايات عشوائية مختلفة، حافظت الطريقة الجديدة على النتائج متقاربة للغاية. وهذا الاتساق أمر بالغ الأهمية للتطبيقات العملية، لأنه يعني أن المطور يمكنه تدريب نموذج مرة واحدة ويكون واثقًا من أنه سيؤدي بشكل جيد، بدلاً من الاضطرار إلى إجراء عشرات التجارب للعثور على نقطة بداية "محظوظة". علاوة على ذلك، عند اختبارها على نموذج لغوي واسع النطاق مدرب على التنبؤ بالكلمة التالية في الجملة، حققت الطريقة الجديدة أدنى معدل خطأ بين جميع النماذج التي تم اختبارها، مما يثبت أن الفوائد تمتد إلى ما وراء مهام التصنيف البسيطة لتصل إلى النماذج التوليدية المعقدة.

كما بحث الباحثون في سبب نجاح هذا المزج من خلال مراقبة كيفية تدفق الإشارات الداخلية للشبكة. ووجدوا أن الطريقة الجديدة تحافظ على تدفق مستمر ومنتظم للمعلومات من الطبقة الأولى إلى الأخيرة، متجنبة الارتفاعات والانخفاضات الحادة التي تحدث غالبًا مع المفاتيح الثابتة. وقد تأكد هذا الاستقرار من خلال ملاحظة أن سلوك الطريقة الجديدة يقع بدقة بين سلوكيات مكوناتها الاثنين، حيث تستعير بفعالية نقاط القوة من كل منهما دون إدخال نقاط ضعف جديدة. ومن المثير للاهتمام أن الشبكة تعلمت أيضًا ضبط المستوى الأساسي للإشارة بشكل مختلف للطبقات المبكرة مقارنة بالطبقات اللاحقة، وهو فارق دقيق لا تستطيع المفاتيح الثمة تحقيقه. ويبدو أن القدرة على تكييف الحالة الداخلية لكل طبقة بشكل فردي هي السر وراء تحسن الاستقرار والأداء.

ومع ذلك، فإن هذه المرونة تأتي بتكلفة. نظرًا لأن الطريقة الجديدة تتطلب من الشبكة حساب سلوكين مختلفين لكل طبقة ثم مزجهما، فإنها تستغرق وقتًا أطول في التدريب. وقد قاس الباحثون هذا العبء الإضافي ووجدوا أن تدريب نموذج باستخدام هذه الطريقة الجديدة استغرق وقتًا أطول بنسبة ثلاثة وثلاثين بالمائة تقريبًا من استخدام مفتاح "GELU" القياسي على نفس الأجهزة. وبينما تتعلم الشبكة بشكل أكثر موثوقية وتنتج نتائج أفضل، فإن الوقت الإضافي المطلوب يعد عاملًا مهمًا لأولئك الذين يحتاجون إلى تدريب النماذج بسرعة أو بموارد حوسبة محدودة. ويقر الفريق بهذا المقايضة، مشيرين إلى أن فائدة تقليل التباين وزيادة الدقة يجب أن تُوزن مقابل الوقت الإضافي والقوة الحوسبية المطلوبة للوصال إلى تلك النتائج.

رغم الوقت الإضافي المطلوب، تشير النتائج إلى تحول في طريقة تفكيرنا في تصميم الشبكات العصبية. إذ يشير نجاح "SG-Blend" إلى أن النهج الجامد الموحد لدوال التنشيط قد يكون من الماضي. فمن خلال السماح للشبكة بتعلم إعداداتها الداخلية، يمكن للباحثين بناء نماذج ليست فقط أكثر دقة، بل أيضًا أكثر قوة وقابلية للتنبؤ. وتثبت الدراسة أن الطريق نحو ذكاء اصطناعي أفضل قد لا يكمن في العثور على صيغة رياضية واحدة مثالية، بل في إنشاء أنظمة مرنة بما يكفي لتكييف آلياتها الداخلية مع المتطلبات المحددة للمهمة المعنية. ويقدم هذا النهج اتجاهًا واعدًا للأبحاث المستقبلية، لا سيما للنماذج الكبيرة والمعقدة التي تقود تقنيات اللغة والرؤية الحديثة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →