← أحدث الأبحاث
🤖 machine learning

Generalizing the Geometry of Model Merging Through Frechet Averages

تقترح هذه الورقة إطاراً عاماً لدمج النماذج يعتمد على متوسط فريشيه (Fréchet averaging) عبر متشعبات مناسبة لضمان ثبات التماثل، مما يبرهن على قدرته على استيعاب الأساليب الحالية مثل دمج فيشر (Fisher merging)، ويوفر خوارزمية عملية لدمج المحولات منخفضة الرتبة (LoRA) تعالج أوجه القصور في النهج الحالية.

المؤلفون الأصليون: Marvin F. da Silva, Mohammed Adnan, Felix Dangel, Sageev Oore

نُشر 2026-05-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Marvin F. da Silva, Mohammed Adnan, Felix Dangel, Sageev Oore

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فريقاً من الطهاة الخبراء. كل طاهٍ أتقن طبقاً معيناً: أحدهم يصنع اللازانيا المثالية، والآخر يحضر السوشي المثالي، والثالث يصنع أفخم طبق سوفليه. الآن، تريد إنشاء "طاهٍ خارق" يمكنه طهي هذه الأطباق الثلاثة ببراعة، لكن ليس لديك الوقت لتدريب طاهٍ جديد من الصفر؛ أنت فقط تريد دمج معرفة الطهاة الحاليين.

في عالم الذكاء الاصطناعي، يسمى هذا دمج النماذج (Model Merging). أنت تأخذ "الأوزان" (الإعدادات الداخلية) لنماذج ذكاء اصطناعي مختلفة وتحاول مزجها في نموذج واحد.

المشكلة: "الخريطة الخاطئة"

تجادل الورقة البحثية بأن الطريقة القديمة للقيام بذلك تشبه محاولة خلط وصفات هؤلاء الطهاة عبر مجرد حساب متوسط أرقامهم على ورقة. هذا يعمل جيداً إذا كان الجميع يكتبون بنفس اللغة ويستخدمون نفس الوحدات.

لكن نماذج الذكاء الاصطناعي لديها ميزة خفية: التماثل (Symmetry).
فكر في الأمر كالتالي: قد يكتب الطاهي (أ) "كوبان من الدقيق"، بينما يكتب الطاهي (ب) "كوب واحد من الدقيق + كوب واحد من الدقيق". كلاهما يعني الشيء نفسه تماماً، لكن الأرقام تبدو مختلفة. أو ربما قام الطاهي (ج) بتبديل ترتيب المكونات في دفتر ملاحظاته، لكن مذاق الطبق ظل متطابقاً.

في الذكاء الاصطناعي، هناك طرق عديدة لكتابة نفس "الوصفة" (النموذج) باستخدام أرقام مختلفة. وإذا قمت فقط بأخذ متوسط الأرقام (المتوسط الساذج - Naive Averaging)، فقد ينتهي بك الأمر بوصفة تقول "صفر كوب من الدقيق" لأن الأرقام الموجبة والسالبة ألغت بعضها البعض. لقد صنعت نموذجاً معطلاً لا يستطيع طهي أي شيء.

يسمي المؤلفون هذا الخروج عن المدار (Stepping off the orbit). تخيل أن الوصفة "الحقيقية" موجودة على مسار دائري (مدار). إذا رسمت ببساطة خطاً مستقيماً بين نقطتين على المسار، فستقطع عبر المنتصف لتصل إلى الطين (نموذج معطل)، بدلاً من البقاء على المسار حيث توجد الوصفات الجيدة.

الحل: "البوصلة الذكية" (GeoMerge)

تقترح الورقة طريقة جديدة تسمى GeoMerge. بدلاً من مجرد حساب متوسط الأرقام، هم يعاملون فضاء نماذج الذكاء الاصطناعي كمنظر طبيعي منحني (Riemannian manifold).

  1. الخريطة: أدركوا أنه بسبب التماثل (الطرق المختلفة لكتابة نفس الوصفة)، فإن "الخريطة الحقيقية" ليست ورقة مسطحة. بل هي سطح مطوي ومنحنٍ، حيث تمثل نقاط مختلفة الشيء نفسه بالفعل.
  2. البوصلة: يستخدمون أداة رياضية تسمى متوسط فريشيه (Fréchet Average). فكر في هذا ليس كمتوسط بسيط، بل كإيجاد "مركز الثقل" على سطح منحني.
  3. المحاذاة (Alignment): قبل مزج النماذج، يقومون أولاً بـ "محاذاتها". يشبه ذلك التأكد من أن الطاهي (أ) والطاهي (ب) يستخدمان نفس أكواب القياس ويكتبان بنفس الترتيب. إنهم يجدون النسخة المحددة من وصفة كل طاهٍ التي تكون الأقرب للآخرين، متجاهلين الاختلافات الشكلية في كيفية كتابة الأرقام.
  4. المسار: بدلاً من القطع مباشرة عبر الطين، يسيرون على طول مسار منحني (Geodesic) يبقي في مسار "الوصفات الجيدة".

لماذا يهم هذا تقنية "LoRA" (الطهاة المتخصصون)

تركز الورقة بشكل كبير على تقنية شائعة تسمى LoRA (التكيف منخفض الرتبة). تخيل أن هؤلاء ليسوا طهاً كاملين، بل هم طهاة مساعدون متخصصون يقومون فقط بتعديل بعض المكونات المحددة لجعل الطبق أفضل.

وجد المؤلفون أنه عندما تحاول دمج هذه التعديلات المتخصصة باستخدام الطرق القديمة، فإن مشكلة "التماثل" تصبح أسوأ. ملاحظات الطهاة المساعدين مرنة للغاية بحيث يمكن كتابتها بآلاف الطرق المختلفة التي تعني الشيء نفسه.

  • الطريقة القديمة (KnOTS): تحاول فرض محاذاة الملاحظات باستخدام خدعة رياضية صارمة وخطوة بخطوة (SVD). وهي تعمل بشكل جيد نوعاً ما، لكنها تشبه محاولة إدخال أوتاد مربعة في ثقوب مستديرة.
  • GeoMerge: تدرك أن الملاحظات تعيش بشكل طبيعي على سطح منحني. تستخدم "البوصلة الذكية" لإيجاد المركز الحقيقي للمجموعة دون فرض شكل صلب عليها.

النتائج

اختبر الباحثون هذا على نموذج ذكاء اصطناعي كبير (Llama 3) تم تخصيصه لأنواع مختلفة من الألغاز اللغوية (الاستدلال باللغة الطبيعية).

  • النتيجة: أنشأت GeoMerge "طاهياً خارقاً" يتفوق في أدائه على أفضل طريقة سابقة (KnOTS).
  • الكفاءة: والأفضل من ذلك، أن GeoMerge فعلت ذلك مع الحفاظ على "حجم" الوصفة صغيراً. الطريقة القديمة انتهت بوصفة ضخمة ومتضخمة (رتبة عالية/high rank)، بينما حافظت GeoMerge على كونها رشيقة وفعالة، مما أثبت أنها تفهم هندسة المشكلة بشكل أفضل.

باختختصار

تقول الورقة البحثية: لا تكتفِ بحساب متوسط الأرقام. نماذج الذكاء الاصطناعي تشبه الوصفات التي يمكن كتابتها بالعديد من اللغات. إذا كنت تريد دمجها، فعليك أولاً ترجمتها إلى لغة مشتركة (المحاذاة) ثم إيجاد مركز المجموعة باستخدام خريطة تحترم شكل العالم (الهندسة)، بدلاً من مسطرة مسطحة. هذا يمنع "الطاهي الخارق" من التحول إلى فوضى معطلة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →