← أحدث الأبحاث
💬 NLP

MeRoTune: RoPE-Safe Merging with a Tunable Dial

يقدم MeRoTune تقنية لدمج النماذج تعالج عدم محاذاة الفضاء الجزئي للانتباه في النماذج المزودة بـ RoPE عبر تعلم مصفوفات تصحيح مقيدة وتتبادل مع RoPE، مما يتيح مزجاً قابلاً للضبط لاحقاً للنماذج المضبوطة بدقة دون تعديل الأوزان الأساسية.

المؤلفون الأصليون: Salman Faroz

نُشر 2026-09-09✓ Author reviewed
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Salman Faroz

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الذكاء الاصطناعي، يواجه الباحثون غالبًا معضلة: لديهم عقل حاسوبي قوي وعام الأغراض، وقد قاموا بتدريب نسخ متخصصة ومنفصلة منه لتتفوق في مهام محددة، مثل كتابة الكود بلغة واحدة أو الإجابة على الأسئ-لة بلغة أخرى. والهدف هو دمج هؤلاء المتخصصين في نموذج واحد متعدد الاستخدامات دون تكلفة تشغيل برامج متعددة في آن واحد. الطريقة القياسية للقيام بذلك هي ببساء خلط الأوزان الرياضية للنموذجين معًا، مثل خلط دفعتين من الطلاء. ومع ذلك، فإن هذا الخلط البسيط يفترض أن المنطق الداخلي لكلا النموذجين متوافق تمامًا. فإذا كان أحد النموذجين يفكر في مفهوم ما باستخدام نظام إحداثيات داخلي مختلف قليلاً عن الآخر، فإن مزجهما مباشرة قد يؤدي إلى نتيجة مربكة تكون أسوأ من كلا النموذجين الأصليين. وهذا أمر معقد بشكل خاص في النماذج الحديثة التي تستخدم آلية محددة لفهم ترتيب الكلمات، وهي نظام يقوم بتدوير المعلومات بناءً على الموقع. وإذا تجاهلت عملية المزج هذا التدوير، فإنها تكسر بصمت قدرة النموذج على فهم السياق، وغالبًا بطرق لا تظهر أثناء التدريب.

لقد طور باحث طريقة جديدة تسمى MeRoTune لحل هذه المشكلة. فبدلاً من المتوسط الأعمى للنموذجين، يقوم أولاً بتعليم كل نموذج كيفية ضبط نظامه الإحداثي الداخلي الخاص به بحيث يمكنهما الاتفاق على كيفية التعامل مع ترتيب الكلمات قبل مزجهما. وقد اكتشفوا أنه لكي يعمل هذا الضبط دون كسر النموذج، يجب أن تتبع التغييرات مجموعة ضيقة ومحددة للغاية من القواعد. لقد أثبتوا رياضياً أن الطريقة الآمنة الوحيدة لتصحيح هذه النماذج هي تطبيق نوع معين من التدوير يحترم الطريقة الفريدة التي يتعامل بها النموذج مع الموقع. وقد بنوا نظامًا تتعلم فيه النسخ المتخصصة من النموذجين هذه التعديلات الدقيقة من تلقاء نفسها، ومن ثم يمكن دمجهما بأي نسبة يرغب فيها المستخدم، ليعمل كقرص قابل للضبط بدلاً من كونه خليطًا ثابتًا.

لقد اختبروا هذا النهج على نسختين متميزتين من نموذج لغوي: إحداهما مدربة لتكون خبيرة في اللغة الإندونيسية والبرمجة، والأخرى مدربة لتكون خبيرة في اللغة اليابانية. وقبل محاولة دمج النموذجين، طبقوا فحصًا رياضيًا صارمًا للتأكد من أن النموذجين مختلفان حقًا بما يكفي لاستحقاق العملية المعقدة. فقد تحققوا من أن كل نموذج كان أفضل حقًا في تخصصه وأسوأ في الآخر، مما أكد وجود صراع حقيقي يحتاج إلى حل. ورفضوا عدة أزواج مرشحة لم تستوفِ هذا المعيار، لضمان أنهم يعملون فقط على مشكلة حقيقية. وبمجرد تأكيد ملاءمة الزوج، قاموا بتدريب النماذج لتعلم عوامل التصحيح الفريدة الخاصة بها. وقد صُممت هذه العوامل لتكون تدويرات بسيطة، مما يضمن بقاء النماذج مستقرة وعدم تشوهها أثناء العملية.

وعندما دمجوا النماذج باستخدام طريقتهم الجديدة، كانت النتائج متفوقة على التقنيات الحالية. لقد اختبروا النموذج المدمج عبر نطاق واسع من نسب المزج، من كونه إندونيسياً في الغالب إلى ياباني في الغالب، ووجدوا أن نهجهم لم يكن أداءه أسوأ أبدًا من الطرق القياسية التي يستخدمها باحثون آخرون. وفي الواقع، في معظم الاختبارات، تجاوزت طريقتهم معيارًا عاليًا للموثوقية الإحصائية، بينما كان هناك أسلوب منافس أدى أداؤه إلى نتيجة أسوأ من النموذج الأساسي غير المدمج في مهمة واحدة على الأقل. كما استكشفوا ما إذا كان يمكن تقسيم نسبة المزج إلى عاملين مستقلين، مما يسمح لكل نموذج بالمساهمة بحرية أكبر. ووجدوا أن القيام بذلك تسبب في انهيار الأداء، مما أثبت أن إبقاء نسبة المزج مرتبطة ببعضها البعض ضروري لنجاح الطريقة.

كما كشفت الدراسة تفاصيل مثيرة للاهتمام حول ما تعلمته النماذج بالفعل خلال العملية. كانت معظم التعديلات التي أجرتها النماذج صغيرة جدًا، وهي تدويرات ضئيلة بمقدار بضع درجات فقط، مما يشير إلى أن النماذج كانت متوافقة في الأصل. ومع ذلك، تطلب عدد قليل من الأجزاء المحددة من النماذج تغييرات أكبر بكثير، وصلت إلى ستة وثمانين درجة، وهذه الأجزاء أيضًا تقلصت في حجمها. وهذا يشير إلى أنه بينما كان الهيكل العام متشابهًا، كانت هناك خلافات عميقة ومحددة في كيفية تعامل النماذج مع مفاهيم معينة تطلبت إعادة محاذاة كبيرة. وقد أشاروا إلى أن هذه الطريقة ليست حلاً سحريًا لكل زوج ممكن من النماذج؛ فهي تعمل فقط عندما تكون النماذج متخصصة حقًا بطرق متضاربة وعندما يتضمن الهيكل الداخلي للنموذج آلية التعامل مع الموقع المحددة التي عالجوها.

في النهاية، يوضح هذا العمل أن دمج نماذج الذكاء الاصطناعي ليس مجرد مسألة متوسط حسابي للأرقام. بل يتطلب فهم الهندسة الخفية لكيفية معالجة النموذج للمعلومات. ومن خلال احترام القواعد المحددة لكيفية تعامل هذه النماذج مع ترتيب الكلمات، نجحوا في إنشاء أداة تسمح للمستخدمين بالتحكم بسلاسة بين القدرات الخبيرة المختلفة دون فقدان جودة أي منهما. توفر هذه الطريقة وسيلة موثوقة لدمج عقول الذكاء الاصطناعي المتخصصة، مما يضمن أن تكون النتيجة النهائية نموذجًا متماسكًا وعالي الأداء بدلاً من كونه خليطًا مربكًا. إن الكود والبيانات الخاصة بهذا العمل متاحة للجمهور، مما يسم يسمح للآخرين بالتحقق من النتائج وتطبيق نفس النهج المدروس والمبني على أسس رياضية لتركيبات النماذج الخاصة بهم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →