← أحدث الأبحاث
🤖 machine learning

Scalable Knowledge Editing for Mixture-of-Experts LLMs via Tensor-Structured Updates

تقترح هذه الورقة إطار عمل لتعديل المعرفة بنموذج مغلق الصيغة وقابل للتوسع لنماذج اللغات الكبيرة القائمة على خليط الخبراء (Mixture-of-Experts)، والذي يستفيد من هياكل الموترات ومتطابقة مصفوفة وودبري لتحقيق تحديثات لكل خبير بتسريع يصل إلى 6 أضعاف مع الحفاظ على جودة تعديل مماثلة للنماذج المرجعية ذات الطبقات الكثيفة.

المؤلفون الأصليون: Roman Maksimov, Vladimir Aletov, Dmitry Bylinkin, Daniil Medyakov, Vladimir Solodkin, Aleksandr Beznosikov

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Roman Maksimov, Vladimir Aletov, Dmitry Bylinkin, Daniil Medyakov, Vladimir Solodkin, Aleksandr Beznosikov

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "تعديل المعرفة القابل للتوسع لنماذج LLM ذات خليط الخبراء عبر التحديثات ذات البنية الموترة" (MoTE)، مقسمة إلى مفاهيم وتشبيهات بسيطة.

المشكلة الكبرى: تحديث مكتبة ضخمة

تخيل أن النموذج اللغوي الكبير (LLM) هو أمين مكتبة فائق الذكاء يعرف كل شيء تقريبًا. ومع ذلك، بمجرد تدريب أمين المكتبة هذا، تصبح معرفته "مجمدة". إذا تغير العالم (على سبيل المثال، تم انتخاب رئيس جديد، أو تم تصحيح حقيقة علمية)، سيستمر أمين المكتبة في تقديم إجابات قديمة وخاطئة.

عادةً، لإصلاح ذلك، يتعين عليك إرسال أمين المكتبة للعودة إلى المدرسة في جلسة إعادة تدريب طويلة ومكلفة. هذا الأمر بطيء، ويكلف قدرًا هائلًا من طاقة الكمبيوتر، ويخاطر بجعل أمين المكتبة ينسى أشياء أخرى كان يعرفها بالفعل.

تعديل المعرفة (Knowledge Editing) هو طريق مختصر. بدلًا من إعادة تدريب أمين المكتبة بالكامل، يمكنك ببساطة الدخول واستبدال ملف محدد في ذاكرته. نجحت الطرق السابقة مع النماذج "الكثيفة" (حيث يكون كل جزء من الدماغ نشطًا)، لكنها واجهت صعوبات مع النماذج الحديثة.

التحدي الجديد: فريق "الخبراء"

لا تستخدم نماذج الذكاء الاصطناعي الحديثة (مثل تلك المستخدمة في OpenAI أو DeepSeek) دماغًا واحدًا ضخمًا، بل تستخدم بنية خليط الخبراء (Mixture-of-Experts - MoE).

  • التشبيه: تخيل بدلًا من أمين مكتبة واحد ضخم، لديك فريق من 100 خبير متخصص (مؤرخ، مبرمج، طباخ، طبيب، إلخ).
  • كيف يعمل: عندما تطرح سؤالًا، يقوم "الموجه" (المدير) بالنظر إلى السؤال ويوقظ فقط الخبراء الـ 4 أو الـ 8 ذوي الصلة بالموضوع، بينما يظل الآخرون نائمين.
  • المشكلة: إذا أردت تحديث حقيقة ما (مثلاً: "عاصمة فرنسا هي باريس")، فإن أدوات التعديل القديمة لم تكن تعرف كيف تتحدث مع هذا الفريق المحدد. لقد حاولت التعامل مع الفريق بأكمله ككتلة واحدة كبيرة، وهو أمر غير فعال وغير منظم. الطريقة الموجودة لإصلاح ذلك (تسمى MoE-Edit) كانت تشبه محاولة تحديث الخبراء واحدًا تلو الآخر في خط طويل، مما يستغرق وقتًا طويلاً للغاية.

الحل: MoTE (مدير الفريق الذكي)

يقترح المؤلفون طريقة جديدة تسمى MoTE (محرر توكر لخليط الخبراء). لقد حلوا المشكلة باستخدام حيلتين رئيسيتين:

1. الرياضيات "المختصرة" (هوية وودبري - Woodbury Identity)

الطريقة القديمة لتحديث الخبراء كانت تتطلب حل لغز رياضي ضخم ومعقد يتضمن عكس مصفوفة ضخمة (شبكة من الأرقام). كان الأمر يشبه محاولة حل لغز "سودوكو" يحتوي على مليون مربع.

استخدم المؤلفون حيلة رياضية تسمى هوية وودبري (Woodbury Identity).

  • التشبيه: بدلًا من حل لغز المليون مربع، أدركوا أنهم يحتاجون فقط لحل لغز صغير مكون من 50 مربعًا يمثل التغييرات التي تريد إجراءها.
  • النتيجة: يحول هذا المهمة من عملية تستغرق ساعات إلى عملية تستغرق دقائق. يمكنهم تحديث المعرفة دون الحاجة أبدًا إلى "إيقاظ" أو حساب الوزن الكامل لكل خبير في آن واحد.

2. احترام هيكل الفريق (تفكيك الموتر - Tensor Decomposition)

الحيلة الثانية كانت إدراك أن الخبراء ليسوا عشوائيين؛ بل هم مرتبطون ببعضهم البعض. لقد تم تدريبهم معًا، لذا فإن معرفتهم متصلة بشكل معين (مثل كتلة من الجبن بدلاً من ورقة مسطحة).

  • التشبيه: تخيل أن الخبراء هم جوقة موسيقية. إذا أردت تغيير طبقة الصوت في الأغنية، فأنت لا تصرخ في شخص واحد فقط، بل تضبط التناغم في المجموعة بأكملها.
  • الطريقة: استخدم المؤلفون تفكيك توكر (Tucker Decomposition). هذه طريقة لضغط "كتلة الجبن" (أوزان الخبراء) إلى شكل أساسي أصغر يلتقط جوهر المجموعة.
  • الفائدة: من خلال تعديل هذا "الجوهر" الأصغر، يتم تحديث جميع الخبراء تلقائيًا بطريقة تحترم علاقاتهم. هذا يمنع النموذج من الارتباك أو "نسيان" أشياء أخرى.

النتائج: سريعة ودقيقة

اختبرت الورقة البحثية MoTE على عدة نماذج ذكاء اصطناعي حديثة (مثل Qwen و GPT-OSS) وقارنتها بأفضل طريقة سابقة (MoE-Edit) وإعادة التدريب القياسية.

  • السرعة: MoTE أسرع بما يصل إلى 6 مرات من أفضل طريقة سابقة. يمكنها تعديل 1,000 حقيقة في جزء بسيط من الوقت.
  • الجودة: إنها جيدة بقدر الطرق الأبطأ في تصحيح الحقائق (الفعالية - Efficacy) وفي عدم كسر الأجزاء الأخرى من النموذج (الخصوصية - Specificity).
  • الكفاءة: تحقق ذلك من خلال إجراء الحساب الرياضي الثقيل مرة واحدة فقط في نهاية العملية ثم نشر تلك النتيجة إلى الطبقات الأخرى، بدلًا من إعادة الحساب لكل طبقة على حدة.

الملخص

تقدم الورقة البحثية MoTE، وهي أداة تسمح لنا بتحديث نماذج الذكاء الاصطناعي الحديثة القائمة على "الخببراء" بسرعة ودقة. وهي تفعل ذلك من خلال:

  1. استخدام اختصار رياضي لتجنب القيام بالحسابات الثقيلة غير الضرورية.
  2. احترام هيكل فريق الخبراء لضمان أن التحديثات منطقية.

هذا يعني أنه يمكننا إبقاء نماذج الذكاء الاصطناعي محدثة مع العالم الحقيقي دون الحاجة إلى إعادة تدريبها من الصفر، مما يوفر كميات هائلة من الوقت والطاقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →