← أحدث الأبحاث
🤖 machine learning

Locality-Aware Redundancy Pruning for LLM Depth Compression

تقترح هذه الورقة إطار عمل LoRP، وهو إطار عمل لتقليم العمق بضربة واحدة وبدون تدريب، يقوم بتخصيص إزالة الطبقات ديناميكيًا بناءً على "درجة محلية التمثيل" (Representation Locality Score) مبتكرة لتقليل الفائض في النماذج اللغوية الكبيرة بفعالية مع الحفاظ على الأداء.

المؤلفون الأصليون: Vincent-Daniel Yun, Youngrae Kim, Woosang Lim, YoungJin Heo, Minkyu Kim, Sunwoo Lee

نُشر 2026-05-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Vincent-Daniel Yun, Youngrae Kim, Woosang Lim, YoungJin Heo, Minkyu Kim, Sunwoo Lee

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة من المعرفة، عميقة للغاية (نموذج لغوي كبير). هذه المكتبة تتكون من مئات الطوابق (الطبقات)، وكل طابق يحتوي على فريق من أمناء المكتبة (العصبونات) الذين يساعدون في معالجة المعلومات. المشكلة هي أن هذه المكتبة ضخمة، ومكلفة للغاية في التشغيل، وبطيئة في التصفح. أنت تريد إزالة بعض الطوابق لجعلها أسرع، لكنك مرعوب من فكرة أنه إذا أزلت الطوابق الخاطئة، فقد تفقد المكتبة قدرتها على صنع المعنى.

تقدم هذه الورقة البحثية طريقة جديدة لتحديد أي الطوابق يجب هدمها، تسمى LoRP (تقليم الفائض القائم على مراعاة الموضع - Locality-Aware Redundancy Pruning). وإليك كيف تعمل، مشروحة ببساطة:

الطريقة القديمة: التخمين والتحقق

في السابق، حاول الناس تقليص هذه المكتبات باستخدام استراتيجيتين رئيسيتين:

  1. النهج "المحلي": كانوا ينظرون إلى كل طابق بشكل فردي ويقولون: "هذا الطابق يبدو ضعيفاً، فلنزله". افترضوا أن كل طابق فريد ومستقل.
  2. النهج "المتصل": افترضوا أن التكرار (الفائض غير الضروري) يحدث فقط في كتلة محددة من الطوابق، مثل الطوابق من 10 إلى 15. لذا، كانوا يقومون ببساطة بقطع تلك الكتلة بأكملها.

المشكلة: اكتشف المؤلفون أن المكتبات المختلفة (نماذج الذكاء الاصطناعي) لها "بنيات" مختلفة. في بعض المكتبات، يكون العمل الزائد وغير الضروري مركزاً في كتلة واحدة محددة. وفي مكتبات أخرى، يكون العمل الزائد منتشراً بالتساوي عبر المبنى بأكم، من القبو إلى السطح. استخدمت الطرق القديمة قاعدة "مقاس واحد يناسب الجميع"، مما أدى غالباً إلى قطع طوابق مهمة أو ترك طوابب غير مفيدة خلفها.

الطالطريقة الجديدة: LoRP (المهندس المعماري الذكي)

LoRP يشبه مهندساً معمارياً ذكياً يتجول في المكتبة قبل إجراء أي عمليات قطع ليرى كيف ترتبط الطوابق ببعضها البعض فعلياً. هو لا يحتاج إلى إعادة تدريب المكتبة (عملية "خالية من التدريب")؛ بل يكتفي بمراقبة كيفية تواصل أمناء المكتبة مع بعضهم البعض.

إليك العملية خطوة بخطوة:

1. اختبار "الصدى" (قياس التشابه)

يرسل المهندس المعماري بعض الجمل النموذجية عبر المكتبة ويستمع إلى كيفية تغير "الأفكار الخفية" (التمثيلات) من طابق إلى آخر.

  • إذا كان الطابق 5 والطابق 6 يقولان الشيء نفسه تقريباً، فهما متكرران (فائض).
  • إذا كان الطابق 5 يقول شيئاً مختلفاً تماماً عن الطابق 6، فهما فريدان.

2. "درجة الموضع" (RLS)

يحسب المهندس المعماري درجة تسمى درجة موضع التمثيل (RLS). فكر في هذا كـ "مقياس التكتل":

  • درجة عالية (متكتل): المكتبة تحتوي على "غرف صدى". الطوابق من 10 إلى 20 كلها تكرر نفس الأفكار. التكرار هنا محلي.
  • درجة منخفضة (منتشر): المكتبة تحتوي على "أصداء منتشرة". التكرار مشتت في جميع أنحاء المبنى، من القبو إلى السطح. التكرار هنا موزع عالمياً.

3. تجميع الطوابق (التجميع العنقودي)

بناءً على هذه الدرجة، يقوم المهندس المعماري بتجميع الطوابق في "أحياء" (عناقيد) من التفكير المتشابه.

  • إذا كانت المكتبة "متكتلة"، ستكون الأحياء عبارة عن مجموعات ضيقة من الطوابق المتطابقة.
  • إذا كانت المكتبة "منتشرة"، ستكون الأحياء أكثر تنوعاً.

4. القطع على مرحلتين (التقليم)

الآن، يقرر المهندس المعماري أي الطوابق سيتم إزالتها باستخدام استراتيجية من خطوتين:

  • الخطوة 1 (التغطية): أولاً، يتأكد من إزالة طابق واحد من كل حي. هذا يضمن عدم مسح حي فريد بالكامل عن طريق الخطأ.
  • الخطوة 2 (التنظيف): بعد ذلك، ينظر إلى الطوابق المتبقية في كل حي. يستمر في إزالة الطوابق الأكثر "تكراراً" (الأكثر تشابهاً) حتى يصل إلى الحجم المستهدف.

لماذا تعمل هذه الطريقة بشكل أفضل؟

اختبرت الورقة البحثية هذه الطريقة على أنواع مختلفة من نماذج الذكاء الاصطناعي (مثل LLaMA و Mistral و Qwen).

  • للنماذج "المتكتلة": حددت LoRP بدقة أنه يمكن إزالة كتلة كبيرة من الطوابق من منطقة معينة بأمان.
  • للنماذج "المنتشرة": أدركت LoRP بشكل صحيح أنها بحاجة لأخذ القليل من مناطق مختلفة، بدلاً من قطع كتلة كبيرة.

النتيجة:
لأن LoRP يتكيف مع الشكل الخاص لكل مكتبة، فإنه يحافظ على ذكاء ودقة الذكاء الاصطناعي بشكل أفضل من الطرق القديمة التي تتبع مبدأ "مقاس واحد يناسب الجميع". فهو يحافظ على قدرة المكتبة على الإجابة على الأسئلة وفهم اللغة بشكل أفضل بكثير، حتى بعد إزالة عدد كبير من الطوابق.

باخت-الاختصار

فكر في الأمر كأنك تقوم بتحرير فيلم.

  • الطرق القديمة كانت تشبه قطع كل مشهد عاشر عشوائياً، أو قطع كتلة كاملة مدتها 5 دقائق لأنهم افترضوا أن الفيلم مكرر بطريقة معينة.
  • LoRP يشبه المخرج الذي يشاهد الفيلم بأكمله أولاً، ويرى بالضبط أين يتكرر الحوار، ثم يقطع الجمل المكررة المحددة مع الحفاظ على تدفق القصة، بغض النظر عن كيفية بناء الفيلم في الأصل.

تخلص الورقة البحثية إلى أن فهم أين و كيف تتكرر المعلومات في الذكاء الاصطناعي هو المفتاح لتقليص حجمه بكفاءة دون كسر بنيته.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →