← أحدث الأبحاث
🤖 machine learning

EntroLLM: Entropy Encoded Weight Compression for Efficient Large Language Model Inference on Edge Devices

إنّ EntroLLM هو إطار عمل لضغط ما بعد التدريب يجمع بين التكميم المختلط وتشفير الإنتروبيا لتقليل متطلبات التخزين بشكل كبير وتسريع الاستدلال للنماذج اللغوية الكبيرة على الأجهزة الطرفية دون الحاجة لإعادة التدريب.

المؤلفون الأصليون: Arnab Sanyal, Gourav Datta, Prithwish Mukherjee, Sandeep P. Chinchali, Michael Orshansky

نُشر 2026-05-05✓ Author reviewed
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Arnab Sanyal, Gourav Datta, Prithwish Mukherjee, Sandeep P. Chinchali, Michael Orshansky

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة من الكتب (نموذج لغوي كبير - LLM) تود حملها في حقيبة ظهرك لتقرأها أثناء التنزه (على جهاز طرفي مثل هاتف ذكي أو روبوت صغير). المشكلة هي أن المكتبة ثقيلة وكبيرة جداً بحيث لا يمكن أن تسعها حقيبتك، وحتى لو استطعت، ستتعب ذراعاك بمجرد محاولة سحب الكتب واحداً تلو الآخر لتقرأها.

تقدم هذه الورقة البحثية طريقة جديدة تسمى EntroLLM لحل هذه المشكلة. فكر في الأمر كخدعة سحرية مكونة من ثلاث خطوات لجعل المكتبة أصغر وأسهل في الحمل دون فقدان أي من القصص الموجودة بداخلها.

1. الفرز "المدبب" (الكمية المختلطة - Mixed Quantization)

عادةً، عندما يحاول الناس تقليص حجم هذه المكتبات، يقومون فقط بتقريب الأرقام في الكتب لجعلها أبسط (مثل تقريب 3.14159 إلى 3.14). تسمى هذه العملية الكمية (Quantization). ومع ذلك، فإن الطرق القياسية غالباً ما تجعل الأرقام تبدو "مسطحة" وعشوائية للغاية، مما يجعل من الصعب ضغطها بشكل أكبر.

خدعة المؤلفين هي النظر إلى كل فصل (أو "طبقة") من الكتاب بشكل فردي. وبناءً على كيفية توزيع الأرقام في ذلك الفصل تحديداً، يختارون طريقة خاصة لتقريبها:

  • الكمية غير الموقعة (Unsigned Quantization): مثل العدّ باستخدام الخطوات الموجبة فقط.
  • الكمية غير المتماثلة (Asymmetric Quantization): مثل إزاحة نقطة الصفر لتناسب الأرقام بشكل أفضل.

من خلال القيام بذلك، تصبح الأرقام في المكتبة "مدببة". تخيل سلسلة جبلية حيث تتجمع معظم القمم بإحكام في المنتصف، مع وجود عدد قليل جداً من القمم المتطرفة. هذا الشكل "المدبب" أسهل بكثير في الضغط من التضاريس المسطحة والعشوائية.

2. قاموس "الاختصارات" (ترميز هوفمان - Huffman Coding)

بمجرد فرز الأرقام في هذا النمط "المدبب"، يستخدم المؤلفون تقنية تسمى ترميز هوفمان.

فكر في هذا الأمر ككتابة كود سري للمكتبة. في اللغة الإنجليزية، يظهر حرف "E" كثيراً، لذا قد تقرر تمثيل "E" بنقطة واحدة (•)، بينما يحصل حرف نادر مثل "Z" على كود طويل (•••••).

  • لأن الفرز "المدبب" جعل قيم أرقام معينة تظهر بشكل متكرر جداً، فإن الكود يعطي تلك الأرقام الشائعة تسميات قصيرة وصغيرة جداً.
  • أما الأرقام النادرة فتحصل على تسميات أطول.

هذا يقلص الحجم الإجمالي للمكتبة بشكل كبير. وتدعي الورقة أن هذه الخطوة تجعل الضغط أفضل بمقدار 7 إلى 11 مرة من الطرق الرائدة الحالية. إنه يشبه تحويل كتاب مكون من 100 صفحة إلى كتيب مكون من 10 صفحات دون تغيير القصة.

3. استراتيجية "القراءة الجماعية" (التشفير المتوازي - Parallel Decoding)

إليك الجزء الصعب: عادةً، لقراءة كود سري، يجب عليك قراءته حرفاً بحرف من البداية إلى النهاية. إذا كانت لديك مكتبة ضخمة، فسيستغرق ذلك وقتاً طويلاً جداً، وستتعطل حقيبة ظهرك (الجهاز) في الانتظار.

أدرك المؤلفون أنه على الرغم من أن الكود قصير، إلا أن الكتب لا تزال منظمة في كتل كبيرة (تنسورات/Tensors). لذا، قاموا بتقسيم المكتبة إلى العديد من الأقسام المستقلة والمنفصلة.

  • بدلاً من شخص واحد يقرأ الكود بالكامل بالتتابع، قاموا بتعيين فريق من القراء (خيوط معالجة متوازية).
  • يأخذ كل قارئ جزءاً مختلفاً من المكتبة ويقوم بفك تشفير قسمه في وقت واحد.
  • ولأن الأجزاء مستقلة، فإنهم ليس عليهم الانتظار لبعضهم البعض.

هذا يعني أنه على الرغم من أن المكتبة صغيرة ومضغوطة، يمكن للجهاز "فك حزم" الكتب فوراً عند الحاجة، مما يجعل سرعة القراءة سريعة جداً.

النتائج: حقيبة ظهر أخف وأسرع

اختبر المؤلفون هذه الطريقة على ثلاث "مكتبات" مختلفة (نماذج ذكاء اصطناعي) بأحجام متفاوتة على جهاز صغير (NVIDIA JETSON، وهو بمثابة كمبيوتر قوي ولكنه صغير).

  • التخزين: وفروا مساحة أكبر بنسبة تصل إلى 30% مقارنة بالنماذج القياسية ذات الـ 8 بت، و65% أكثر مقارنة بنماذج الـ 4 بت.
  • السرعة: نظرًا لأن كمية أقل من البيانات كان يجب نقلها، استطاع الجهاز التفكير (الاستنتاج) بشكل أسرع بنسبة تتراوح بين 30% إلى 146%.
  • الدقة: ظلت "القصص" (إجابات الذكاء الاصطناعي) بنفس دقة المكتبة الأصلية غير المختصرة.

باختواماً: EntroLLM هي طريقة لضغط عقل ذكاء اصطناعي ضخم داخل حقيبة ظهر صغيرة عن طريق تنظيم البيانات في شكل "مدبب"، وكتابتها باختصار فعال للغاية، وتوظيف فريق من العمال لفك حزمها جميعاً في وقت واحد. وهذا يجعل من الممكن تشغيل ذكاء اصطناعي ذكي على أجهزة صغيرة تعمل بالبطارية دون الحاجة إلى كمبيوتر خارق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →