Float8@2bits: Entropy Coding Enables Data-Free Model Compression
تقدم الورقة البحثية EntQuant، وهو إطار عمل لضغط ما بعد التدريب بدون بيانات يستفيد من ترميز الإنتروبيا لتحقيق ضغط بمعدل بتات فائق (أقل من 4 بت) يصل إلى أحدث المستويات في النماذج الكبيرة مثل نماذج الـ 70 مليار بارامتر في أقل من 10 دقائق، حيث ينجح في توحيد سرعة وعالمية الطرق التي لا تعتمد على البيانات مع الدقة العالية التي تتطلب عادةً بيانات معايرة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مكتبة ضخمة ومفصلة للغاية من الكتب (نموذج لغوي كبير). لكي تتمكن من قراءة هذه الكتب على جهاز صغير مثل الهاتف الذكي، تحتاج إلى تقليص حجمها. عادةً، هناك طريقتان للقيام بذلك:
- طريقة "السريع والرديء": تقوم بتصوير الكتب بسرعة على بطاقات فهرسة صغيرة. هذه الطريقة سريعة ولا تتطلب أي بحث إضافي، ولكن إذا قمت بتقليصها كثيراً (أقل من 4 بت)، تصبح الكلمات غير مفهومة وتنهار القصة.
- الطريقة "البطيئة والمثالية": تقوم بتعيين فريق من المحررين لإعادة كتابة كل جملة بعناية، باستخدام مجموعة محددة من الكتب المرجعية لضمان بقاء المعنى مثالياً. هذه الطريقة تعمل بشكل رائع، لكنها تستغرق أياماً، وتتطلب أجهزة كمبيوتر باهظة الثمن، وتحتاج إلى الوصول إلى تلك الكتب المرجعية (التي غالباً ما تكون غير موجودة أو خاصة).
إليك EntQuant: تقدم الورقة البحثية طريقة جديدة تسمى EntQuant تعمل مثل "شعاع التصغير السحري" الذي يجمع بين أفضل ما في العالمين. إنها سريعة، ولا تحتاج إلى كتب مرجعية، وتحافظ على سلامة القصة حتى عندما يتم تقليص حجمها إلى حد أقصى.
إليك كيف تعمل، باستخدام تشبيهات بسيطة:
1. المشكلة: فخ "الصندوق الثابت"
الطرق الحالية تجبر كلمات المكتبة على الدخول في صناديق ذات أحجام ثابتة.
- إذا كنت تريد توفير المساحة، يجب عليك استخدام صناديق صغيرة جداً (بتات منخفضة).
- لكن الصناديق الصغيرة لا يمكنها حمل سوى عدد قليل من الكلمات المحددة. وإذا احتاجت المكتبة للتعبير عن فكرة معقدة، فستتعثر لأن الصندوق سيكون صغيراً جداً. لهذا السبب تفشل الطرق الحالية عندما تحاول تقليص النماذج إلى أقل من 4 بت؛ حيث تنفد "القدرة التعبيرية".
2. الحل: "نظام أرشفة ذكي"
تغير EntQuant القواعد. بدلاً من إجبار الكلمات على الدخول في صناديق صغيرة، فإنها تبقي الكلمات في صناديقت عالية الجودة ومعيارية (مثل Float8 أو Int8) ولكنها تنظمها بذكاء شديد بحيث لا تشغل مساحة تذكر.
فكر في الأمر كأنه خدمة تعبئة وتغليف عند الانتقال من منزل لآخر:
- الطريقة القديمة: يجب عليك وضع أثاثك في صناديق ذات أحجام مسبقة التحديد. إذا كان لديك أريكة ضخمة، فسيتعين عليك تقطيعها لتناسب صندوقاً صغيراً.
- طريقة EntQuant: تحافظ على الأثاث كاملاً (دقة عالية)، ولكنك ترتبه بإحكام شديد بحيث تكون الشاحنة شبه فارغة. أنت تستخدم "خوارزمية ذكية" لتعبئة العناصر بكفاءة عالية بحيث تكون الشاحنة مليئة بالهواء بنسبة 90%، ومع ذلك تظل العناصر محفوظة تماماً.
3. السر الكامن: "ترميز الإنتروبيا"
تستخدم الورقة البحثية تقنية تسمى ترميز الإنتروبيا (تحديداً ما يسمى ANS).
- تخيل أنك تكتب شفرة سرية. إذا ظهر حرف "E" بنسبة 50% من الوقت، فإنك تعطيه رمزاً قصيراً جداً (مثل "1"). أما إذا ظهر حرف "Z" نادراً، فتعطيه رمزاً أطول (مثل "11010").
- تقوم EntQuant أولاً "بتدريب" النموذج على استخدام أرقام معينة بشكل متكرر أكثر من غيرها (مما يجعل البيانات "منخفضة الإنتروبيا").
- ثم تستخدم هذا الترميز الذكي لضغط البيانات. ولأن الأرقام قابلة للتنبؤ، يمكن للكمبيوتر تخزينها باستخدام أقل من 2 بت لكل معلمة (parameter) في المتوسط، رغم أن الأرقام نفسها لا تزال مخزنة بتنسيقات عالية الدقة.
4. لماذا يعد هذا أمراً بالغ الأهمية؟
- لا حاجة لـ "المعايرة": معظم طرق الضغط عالية الجودة تحتاج إلى "تجربة قيادة" باستخدام مجموعة بيانات لضبط النموذج. EntQuant لا تعتمد على البيانات (Data-free). يمكنك أخذ نموذج، وضغطه في أقل من 10 دقائق، وسيعمل ببساطة. وهذا أمر بالغ الأهمية للنماذج الخاصة أو المتخصصة حيث لا تملك بيانات التدريب الخاصة بها.
- الضغط الفائق: نجحت في ضغط نماذج ضخمة (مثل نموذج بـ 70 مليار معلمة) إلى حجم يناسب بطاقة رسوميات استهلاكية، مع الحفاظ على ذكاء النموذج بما يكفي لاتباع تعليمات معقدة وحل المسائل الرياضية.
- السرعة: بينما يتعين عليها "فك" البيانات قليلاً أثناء القراءة (التشفير)، توضح الورقة أن هذا يحدث بسرعة كبيرة على أجهزة الكمبيوتر الحديثة لدرجة أن التباطؤ يكون ضئيلاً (حوالي 1.5 إلى 2 مرة أبطأ من الأصل، وهو لا يزال سريعاً جداً).
الخلاصة
لقد ابتكر المؤلفون، باتريك بوتزكي ومارتن جينزل (وفريقهم في Merantix Momentum)، أداة تتيح لك تقليص نماذج الذكاء الاصطناوي العملاقة لتصبح بحجم حقيبة سفر صغيرة دون فقدان ذكائها، ويمكنك القيام بذلك فوراً دون الحاجة إلى أي بيانات إضافية. الأمر يشبه القدرة على وضع يخت بطول 70 قدماً في حقيبة ظهر دون أن يتحطم.
النتيجة الرئيسية: لقد كسروا القاعدة التي تقول "لكي توفر المساحة، يجب أن تفقد الجودة". فمن خلال استخدام نظام أرشفة ذكي (ترميز الإنتروبيا) بدلاً من مجرد تقطيع البيانات، حافظوا على الجودة العالية مع تحقيق تقليص هائل في الحجم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.