← أحدث الأبحاث
🤖 machine learning

FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

تقترح الورقة البحثية FAMPWQ، وهي طريقة جديدة لتكميم الأوزان ذات الدقة المختلطة التكيفية القائمة على معلومات فيشر، والتي تستخدم مخصصاً يعتمد على التعلم التعزيزي لتحسين توزيع عرض البت عبر الطبقات، مما يحسن بشكل كبير أداء استدلال النماذج اللغوية الكبيرة ودقتها على الأجهزة محدودة الموارد مقارنة بالنماذج المرجعية الحالية.

المؤلفون الأصليون: Gongwei Lee, Ji Liu, Juncheng Jia, Ji Wu

نُشر 2026-08-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Gongwei Lee, Ji Liu, Juncheng Jia, Ji Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تُعد النماذج اللغوية الكبيرة هي المحركات التي تقف وراء جيل جديد من الذكاء الاصطناعي، وهي قادرة على كتابة القصص، وحل المشكلات، وإجراء محادثات بطلاقة كانت تبدو مستحيلة في السابق. تُبنى هذه الأنظمة على شبكات واسعة من الروابط الرياضية، المعروفة باسم "المعلمات" (parameters)، والتي تُخزن كأرقام في ذاكرة الحاسوب. وكلما زاد تعقيد النموذج، زادت كمية الذاكرة التي يتطلبها للتشغيل. وبينما تعمل هذه النماذج ببراعة في مراكز البيانات القوية، فإن حجمها الهائل يجعل من الصعب استخدامها على الأجهزة اليومية مثل أجهزة الكمبيوتر المحمولة أو الهواتف الذكية، التي تمتلك مساحة تخزين وقدرة معالجة أقل بكثير. ولتجسير هذه الفجوة، يستخدم المهندسون تقنية تسمى "التكميم" (quantization)؛ وهي عملية تبسط الأرقام داخل النموذج، مما يقلل من دقتها لتوفير المساحة. ومع ذلك، فإن هذا التبسيط هو مقايضة دقيقة: فإذا تم تقريب الأرقام بشكل مفرط، تتلاشى ذكاء النموذج، ويبدأ في ارتكاب الأخطاء أو يفقد قدرته على فهم السياق.

لسنوات، كان النهج القياسي لهذه المشكلة هو معاملة كل جزء من النموذج بنفس الطريقة. حيث كان المهندسون يطبقون مستوى موحداً من التبسيط على النظام بأكلى، تماماً مثل صنفرة منحوتة خشبية باستخدام نفس درجة خشونة ورق الصنفرة على كامل السطح. هذه الطريقة بسيطة، لكنها تتجاهل حقيقة جوهرية: وهي أن أجزاءً ليست متساوية في الأهمية داخل النموذج اللغوي. فهناك أقسام من الشبكة حساسة للغاية للتغييرات، حيث يمكن لأي خطأ ضئيل أن يفسد المخرجات، بينما تكون أقسام أخرى قوية ويمكنها تحمل تبسيط كبير دون أي فقدان ملحوظ في الجودة. وقد أظهرت الأبحاث الحديثة أن تطبيق نفس المستوى من الضغط على كل من المناطق الحساسة والقوية يجبرنا على الاختيار بين إهدار الذاكرة في أجزاء لا تحتاج إليها، أو تدمير ذكاء النموذج عبر الضغط المفرط للأجزاء التي تحتاج ذلك.

لقد طور فريق من الباحثين الآن طريقة جديدة تسمى FAMPWQ تحل هذه المشكلة من خلال التعامل مع كل طبقة من طبقات النموذج بشكل فردي. فبدلاً من تطبيق قاعدة واحدة على النظام بأكمله، يقوم نهجهم بقياس مدى حساسية كل طبقة محددة للضغط قبل تقرير مقدار تبسيطها. وللقيام بذلك، يستخدمون مفهوماً رياضياً يُعرف باسم "معلومات فيشر" (Fisher information)، والذي يعمل بمثابة اختبار جهد للبنية الداخلية للنموذج. حيث يقومون بإدخال اضطراب صغير ومحاكى للأرقام في طبقة معينة ويراقبون مدى تغير أداء النموذج استجابة لذلك. فإذا انخفض الأداء بشكل حاد، تُعتبر الطبقة حساسة ويتم الإبقاء عليها بدقة أعلى. أما إذا ظل الأداء مستقراً، فيتم تحديد الطبقة كطبقة قوية ويتم ضغطها بشكل أكثر عدوانية. وهذا يسمح للنظام بالحفاظ على الأجزاء الحرجة والدقيقة للنموذج، مع تقليص الأجزاء الزائدة بشكل حاد، مما يخلق توازناً مصمماً خصيصاً لكل نموذج على حدٍ.

بمجرد أن يحدد الباحثون حساسية كل طبقة، يستخدمون خوارزمية تعلم لتحديد عدد بتات الدقة التي يجب تخصيصها لكل منها بالضبط. تعمل هذه الخوارزمية كـ "مخطط استراتيجي"، حيث تبحث عن المزيج المثالي من الدقة العالية والمنخفضة الذي يتناسب مع حد ذاكرة صارم مع الحفاظ على ذكاء النموذج سليماً. والهدف هو إيجى تكويناً يتم فيه تقليل استخدام الذاكرة الإجمالي إلى أدنى حد، مع إبقاء فقدان الدقة منخفضاً قدر الإمكان. ومن خلال استخدام هذه الاستراتيجية التكيفية، تمكن الباحثون من دفع حدود ما هو ممكن للنماذج المضغوطة. وفي الاختبارات على عدة نماذج لغوية كبيرة مختلفة، تفوقت طريقتهم باستمرار على التقنيات الموجودة. فعندما تم ضغط النماذج إلى متوسط ثلاثة بتات فقط لكل رقم، أنتج النهج الجديد نتائج أكثر دقة بكثير من الطرق الأخرى، حيث أظهرت بعض الاختبارات انخفاضاً في الأخطاء بنسبة تقارب 7 في المائة.

تشير نتائج هذا العمل إلى أن مستقبل تشغيل الذكاء الاصطناعي القوي على الأجهزة الصغيرة يكمن في المرونة بدلاً من الموحدة. فقد وجد الباحثون أنه من خلال احترام الاحتياجات الفريدة لكل جزء من الشبكة، استطاعوا الحفاظ على الأداء العالي حتى عند وجود بصمة ذاكرة منخفضة للغاية. وفي المقارنات المباشرة حيث طُلب من النماذج تقييم جودة إجاباتها الخاصة، فازت الطريقة الجديدة على النهج الرائدة الأخرى في ما يصل إلى 76 في المائة من الحالات. وهذا يشير إلى أن النماذج احتفظت بفهم أعمق للغة والمنطق مما كان يُعتقد سابقاً تحت مثل هذه القيود الصارمة. وبينما تتطلب الطريقة فترة تحليل أولية لتحديد الإعدادات المثلى، فإن هذه التكلفة هي مصروف لمرة واحدة يتم تعويضه من خلال القدرة على تشغيل هذه النماذج المتطورة على أجهزة كانت في السابق محدودة جداً بحيث لا تدعمها. إن هذا العمل يثبت أنه من خلال قياس هشاشة مكونات النظام بعناية، يمكننا ضغطه بشكل أكثر فعالية من خلال تطبيق حل واحد يناسب الجميع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →