Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations
تبحث هذه الورقة في كيفية تأثير التكميم على التفسيرات الذاتية للنماذج اللغوية الكبيرة، وتجد أنه بينما يتسبب ذلك عمومًا في انخفاضات متوسطة في جودة التفسير، والأمانة، وثقة المستخدم، فإن التأثير يتباين باختلاف السياق وحجم النموذج، مما يستلزم التحقق من الحالة الخاصة قبل النشر.
المؤلفون الأصليون:Qianli Wang, Nils Feldhus, Pepa Atanasova, Fedor Splitt, Simon Ostermann, Sebastian Möller, Vera Schmitt
تُعد النماذج اللغوية الكبيرة أدوات قوية يمكنها الكتابة، والتفكير، وشرح طريقة تفكيرها. وعندما تتخذ هذه الأنظمة قراراً ما، يمكنها غالباً توليد جملة أو جملتين تصفان سبب اختيارها لهذا المسار، وهي ميزة تُعرف باسم "التفسير الذاتي". وتكتسب هذه القدرة أهمية متزايدة في المواقف عالية المخاطر، مثل التشخيص الطبي أو التحليل القانوني، حيث يحتاج المستخدمون إلى الثقة في أن الآلة تفكر بشكل صحيح ولا تخمن فحسب. ولجعل هذه الأنظمة الضخمة أسرع وأرخص في التشغيل على الأجهزة اليومية، يستخدم المهندسون غالباً تقنية تُسمى "الكمية" (quantization). تشبه هذه العملية ضغط صورة عالية الدقة إلى حجم ملف أصغر؛ فهي تقلل من دقة الأرقام داخل النموذج لتوفير المساحة وتسريع الحسابات، لكنها تخاطر بفقدان بعض التفاصيل الدقيقة التي تجعل الصورة واضحة. والسؤال الجوهري الذي يواجه الباحثين هو ما إذا كان هذا الضغط يؤدي أيضاً إلى طمس قدرة النموذج على شرح نفسه بصدق.
لقد وضع فريق من العلماء نصب أعينهم استقصاء هذه المشكلة تحديداً. حيث أخذوا عدة نماذج لغوية كبيرة بأحجام مختلفة وطبقوا عليها ثلاث تقنيات ضغط شائعة، مما أدى إلى إنشاء نسخ تستخدم بتات أقل من المعلومات لتخزين معرفتها. ثم طلبوا من هذه النماذج توليد نوعين من التفسيرات لمهام متنوعة: المبررات باللغة الطبيعية، وهي جمل مكتوبة تشرح قراراً ما، والأمثلة "الواقعية المضادة" (counterfactual examples)، وهي نسخ معدلة قليلاً من المدخلات التي من شأنها أن تجعل النموذج يغير رأيه. ومن خلال مقارنة النماذج المضغوطة بنسخها الأصلية غير المضغوطة، استطاع الباحثون معرفة ما إذا كان فعل تقليص حجم النموذج يؤدي أيضاً إلى تقليص قدرته على التفكير الصادق.
أظهرت النتائج أنه بينما يكون للضغط تأثير، إلا أنه ليس كارثياً كما يُخشى، وإن كان لا يخلو من التكلفة. فقد وجدت الدراسة أن "الكمية" تؤدي عادةً إلى انخفاض متوسط في جودة التفسيرات، حيث تنخفض الدرجات بنسبة تصل إلى 4.4 بالمئة، وانخفاض مماثل في "الأمانة" (faithfulness)، بمعنى أن التفسيرات أصبحت أقل توافقاً مع المنطق الداخلي الفعلي للنموذج بنسبة تصل إلى 3.9 بالمئة. ومع ذلك، كانت تجربة البشر لهذه التغييرات أكثر وضوحاً. ففي دراسة شملت ثمانية وأربعين شخصاً قرأوا التفسيرات وقيموها، وُجد أن النماذج المضغوطة كانت تُعتبر أقل موثوقية وأقل تماسكاً بشكل ملحوظ، حيث انخفضت درجات الموثوقية بنسبة تصل إلى 8.5 بالمئة. ويشير هذا إلى أنه بينما قد تظل النماذج وظيفية من الناحية التقنية، إلا أن التفسيرات التي تنتجها تبدو أقل موثوقية للقارئ البشري.
ومن المثير للاهتمام أن الباحثين اكتشفوا أن الحجم لا يضمن دائماً الصمود. فبينما كانت النماذج الأكبر حجماً أفضل عموماً في الحفاظ على صدق تفسيراتها عند ضغطها، إلا أنها لم تنتج بالضرورة نصوصاً ذات جودة أعلى من النماذج الأصغر غير المضغلة. علاوة على ذلك، لم تثبت أي طريقة ضغط واحدة أنها الأفضل في جميع المجالات؛ فبعض التقنيات حافظت على دقة المهام بشكل أفضل، بينما كانت تقنيات أخرى أفضل قليلاً في الحفاظ على تماسك التفسيرات. كما سلطت الدراسة الضوء على قصور في كيفية تقييمنا لهذه الأنظمة حالياً؛ حيث وجد الباحثون أن استخدام ذكاء اصطناعي آخر للحكم على جودة هذه التفسيرات فشل في مطابقة الحكم البشري. فقد أغفل الحكام الآليون الطرق الدقيقة التي أدى بها الضغط إلى تدهور موثوقية النص، وهي فجوة لا يمكن إلا للتقييم البشري كشفها.
وفي الختام، تخلص الورقة البحثية إلى أن "الكمية" تظل استراتيجية قابلة للتطبيق لنشر هذه النماذج، بشرط أن يختبر المطورون التفسيرات المحددة التي ستولدها نماذجهم قبل وضعها قيد التشغيل. إن التدهور في الأداء غالباً ما يكون صغيراً بما يكفي ليكون مقبولاً، ولكن في المواقف التي تكون فيها الشفافية أمراً حاسماً، مثل الرعاية الصحية أو العدالة، فإن الخسارة الطفيفة في التماسك والموثوقية تكتسي أهمية بالغة. وتشير النتائج إلى عدم وجود حل واحد يناسب الجميع؛ وبدلاً من ذلك، يجب على الممارسين التحقق بعناً من كيفية تأثير الضغط على النوع المحدد من التفسيرات الذي سيقدمه نظامهم، لضمان بقاء النموذج شريكاً موثوقاً في اتخاذ القرار حتى بعد ضغطه.
ملخص تقني: هل لا تزال النماذج اللغوية الكبيرة قادرة على تفسير نفسها؟ استقصاء أثر التكميم على التفسيرات الذاتية
بيان المشكلة يُعد التكميم (Quantization) تقنية قياسية لضغط النماذج اللغوية الكبيرة (LLMs) لتسهيل الاستدلال والتشغيل بكفاءة، لا سيما على الأجهزة ذات الموارد المحدودة. وبينما بحثت أبحاث مستفيضة في تأثير التكميم على أداء المهام، والقدرات متعددة اللغات، والتحيز، والمواءمة، إلا أن تأثيره على التفسيرات الذاتية (Self-Explanations - SEs) لا يزال غير مستكشف. والتفسيرات الذاتية هي مبررات يولدها النموذج لمخرجاته الخاصة، ويتم الاعتماد عليها بشكل متزايد لتعزيز الشفافية في التطبيقات عالية الخطورة. ويفترض المؤلفون أن التفسيرات الذاتية قد تكون حساسة بشكل خاص للتكميم لأن النماذج اللغوية الكبيرة يتم تحسينها مباشرة لأداء المهام، بينما يعد توليد تفسيرات أمينة قدرة ثانوية وغير مباشرة. وعلاوة على ذلك، نظرًا لأن النماذج المكممة تُستخدم كثيرًا في دراسات توليد التفسيرات الذاتية السابقة، فإن فهم ما إذا كان التكميم يقلل من الجودة (التماسك، والمعقولية) والأمانة (المواءمة مع الاستدلال الداخلي للنموذج) لهذه التفسيرات أمر بالغ الأهمية.
المنهجية تجري الدراسة تقييمًا شاملًا عبر ستة نماذج لغوية كبيرة مفتوحة المصدر (Llama3-8B/70B و Qwen2.5-7B/14B/32B/72B) وثلاث تقنيات شائعة للتكميم بعد التدريب (PTQ) وهي: GPTQ، وAWQ، والتكميم الصحيح (Integer Quantization - BITSANDBYTES) بدقتين 4-بت و8-بت. يركز التقييم على نوعين متميزين من التفسيرات الذاتية ذات النص الحر:
التفسيرات باللغة الطبيعية (NLEs): يتم توليدها في بيئة "الصفر محاولة" (zero-shot) باستخدام مطالبات ZeroCoT.
الأمثلة المقابلة للواقع (CFEs): يتم توليدها باستخدام إطار عمل FIZLE لإنشاء مدخلات معدلة بأقل قدر من التغيير تؤدي إلى عكس تنبؤ النموذج.
يتكون إطار التقييم من ثلاثة منظورات:
التقييم الآلي: يتم تقييم التفسيرات باللغة الطبيعية (NLEs) عبر BARTScore (المعقولية القائمة على المرجع) وTIGERScore (كشف الأخطاء المستقل عن المرجع). أما الأمثلة المقابلة للواقع (CFEs) فيتم تقييمها باستخدام معدل قلب الملصق (LFR)، والارتباك (PPL)، والتشابه النصي (TS).
تقييم الأمانة (Faithfulness): يتم اختبار التفسيرات باللغة الطبيعية (NLEs) باستخدام الميزات المنحازة (Biasing Features) (للتحقق مما إذا كانت التفسيرات تعكس التحيزات المحقونة) وCC-SHAP (لقياس المواءمة بين مساهمات المدخلات في التنبؤ مقابل التفسير). ويتم تقييم الأمثلة المقابلة للواقع (CFEs) عبر الاتساق الذاتي (Self-Consistency) (للتحقق مما إذا كان المثال المقابل للواقع قد نجح في تغيير التنبؤ إلى الملصق المستهدف).
التقييم البشري: دراسة مستخدمين مع 48 مشاركًا قاموا بتقييم التفسيرات باللغة الطبيعية (NLEs) والأمثلة المقابلة للواقع (CFEs) من حيث الموثوقية والتماسك باستخدام مقياس ليكرت الخماسي. بالإضافة إلى ذلك، أُجري تقييم "النموذج كحكم" (LLM-as-a-Judge) لمقارنة التسجيل الآلي مقابل التقييمات البشرية.
المساهمات والنتائج الرئيسية
تدهور متوسط في الجودة والأمانة: يؤدي التكميم عمومًا إلى انخفاضات متوسطة في جودة التفسيرات الذاتية (حتى 4.4%) وأمانتها (حما حتى 3.9%). ومع ذلك، فإن التأثير متغير للغاية؛ ففي بعض التكوينات، تولد النماذج المكممة تفسيرات بجودة مماثلة أو حتى أعلى من نظيراتها ذات الدقة الكاملة، وربما يعود ذلك إلى تأثيرات التنظيم (regularization) أو تقليل الاعتلاج (entropy) في المخرجات.
حجم النموذج والمتانة: تظهر النماذج الأكبر حجمًا مرونة محدودة فيما يتعلق بجودة التفسيرات الذاتية (تكون أحيانًا أسوأ من النماذج الأصغر ذات الدقة الكاملة) ولكنها تظهر متانة أكبر في الحفاظ على أمانة التفسيرات. وعلى العكس من ذلك، تظهر النماذج الأصغر تدهورًا أكثر وضوحًا في الأمانة تحت تأثير التكميم.
لا توجد طريقة تكميم عالمية: لا توجد تقنية تكميم واحدة (GPTQ أو AWQ أو Integer) تتفوق باستمرار على غيرها في دقة المهام، وجودة التفسير، والأمانة في آن واحد. هناك مقايضة بين الحفاظ على أداء المهمة ومقاييس التفسير.
الإدراك البشري مقابل المقاييس الآلية: يرى المقيمون البشريون أن النماذج ذات الدقة الكاملة تنتج تفسيرات أكثر موثوقية وتماسكًا بشكل ملحوظ من النماذج المكممة (انخفاض يصل إلى 8.5% في التقييمات البشرية). ومن الجدير بالذكر أن تقييمات "النموذج كحكم" فشلت في رصد هذا التأثير، حيث أظهرت ارتباطات ضعيفة أو غير معنوية مع التقييمات البشرية، لا سيما بالنسبة للأمثلة المقابلة للواقع (CFEs). وهذا يشير إلى أن الأحكام الآلية قد تعتمد على السمات السطحية (مثل الطلاقة والطول) بدلاً من إشارات الجودة الدقيقة التي يكتشفها البشر.
الحساسية التفاضلية: تظهر التفسيرات باللغة الطبيعية (NLEs) حساسية أكبر للتكميم مقارنة بالأمثلة المقابلة للواقع (CFEs). وبينما تظل صلاحية الأمثلة المقابلة للواقع (LFR) مستقرة نسبيًا، فإن طلاقة وتشابه النصوص في هذه الأمثلة تتدهور بشكل أكثر وضوحًا، خاصة في النماذج الأصغر.
الأهمية والادعاءات خلصت الورقة إلى أنه بينما يؤدي التكميم إلى تدهور ملموس في جودة وأمانة التفسيرات الذاتية، فإن هذه الانخفاضات عامةً تعتبر متوسطة ولا تبطل استخدام التكميم كاستراتيجية فعالة لضغط النماذج. ومع ذلك، يؤكد المؤلفون أن التأثير يعتمد على السياق. وبالنسبة للتطبيقات عالية الخطورة حيث تكون موثوقية التفسير أمرًا بالغ الأهمية، يُنصح الممارسون بعدم افتراض حل "واحد يناسب الجميع". بدلاً من ذلك، يُنصح بالتحقق تجريبيًا من جودة التفسيرات الذاتية وأمانتها لحالات الاستخدام وتكوينات النماذج الخاصة بهم قبل النشر. كما تسلط الدراسة الضوء على قصور حرج في ممارسات التقييم الآلي الحالية: فقد تكون مقاييس "النموذج كحكم" غير كافية لتقييم الفروق الدقيقة في جودة التفسير الناتجة عن التكميم، مما يستوجب التقييم البشري في السيناريوهات التي تتطلب شفافية عالية.