← أحدث الأبحاث
🤖 AI

Quantization Amplifies Determinism, Not Bias: Scale-Dependent Behavioral Effects of Serving-Time Weight Compression

تُظهر هذه الدراسة أن تكميم الأوزان في النماذج اللغوية الكبيرة يعزز الحتمية من خلال تقليل تنوع المخرجات وزيادة التكرار الدلالي دون زيادة التحيز بالضرورة، مع تباين هذه الآثار السلوكية بشكل كبير عبر أحجام النماذج المختلفة.

المؤلفون الأصليون: Dachi Kurtskhalia

نُشر 2026-09-09✓ Author reviewed
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Dachi Kurtskhalia

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

عندما نسأل نموذج لغة كبير سؤالاً له إجابات صحيحة متعددة — مثل "اقترح علامة تجارية للسيارات لسائق في المدينة" أو "سمِّ دولة ذات ساحل شهير" — فإننا نتوقع مجموعة متنوعة من الاستجابات. هذه الأنظمة الاصطناعية مدربة على كميات هائلة من النصوص البشرية، حيث تتعلم التنبؤ بالكلمة التالية في الجملة بناءً على الأنماط التي رأتها من قبل. ولجعل هذه الأنظمة سريعة ومنخفضة التكلفة بما يكفي للعمل على أجهزة الكمبيوتر العادية، يقوم المطورون غالباً بضغط ذاكرتها الداخلية، وهي عملية تُعرف باسم "الكمّنة" (quantization). تقلل هذه التقنية من دقة الأرقام التي يستخدمها النموذج في التفكير، مضحيةً بجزء ضئيل من التفاصيل الرياضية مقابل مكسب كبير في السرعة وانخفاض التكلفة. ولسنوات، افترضت الصناعة أن هذا الضغط غير ضار للنماذج متوسطة الحجم، طالما أن النموذج لا يزال قادراً على الإجابة على الأسئلة بشكل صحيح. ومع ذلك، فقد تم اختبار هذا الافتراض في الغالب على مهام ذات إجابة واحدة صحيحة، مثل حل مسألة رياضية أو تحديد حقيقة معينة. وهذا يترك سؤالاً جوهرياً دون إجابة: عندما تكون هناك إجابات عديدة صحيحة، هل يغير ضغط النموذج من الخيارات التي يختار تقديمها؟

لقد شرع باحث في استقصاء هذا السؤال تحديداً عبر معاملة النموذج ليس كطالب اختبار، بل كمُوصٍ (recommender). وركز على ثلاثة أحجام مختلفة من عائلة نماذج ذكاء اصطناعي شهيرة، حيث قام بتشغيل كل منها عند ثلاثة مستويات مختلفة من ضغط الذاكرة: إعداد قياسي عالي الدقة، وإعداد مضغوط بشكل متوسط، وإعداد مضغوط بشكل عالٍ. ولضمان مقارنة عادلة، أبقى كل العوامل الأخرى متطابقة، باستخدام نفس الأجهزة، ونفس محرك البرمجيات، وحتى نفس البذور العشوائية (random seeds) لتوليد الاستجابات. طرح على النماذج آلاف الأسئلة حول العلامات التجارية للسيارات والدول، وهي سيناريوهات لا توجد فيها إجابة واحدة صحيحة، ثم حلل بعناية تنوع الاستجابات. كان هدفه هو معرفة ما إذا كانت النماذج المضغوطة ترتكب مجرد أخطاء، أم أنها تغير بشكل جوهري نطاق الاحتمالات التي ترغب في تقديمها.

كشفت النتائج عن انقسام مفاجئ في السلوك يعتمد كلياً على حجم النموذج. فبالنسبة لأصغر نموذج تم اختباره، تسبب الضغط العالي في انهيار ملحوظ في التنوع. فعندما طُلب منه اقتراح علامات تجارية للسيارات، توقف هذا النموذج المضغوط عن تقديم مزيج من الخيارات وبدأ في التركيز على خيار واحد. وفي سيناريو محدد، اقترح النموذج القياسي أربع علامات تجارية مختلفة عبر عشرين محاولة، بينما اقترح الإصدار المضغوط نفس العلامة التجارية بالضبط في جميع المحاولات العشرين. لم يعني هذا أن النموذج كان منحازاً لعلامة تجارية معينة بطريقة ضارة؛ بل يعني أنه بالنسبة لأي سؤال معطى، أصبح النموذج أكثر عرضة لتكرار نفس الإجابة التي اختارها بالفعل، مما أدى فعلياً إلى إغلاق الخيارات الصالحة الأخرى. وجد الباحث أن النموذج المضغوط لم يكن يضخم الصور النمطية أو يفضل جنسيات معينة؛ بل كان ببساطة يصبح أكثر حتمية (deterministic)، مما يقلص مجموعة الاقتراحات إلى مسار واحد متكرر.

وبينما نظر الباحث إلى النماذج الأكبر حجماً، تغيرت القصة. فالنماذج متوسطة الحجم والكبيرة لم تعانِ من هذا الفقد في تنوع إجاباتها؛ إذ استمرت في التوصية بمجموعة متنوعة من العلامات التجارية للسيارات والدول، تماماً كما تفعل النسخ القياسية غير المضغوطة. ومع ذلك، أظهرت هذه النماذج الأكبر حجماً تحولاً طفيفاً في طريقة حديثها؛ حيث بدأت تستخدم علامات الترقيم، وتحديداً الشرطة الطويلة (em-dash)، بشكل متكرر أكثر من نظيراتها غير المضغوطة. يشير هذا إلى أنه بينما احتفظت النماذج الأكبر القدرة على التفكير في أفكار مختلفة، إلا أن الضغط غير من نسيج كتابتها، مما جعلها تبدو مختلفة قليلاً حتى لو ظل المحتوى غنياً ومتنوعاً.

تقدم الآلية الكامنة وراء هذه التغييرات نظرة أعمق في كيفية عمل هذه النماذج. ففي أصغر نموذج، جعل الضغط خطوات عملية التفكير الفردية أكثر فوضوية وأقل قابلية للتنبؤ، ومع ذلك، أصبحت النتيجة النهائية أكثر جموداً. الأمر كما لو أن النموذج أصبح أكثر عدم يقين بشأن الكلمات المحددة التي يختارها في كل لحظة، لكن هذا الارتباك أدى للمفارقة إلى التقارب نحو نفس الإجابة النهائية في كل مرة. لاحظ الباحث أنه بينما زاد عدم اليقين الداخلي للنموذج، تناقص التنوع الفعلي للاقتراحات النهائية. يتحدى هذا الاكتشاف فكرة أن الضغط يجعل النموذج "أغبى" فحسب؛ بل يوضح أن الضغط يمكن أن يخلق نوعاً معيناً من الفشل حيث يفقد النموذج قدرته على استكشاف مسارات مختلفة صالحة، حتى بينما يبدو أنه يعمل بشكل طبيعي.

خلصت الدراسة إلى أن المخاطر بالنسبة للنماذج الأصغر والمضغوطة المستخدمة في تطبيقات العالم الحقيقي مثل خدمة العملاء أو توصيات المنتجات، لا تكمن بالضرورة في كونها منحازة أو مسيئة، بل في كونها قد تصبح ضيقة جداً في اقتراحاتها. فقد تتوقف عن عرض النطاق الكامل للمنتجات المتاحة للعملاء، مما يحد من تعرضهم لخيارات مختلفة. ويقترح الباحث أنه عند تدقيق هذه الأنظمة، يجب علينا النظر إلى ما وراء الدقة البسيطة والتحقق من هذا النوع من التركيز. فإذا كان من المفترض للنموذج أن يقدم خيارات، فيجب أن يكون قادراً على تقديم مجموعة متنوعة منها. إن الضغط الذي يجعل هذه الأنظمة ميسورة التكلفة قد يعمل، في أصغر النماذج، على تجريدها بهدوء من التنوع ذاته الذي يجعلها مفيدة، محولاً إياها من مساعد نافع إلى مساعد مكرر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →