ScaleCal: Scale-Aware Confidence Calibration for Small Language Models
يُعد ScaleCal إطار عمل لا يتطلب تدريباً يعالج تدهور إشارات الثقة في النماذج اللغوية الصغيرة من خلال الجمع بين الإشارات القائمة على "اللوجيت" (logit) والمعايرة حرارياً مع أخذ عينات الاتساق الدلالي الانتقائي، مما يحسن بشكل كبير من خطأ المعايرة وكشف الفشل مع الحفاظ على تكاليف حوسبة منخفضة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الذكاء الاصطناائي، ظهر جيل جديد من النماذج المدمجة، المصممة للعمل على الأجهزة اليومية مثل الهواتف الذكية وأجهزة الكمبيوتر المحمول بدلاً من مراكز البيانات الضخمة والمستهلكة للطاقة. هذه النماذج اللغوية الصغيرة قوية بما يكفي للإجابة على الأسئلة، وحل المسائل الرياضية، وكتابة النصوص، لكنها تواجه عائقاً حرجاً: فهي غالباً لا تعرف متى تكون مخطئة. وبخلاف نظيراتها الأكبر حجماً، التي يمكن أحياناً دعمها بأنظمة أكبر، تعمل هذه النماذج الصغيرة بمفردها. وإذا أخطأ نموذج صغير بثقة، فقد يضلل المستخدم تماماً كما قد يفعل خبير بشري، ولكن مع خطر إضافي وهو أن المستخدم ليس لديه وسيلة لمعرفة أن الإجابة ليست سوى تخمين. ولجعل هذه الأدوات آمنة للاستخدام في العالم الحقيقي، يحتاج الباحثون إلى طريقة لقياس مدى يقين النموذج، والأهم من ذلك، طريقة لإخبار النموذج بأن يقول "لا أعرف" عندما يكون غير متأكد.
يكمن التحدي في كيفية تعبير هذه النماذج عن ثقتها. فالطرق القياسية للتحقق مما إذا كانت الإجابة جيدة غالباً ما تفشل عندما يكون النموذج صغيراً. وتتضمن إحدى التقنيات الشائعة النظر في مدى احتمالية اعتبار النموذج لكلماته الخاصة، ولكن في النماذج الأصغر، تصبح هذه الإشارة غير موثوقة، حيث تبدو واثقة جداً حتى عندما تكون الإجابة بلا معنى. وهناك طريقة أخرى تتضمن طلب توليد الإجابة نفسها عدة مرات من النموذج لمعرفة ما إذا كانت ستظل متسقة، ولكن هذا عادة ما يكون بطيئاً ومكلفاً للتشغيل على الأجهزة الصغيرة. وكان السؤال الجوهري للعلماء هو ما إذا كانت هناك طريقة للحصول على موثوقية الطريقة البطيئة والمكلفة دون دفع التكلفة الكاملة، وتحديداً لهذه النماذج الصغيرة والفعالة.
لقد طور أحد الباحثين حلاً يسمى (ScaleCal)، وهي طريقة تسمح للنماذج اللغوية الصغيرة بمعرفة متى تتوقف وتفكر بعمق أكبر. يعتمد هذا النهج على ملاحظة بسيطة حول المقايضة بين السرعة والدقة. وجد الباحث أنه بالنسبة للنماذج الصغيرة جداً، فإن الطريقة السريعة والرخيصة للتحقق من الثقة تكون معطلة؛ فهي مليئة بالضجيج لدرجة لا يمكن الوثوق بها. ومع ذلك، فإن الطريقة الأكثر تكلفة للتحقق — وهي طلب توليد الإجابة عدة مرات من النموذج ورؤية ما إذا كانت النتائج تتفق — تظل موثوقة، ومن المثير للدهشة أنها في الواقع ميسورة التكلفة لهذه النماذج الصغيرة لأنها سريعة جداً في الأصل. يعمل (ScaleCal) كحارس بوابة ذكي؛ فهو يطلب أولاً من النموذج إجابة سريعة ودرجة ثقة سريعة. إذا كانت الدرجة عالية، يقبل النظام الإجابة فوراً. أما إذا كانت الدرجة منخفضة، مما يشير إلى عدم اليقين، فيقوم النظام بتفعيل خطوة ثانية حيث يقوم النموذج بتوليد الإجابة عدة مرات أخرى للتحقق من الاتساق. تضمن هذه العملية ذات الخطوتين أن النظام لا يدفع التكلفة الإضافية إلا عند الضرورة القصوى.
اختبر الباحث هذه الطة عبر ثمانية نماذج لغوية صغيرة مختلفة، تتراوح من النماذج المتناهية الصغر بـ 0.5 مليار معلمة إلى النماذج الأكبر بـ 7 مليارات معلمة، باستخدام أربعة أنواع مختلفة من الاختبارات المعيارية بما في ذلك المعرفة العامة، والرياضيات، واختبارات الصدق. واكتشفوا أنه بدون هذه الطريقة الجديدة، كانت النماذج الصغيرة مفرطة في الثقة بشكل خطير. فعند سؤالها عن تقييم يقينها، كان النموذج الصغير جداً غالباً ما يدعي أنه متأكد بنسبة 95% من إجابة كانت خاطئة في الواقع بنسبة 45% من الوقت. وقد أصل النظام الجديد خطأ المعايرة هذا بنسبة تقارب النصف لأصغر النماذج. والأهم من ذلك، فقد حسن بشكل كبير قدرة النظام على اكتشاف إخفاقاته. ففي الاختبارات التي كان الهدف منها ببساطة رصد الإجابة الخاطئة، رفع النهج الجديد معدل الكشف من مجرد تخمين عشوائي إلى درجة عالية من الموثوقية، مما سمح للنموذج بالامتناع عن الإجابة عندما يكون من المرجح أن يكون غير صحيح.
كانت كفاءة الطريقة نتيجة رئيسية. ونظراً لأن النماذج الصغيرة سريعة جداً، فإن التكلفة الإضافية لتوليد إجابات متعددة لم تحدث إلا لجزء ضئيل من الأسئلة. وفي المتوسط، استخدم النظام ما يعادل حوالي ثلاث ونصف تمريرات عبر النموذج لكل سؤال، وهو جزء ضئيل من تكلفة تشغيل نموذج واحد أكبر وأكثر قوة لمرة واحدة فقط. وبالنسبة لأصغر النماذج التي تم اختبارها، جعل هذا النهج هذه النماذج أرخص بنحو أربع مرات من حيث قدرة الحوسبة مقارنة بتشغيل تمريرة واحدة لنموذج واحد كبير يبلغ 7 مليارات معلمة، مع تحقيق مستوى مماثل من الموثوقية في معرفة متى يتوقف. ووجد الباحث أنه كلما زاد حجم النماذج، قلت الحاجة إلى هذا الفحص الإضافي، وهو أمر منطقي لأن النماذج الأكبر تكون بطبيعتها أفضل في تقدير ثقتها الخاصة.
يوفر هذا العمل مساراً عملياً لنشر الذكاء الاصطناعي على الأجهزة الشخصية. فمن خلال الجمع بين فحص سريع وفحص أكثر شمولاً ومستهدفاً عند الحاجة فقط، يمنح هذا النهج النماذج الصغيرة آلية سلامة كانت مفقودة سابقاً. وقد أكد الباحث أن نهجه يعمل دون الحاجة إلى إعادة تدريب النماذج أو إضافة مكونات برمجية إضافية؛ فهو ببساطة يعدل كيفية تفسير مخرجات النموذج الحالية ومتى يُطلب منه المحاولة مرة أخرى. والنتيجة هي نظام ليس دقيقاً فحسب، بل هو صادق أيضاً بشأن حدوده، وقادر على التراجع والاعتراف بعدم اليقين بدلاً من تقديم إجابة خاطئة بثقة. وهذا التوازن بين السرعة والتكلفة والموثوقية يشير إلى أنه يمكن الوثوق بالنماذج اللغوية الصغيرة للمهام الحرجة على الأجهزة الطرفية، بشرما توفر لها وسيلة لمعرفة متى يجب عليها التمهل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.