← أحدث الأبحاث
💬 NLP

Temperature Fragility and the Conditional Benefits of Truncation Sampling

تُظهر هذه الورقة أن تقنيات أخذ العينات بالبتر مثل top-p وmin-p تعمل أساساً على تحسين دقة النماذج اللغوية الكبيرة عند درجات الحرارة العالية حيث يتدهور الأداء بشكل كبير، ولا تقدم أي فائدة مقارنة بأخذ عينات درجة الحرارة القياسية عند درجات الحرارة الافتراضية المنخفضة المستخدمة عادةً في الأنظمة المنشورة.

المؤلفون الأصليون: Francesco La Rosa

نُشر 2026-09-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Francesco La Rosa

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تُعد نماذج اللغات الكبيرة هي المحركات الكامنة وراء أدوات توليد النصوص التي أصبحت جزءاً من الحياة اليومية. وعندما تكتب هذه النماذج جملة ما، فهي لا تسترجع ببساطة إجابة ثابتة؛ بل تتنبأ بالكلمة التالية، أو "الرمز" (token)، من خلال موازنة قائمة هائلة من الاحتمالات. وفي كل خطوة، يخصص النموذج احتمالية لكل كلمة في مفرداته، ويقوم برنامج حاسوبي باختيار واحدة من تلك القائمة لمواصلة النص. ويتحكم إعداد يُسمى "درجة الحرارة" (temperature) في مدى عشوائية هذا الاختيار. فدرجة الحرارة المنخفضة تجعل النموذج يلتزم بالكلمات الأكثر وضوحاً وأرجحية، مما يحافظ على المخرجات آمنة ويمكن التنبؤ بها. أما درجة الحرارة المرتفعة فتجعل عملية الاختيار أكثر انتشاراً، مما يسمح للنموذج بالاختيار من "الذيل الطويل" للكلمات غير المرجحة. وهذا يمكن أن يجعل النص أكثر إبداعاً أو تنوعاً، ولكنه يخاطر أيضاً بجذب النموذج نحو كلمات لا يثق بها، حيث تكون تخميناته هي الأقل موثوقية.

لسنوات عديدة، استخدم المطورون شبكة أمان تسمى "أخذ العينات بالبتر" (truncation sampling) لإدارة هذه المخاطر. وتعمل هذه الأساليب، مثل "top-p" أو "min-p"، كمرشح يستبعد الكلمات الأقل احتمالاً قبل أن يقوم النموذج باختياره. والفكرة هي أنه من خلال قطع أسفل القائمة، يمكن للنموذج العمل بدرجة حرارة أعلى دون أن يفقد مساره. وقد أشارت دراسات سابقة إلى أن هذه المرشحات قدمت مكاسب كبيرة في الدقة، لكنها اختبرت هذه الأفكار عند درجات حرارة عالية لا تستخدمها معظم الأنظمة في الواقع. وقد ترك هذا فجوة في فهمنا: هل تساعد هذه المرشحات حقاً النماذج التي نستخدمها يومياً، أم أنها مفيدة فقط عندما تُدفع درجات الحرارة إلى أقصى حدودها؟

قام باحث من جامعة إدنبرة بسد هذه الفجوة عبر اختبار ثلاثة عشر نموذجاً مختلفاً من المصادر المفتوحة في مهمتين قياسيتين للاستنتاج. وقد مرر النماذج عبر مسار عمل واحد محكوم لضمان أن كل نتيجة تعود إلى طريقة فك التشفير نفسها، وليس بسبب الاختلافات في البرمجيات أو الأسئلة. واختبر النماذج عند درجات حرارة 0.7 و1.0 و1.3، وهي تغطي النطاق الذي تعمل فيه معظم الأنظمة المنشورة. ووجد الباحث أن الأمر يعتمد كلياً على النموذج المحدد المستخدم. واكتشف أن بعض النماذج هشة، بمعنى أن أداءها ينهار عندما ترتفع درجة الحرارة ولو قليلاً فوق المستوى الافتراضي، بينما نماذج أخرى قوية وتحافظ على ثباتها.

وكشفت الدراسة أن ستة من أصل ثلاثة عشر نموذجاً تم اختبارها عانت من انخفاض حاد في الدقة عندما انتقلت درجة الحرارة من 0.7 إلى 1.3. وفي أحد الاختبارات الصعبة، فقدت هذه النماذج الهشة ما بين 17 و38 نقطة مئوية من الدقة. وتتبع الباحث هذا الفقدان وصولاً إلى نوع محدد من الفشل: لم تكن النماذج تعطي إجابات خاطئة فحسب، بل توقفت عن تقديم الإجابات تماماً. فبدلاً من إنهاء الفكرة، كان النص يستمر في التدفق حتى يصطدم بحد أقصٍ للطول، أو يتحلل إلى هراء لا يستطيع برنامج التقييم قراءته. أما النماذج السبعة الأخرى التي تم اختبارها فلم تعانِ من هذا المصير؛ فقد حافظت على دقتها عبر نفس نطاق درجات الحرارة، وفقدت 10 نقاط كحد أقصى، أو لم تفقد شيئاً على الإطلاق.

هذا التمييز غيّر كل شيء فيما يتعلق بقيمة مرشحات البتر. فبالنسبة للنماذج القوية، لم توفر المرشحات أي فائدة. فعند درجات الحرارة القياسية المستخدمة في الممارسة العملية، لم يؤدِ تطبيق المرشح إلى تحسين الدقة مقارنة بأخذ عينات درجة الحرارة البسيطة. وقد قاس الباحث ذلك بدقة ووجد أن أي مكسب محتمل كان صغيراً جداً لدرجة يمكن اعتبارها ضئيلة. ومع ذلك، بالنسبة للنماذج الهشة، كانت المرشحات بمثابة طوق نجاة. فعندما ارتفعت درجة الحرارة إلى 1.3، نجح كل مرشح بتر تم اختباره في استعادة الدقة المفقودة، مما أعاد النماذج إلى مستويات أدائها الأصلية تقريباً. وقد عملت المرشحات عن طريق منع النماذج من التيه في ذيل الكلمات غير المرجحة التي تسببت في الانهيار.

ووجد الباحث أيضاً أن النقطة التي ينهار عندها النموذج ليست ثابتة؛ إذ يمكن تغييرها من خلال كيفية تدريب النموذج بعد إنشائه الأولي. فأحد النماذج التي كانت نسخة مختلفة من نموذج أساسي هش فقد نصف الدقة التي فقدها نموذج الأصل فقط، مما يشير إلى أن عملية التدريب تلعب دوراً رئيسياً في الاستقرار. علاوة على ذلك، أظهرت الدراسة أن هذه النماذج الهشة تنهار في النهاية حتى عند درجات الحرارة الأعلى، ولكن المرشحات يمكنها تأخير هذا الفشل، مما يحافظ على تماسك النموذج في درجات حرارة تصل إلى 2.0.

وتشير النتائج إلى أن الفوائد المسجلة لأخذ عينات البتر حقيقية، لكنها مشروطة. فهذه الأدوات لا تحسن النماذج بشكل عالمي؛ بل تعمل أساساً على إنقاذ النماذج التي تعاني بالفعل مع درجات الحرارة المرتفعة. وبالنسبة لغالبية النماذج المختبرة، التي ظلت مستقرة عند الإعدادات القياسية، لم تقدم المرشحات أي ميزة. وهذا يعني أنه بالنسبة للممارسين الذين يعملون على مهام ذات إجابات واضحة وقابلة للتحقق، فإن اختيار النموذج أكثر أهمية من اختيار أداة أخذ العينات. فإذا كان النموذج قوياً عند درجة الحرارة المستهدفة، فإن إضافة مرشح لن يغير شيئاً. وإذا كان النموذج هشاً، يمكن للمرشح استعادة الخسارة، لكن السبب الجذري هو حساسية النموذج لدرجة الحرارة، وليس خللاً في طريقة أخذ العينات نفسها. وتخلص الدراسة إلى أنه عند درجات الحرارة التي تستخدمها الأنظمة فعلياً، يحدد اختيار النموذج الدقة، وأن مرشحات البتر هي علاج لمشكلة تعاني منها بعض النماذج فقط.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →