High Accuracy, Less Talk (HALT): Reliable LLMs through Capability-Aligned Finetuning
تقدم الورقة البحثية HALT، وهي طريقة ضبط دقيق متوافقة مع القدرات تعمل على تحسين موثوقية النماذج اللغوية الكبيرة من خلال تدريب النماذج على الامتناع عن توليد المحتوى غير المؤكد، مما يزيد بشكل كبير من الصحة الواقعية عبر مجالات متنوعة مع الحفاظ على توازن قابل للضبط مع اكتمال الاستجابة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك طالباً نابغاً ولكن مفرط الحماس يُدعى أليكس. أليكس ذكي للغاية وقد قرأ كل كتاب تقريباً في المكتبة. ومع ذلك، لدى أليكس عيب واحد كبير: أليكس لا يعترف أبداً عندما لا يعرف شيئاً ما.
إذا سألت أليكس: "من كان الرئيس الخامس والأربعين للولايات المتحدة؟"، سيقول أليكس: "باراك أوباما!" (إجابة صحيحة).
لكن إذا سألت: "ما هو اسم الهامستر الذي كان حيوان أوباما الأليف في طفولته؟"، لا يقول أليكس "لا أعرف"، بل يخترع اسماً مثل "مستر ويسكرز" ويخبرك به بكل ثقة. في عالم الذكاء الاصطناعي، يُسمى هذا الهلوسة (Hallucination).
في المواقف عالية الخطورة مثل الطب أو القانون، يكون اختلاق الحقائق أمراً خطيراً. أنت تفضل أن يقول الطبيب: "لست متأكداً، دعنا نتحقق"، على أن يعطيك وصفة طبية خاطئة بكل ثقة.
هذه هي المشكلة التي تحاول ورقة بحثية بعنوان HALT (دقة عالية، كلام أقل) حلها.
الفكرة الجوهرية: "كلام أقل، حقيقة أكثر"
يقترح الباحثون طريقة جديدة لتدريب نماذج الذكاء الاصطناعي. فبدلاً من إجبار الذكاء الاصطناعي على الإجابة على كل سؤال، يعلمونه التوقف عن الكلام عندما لا يكون واثقاً بنسبة 100%.
فكر في الأمر كأنه صمام أمان. إذا كان الذكاء الاصطناعي غير متأكد، فهو لا يخمن؛ بل يقول: "غير متأكد من هنا".
كيف يعمل HALT؟ (استعارة "المحرر")
لتعليم الذكاء الاصطناعي هذا السلوك الجديد، لم يكتفِ الباحثون بإعطائه المزيد من الكتب ليقرأها، بل عملوا كـ محرر صارم لبيانات تدريب الذكاء الاصطناعي. إليك العملية:
- المسودة: أولاً، نطلب من الذكاء الاصطناعي كتابة إجابة لسؤال ما (مثل مسألة رياضية أو سيرة ذاتية).
- التدقيق في الحقائق: نقوم بتفكيك تلك الإجابة إلى جمل أو خطوات صغيرة ومنفصلة (أجزاء).
- اختبار الحقيقة: نستخدم "كاشف حقيقة" فائق الذكاء (ذكاء اصطناعي آخر) للتحقق من كل جزء مقابل الحقيقة الأصلية.
- الجزء أ: "ولد أوباما في هاواي." -> صحيح.
- الجزء ب: "كان لدى أوباما كلب يدعى بو." -> صحيح.
- الجزء ج: "كلب أوباما كان من نوع جولدن ريتريفر." -> خطأ (كان من نوع جيرمن شيبرد).
- القص: هنا تكمن المعجزة.
- إذا كانت الإجابة عبارة عن قائمة من الحقائق المستقلة (مثل سيرة ذاتية)، فإن المحرر يقص الجملة الخاطئة. الإجابة النهائية تحتوي فقط على الحقائق الصحيحة.
- إذا كانت الإجابة عبارة عن سلسلة من المنطق (مثل مسألة رياضية)، وارتكب الذكاء الاصطناعي خطأ في الخطوة 3، فإن المحرر يقطع كل شيء من الخطوة 3 فصاعداً ويستبدله بعبارة "غير متأكد من هنا".
يتم بعد ذلك تدريب الذكاء الاصطناعي على هذه الإجابات "المحررة". إنه يتعلم: "مهلاً، عندما لا أكون متأكداً، يجب أن أتوقف وأقول 'غير متأكد' بدلاً من اختلاق أشياء".
المقايضة: الاكتمال مقابل الصحة
تقدم الورقة البحثية "مفتاحاً" يمكن للمستخدم تدويره. هذا هو عتبة الثقة (Confidence Threshold).
- تدوير المفتاح نحو "المتحمس": يحاول الذكاء الاصطناعي الإجابة على قدر أكبر من السؤال. قد يخطئ في بعض الحقائق، لكنه يعطيك إجابة أطول. (اكتمل عالٍ، وصحة منخفضة).
- تدوير المفتاح نحو "المحافظ": يتحدث الذكاء الاصطناعي فقط عندما يكون متأكداً تماماً. قد يتوقف في منتصف مسألة رياضية، لكن كل ما قاله هو حقيقي بنسبة 100%. (اكتمل منخفض، وصحة عالية).
فكر في الأمر مثل توقعات الطقس:
- الذكاء الاصطناعي القياسي: "سوف تمطر، وتثلج، وتتساقط البرد، وربما إعصار!" (يحاول تغطية جميع الاحتمالات، لكنه غالباً ما يكون مخطئاً).
- ذكاء HALT: "سوف تمطر. لست متأكداً بشأن الإعصار." (يتوقع فقط ما يعرفه يقيناً).
النتائج: نموذج فائق الموثوقية
اختبر الباحثون هذا في أربعة مجالات صعبة: السير الذاتية، الرياضيات، البرمجة، والطب.
أخذوا نموذجاً قوياً (Llama3-70B) ودربوه باستخدام HALT.
- التدريب القياسي: حصل النموذج على حوالي 51% من الحقائق بشكل صحيح. كان واثقاً ولكنه كان مخطئاً في كثير من الأحيان.
- تدريب HALT: حصل النموذج على 87% من الحقائق بشكل صحيح.
ما هي الضريبة؟ قدم النموذج إجابات أقصر. لقد اعترف بالجهل في كثير من الأحيان. ولكن بالنسبة لطبيب أو محامٍ أو مبرمج، فإن دقة بنسبة 87% مع عدم وجود أكاذيب أفضل بكما لا نهاية له من دقة بنسبة 51% مع أكاذيب واثقة.
لماذا يهم هذا؟
معظم أبحاث الذكاء الاصطناعي تحاول جعل النماذج "أذكى" لتعرف حقائق أكثر. أما HALT فيتبع نهجاً مختلفاً: إنه يجعل النموذج أكثر صدقاً بشأن ما لا يعرفه.
الأمر يشبه تعليم طالب أنه من المقبول أن يرفع يده ويقول: "لا أعرف الإجابة على الجزء الأخير من هذا السؤال"، بدلاً من التخمين والحصول على درجة سيئة في الاختبار بالكامل.
باختالصر: يعلم HALT الذكاء الاصطناعي أن يكون خبيراً موثوقاً يعرف حدوده، بدلاً من أن يكون كاذباً واثقاً يخترع الأشياء. إنه يستبدل "كثرة الكلام" بـ "قول الحقيقة".
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.