Popular but Wrong: Understanding and Mitigating LLM Overconfidence through Knowledge Popularity
تكشف هذه الورقة أن النماذج اللغوية الكبيرة تظهر ثقة مفرطة في الإجابات غير الصحيحة عندما تكون تلك الإجابات شائعة للغاية أو تتكرر كثيراً مع الاستعلام، وتوضح أن دمج إشارات شعبية المعرفة يقلل بفعالية من هذه الثقة المفرطة مع تحسين دقة تقدير الثقة بشكل كبير.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في هدوء طنين مزارع الخوادم، برز نوع جديد من الذكاء، ذكاء يمكنه كتابة الشعر، وحل المعادلات، والإجابة على الأسئلة بطلاقة تبدو بشرية تقريبًا. لقد تم تدريب هذه النماذج اللغوية الكبيرة على محيطات شاسعة من النصوص، حيث تعلمت التنبؤ بالكلمة التالية في الجملة من خلال التعرف على الأنماط في المعرفة البشرية. ولكن هناك عقبة: هذه الآلات لا "تعرف" الحقائق حقًا بالطريقة التي نعرفها نحن؛ فهي لا تملك ذاكرة عن العالم، بل تملك فقط إدراكًا إحصائيًا للكلمات التي تظهر عادةً معًا. وعندما تكون غير متأكدة، غالبًا ما لا تعترف بذلك، بل تنتج بدلاً من ذلك إجابات خاطئة بيقين تام، وهي ظاهرة يسميها الباحثون "الثقة المفرطة". ويمثل هذا مشكلة حرجة لأي شخص يعتمد على هذه الأدوات في مجالات السلامة أو الطب أو التمويل، لأن الكذبة الواثقة أخطر بكثير من الحقيقة المترددة. وكان السؤال الجوهري للعلماء هو لماذا تثق هذه النماذج في أخطائها بهذا العمق؟ هل هو خلل عشوائي، أم أن هناك نمطًا خفيًا في كيفية تعلمها يجعلهها متيقنة من الأشياء الخاطئة؟
شرع فريق من الباحثين في التحقيق في هذا الغموض من خلال النظر في مفهوم "الشعبية". وتساءلوا عما إذا كانت النماذج تفضل ببساطة الإجابات الشهيرة أو التي تُرى كثيرًا في بيانات التدريب الخاصة بها، حتى عندما تكون تلك الإجابات خاطئة بالنسبة للسؤال المطروح تحديدًا. ولاختبار ذلك، ركزوا على نوع معين من المهام: الأسئلة الواقعية حول كيانات من العالم الحقيقي، مثل السؤال عن مخرج فيلم معين أو مكان ولادة لاعب كرة سلة. وجمعوا آلافًا من هذه الأسئلة وقارنوا الإجابات الصحيحة بالإجابات الخاطئة التي أنتجتها النماذج. وقاسوا "شعبية" الأشخاص والأماكن المعنية من خلال عدّ عدد الروابط التي تشير إليهم على الإنترنت ومدى ظهورهم معًا في الوثائق المكتوبة. سمح هذا النهج لهم برؤية ما إذا كانت النماذج تنجذب نحو الأسماء الأكثر شهرة بدلاً من الأسما الصحيحة.
اكتشف الباحثون أنه عندما ترتكب هذه النماذج أخطاءً، فإن أخطاءها ليست عشوائية على الإطلاق. فبدلاً من تخمين أسماء غامضة أو غير مرجحة، تميل النماذج إلى اختلاق إجابات أكثر شعبية من الحقائق الصحيحة. فعلى سبيل المثال، إذا كان النموذج لا يعرف مخرج فيلم غير معروف، فمن المرجح أن يذكر بثقة مخرجًا مشهورًا رآه مرات عديدة من قبل، بدلاً من اسم عشوائي مجهول. علاوة على ذلك، غالبًا ما تختار النماذج إجابات تظهر بشكل متكرر في نفس الجمل التي تحتوي على السؤال، حتى لو كان هذا الارتباط غير صحيح. فقد يجيب النموذج على سؤال حول مخرج فيلم بتسمية المنتج، لمجرد أن هذين الدورين يُذكران معًا كثيرًا في المقالات. ووجدت الدراسة أن هذه البدائل الشعبية والخاطئة ليست شائعة فحسب، بل هي أيضًا التي يثق بها النموذج أكثر من غيرها. وحتى عندما تكون الإجابة غير صحيحة، يمنح النموذج مستوى أعلى من الثقة للاستجابة الشعبية ذات الطابع المألوف مقارنة باستجابة أقل شهرة وصحيحة.
ينطبق هذا النمط على أنواع مختلفة من الأسئلة وأحجام مختلفة من النماذج، مما يشير إلى خلل جوهري في كيفية معالجة هذه الأنظمة للمعرفة. ووجد الباحثون أنه كلما تكررت معلومة ما في بيانات التدريب، زاد احتمال توليدها من قبل النموذج وزادت ثقته بها، بغض النظر عما إذا كانت هي الإجابة الصحيحة للاستعلام المحدد. وهذا يخلق حلقة مفرغة خطيرة حيث تُعامل الإجابة الخاطئة الأكثر شهرة على أنها الحقيقة الأكثر احتمالاً. وتبرز الدراسة أن الفجوات الكبيرة في المعرفة المتخصصة ترتبط بتوليد أكثر انحيازًا للشعبية، مما يعني أنه عندما تعرف النماذج أقل عن موضوع معين، فإنها تكون أكثر عرضة للاعتماد على الارتباطات المألوفة والخاطئة. وتكشف النتائج عن وجود ارتباطات نظامية قوية بين الشعبية والثقة المفرطة، رغم أن الباحثين أشاروا إلى أن هذه الارتباطات هي علاقات ارتباطية وليست سببية، مما يعني أنها تظهر رابطًا واضحًا دون إثبات أن الشعبية وحدها هي التي تسبب التنبؤات ذات الثقة المفرطة.
ولمعالجة ذلك، طور الباحثون طريقة لمساعدة النماذج على إدراك متى قد تكون ثقتها في غير محلها. فقد أنشأوا نظامًا ينظر في شعبية الإجابة والعلاقة بين السؤال والإجابة قبل قبول درجة ثقة النموذج. ومن خلال مراعاة مدى شعبية الإجابة ومدى ظهورها مع السؤال، يمكن للنظام تعديل ثقة النموذج نزولاً عندما يكون متأكداً جداً من إجابة شعبية ولكنها خاطئة على الأرجح. وعندما اختبروا هذا النهج على ستة نماذج مختلفة، كانت النتائج مذهلة؛ فقد انخفض متوسط الثقة التي وضعتها النماذج على إجاباتها الخاطئة بشكل كبير، من 0.765 إلى 0.254. وفي الوقت نفسه، تحسنت دقة ثقة النموذج بشكل ملحوظ، مما يعني أن النموذج أصبح أفضل بكثير في معرفة متى يكون على صواب ومتى يكون على خطأ.
تخلص الدراسة إلى أن الشعبية هي محرك رئيسي للثقة المفرطة في الذكاء الاصطناعي. فالنماذج لا تقوم بمجرد التخمين، بل تتبع مسار المقاومة الأقل نحو الأسماء والارتباطات الأكثر ألفة. ومن خلال فهم هذا الانحياز، يمكن بناء ضمانات أفضل تمنع هذه الأنظمة من الظهور بمظهر السلطة المعرفية عندما تكون مخطئة في الواقع. وأشار الباحثون إلى أنه بينما ركز عملهم على الأسئلة الواقعية حول كيانات محددة، فإن المبدأ يمتد على الأرجح إلى مجالات أخرى قد تفضل فيها النماذج الأنماط الشائعة على الحقائق المحددة. كما أقروا بأن مقاييسهم للشعبية استندت إلى بيانات الإنترنت العامة، والتي تعمل كبديل لما رآه النماذج أثناء التدريب، وأن العلاقة التي وجدوها هي ارتباط قوي وليس علاقة سبب ونتيجة مثبتة. ومع ذلك، فإن القدرة على استخدام إشارات الشعبية هذه لتهدئة الثقة المفرطة للآلة تقدم خطوة عملية نحو جعل هذه الأدوات القوية أكثر موثوقية وجدارة بالثقة للاستخدام اليومي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.