Token Probability Beats Verbalized Condence for Error Detection in Small Open-Weight Language Models: A Medical and Psychiatric Benchmark Study
تُظهر هذه الدراسة الاستطلاعية أنه بالنسبة للنماذج اللغوية صغيرة الحجم ذات الأوزان المفتوحة (1.2 إلى 9.2 مليار معلمة) والمطبقة على المهام الطبية والنفسية، فإن استخراج احتمالات الرموز الداخلية يعد طريقة أكثر موثوقية بشكل ملحوظ لاكتشاف الأخطاء من الاعتماد على ثقة النماذج المُعبر عنها لفظياً، ولا سيما بالنسبة لأصغر النماحماً حيث يكون أداء الثقة اللفظية عند مستويات المصادفة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الذكاء الاصطناعي، هناك رغبة متزايدة في استخدام برامج حاسوبية قوية لمساعدة الأطباء والأطباء النفسيين في اتخاذ القرارات الصعبة. هذه البرامج، المعروفة باسم النماذج اللغوية الكبيرة، يمكنها قراءة كميات هائلة من الأدبيات الطبية والإجابة على أسئلة معقدة حول صحة الإنسان. ومع ذلك، تظل هناك مشكلة حرجة: كيف يعرف الطبيب متى يثق في الحاسوب؟ إذا قال الجهاز إن التشخيص مؤكد، ولكنه في الواقع خاطئ، فقد تكون العواقب وخيمة. لسنوات، حاول الباحثون حل هذه المشكلة من خلال مطالبة الحاسوب ببساطة بإخباره بمدى تأكده. إنهم يطلبون من النموذج إرفاق درجة مئوية بإجابته، وهو تقرير لفظي عن الثقة. كان الأمل هو أنه إذا قال الحاسوب إنه متأكد بنسبة خمسين بالمائة فقط، فيمكن للإنسان أن يتدخل ويراجع العمل. لكن الدراسات الحديثة أظهرت أن هذه الدرجات المبلغ عنها ذاتياً غالباً ما تكون غير موثوقة، وأحياناً لا تزيد دقتها عن التخمين العشوائي.
هذا الشك أمر ملح بشكل خاص بالنسبة للنسخ الأصغر والأرخص من هذه البرامج الحاسوبية التي يمكن تشغيلها على جهاز حاسوب مكتبي واحد بدلاً من مراكز بيانات ضخمة ومكلفة. هذه النماذج الأصغر هي الأكثر عرضة للاستخدام في العيادات الخاصة حيث يجب أن تظل بيانات المرضى آمنة وتكون التكاليف منخفضة. يبحث دراسة جديدة أجراها كونال داندا في المعهد الهندي للتكنولوجيا في خاراجبور فيما إذا كان يمكن الوثوق بهذه النماذح الأصغر في رصد أخطائها الخاصة. تقارن الدراسة بين طريقتين لقياس اليقين. الأولى هي الثقة اللفظية، حيث يُطلب من النموذج قول مدى تأكده. الثانية هي إشارة خفية تسمى "احتمالية الرمز" (token probability). لفهم هذا، تخيل أن الحاسوب يكتب إجابة كلمة بكلمة. عند كل خطوة، يحسب الاحتمالية الرياضية لاختيار الحرف أو الكلمة المحددة التالية. احتمالية الرمز هي ببساطة الحساب الداخلي للحاسوب لمدى احتمالية اختياره للإجابة الدقيقة التي اختارها في النهاية. تسأل هذه الدراسة سؤالاً مباشراً: هل هذا الحساب الرياضي الخفي مؤشر أفضل على الحقيقة من كلمات النموذج المنطوقة؟
اختبر الباحثون أربعة نماذج حاسوبية صغيرة مختلفة، تتراوح أحجامها من المدمجة جداً إلى القوية متوسطاً. استخدموا هذه النماذج للإجابة على 1600 سؤال طبي ونفسي مستمد من اختبارات معيارية. وبالنسبة لكل سؤال، سجل الفريق كلاً من درجة الثقة المنطوقة واحتمالية الرمز الداخلية. ثم تحققوا من الإجابات مقابل الحلول الصحيحة لمعرفة أي إشارة كانت أفضل في التنبؤ بالأخطاء. كانت النتائج واضية ومتسقة عبر جميع النماذج الأربعة. في كل حالة، كانت احتمالية الرمز الداخلية مؤشراً أفضل بكثير على ما إذا كانت الإجابة صحيحة أم خاطئة من درجة الثقة اللفظية. ولم يكن الفرق بسيطاً؛ فبالنسبة لأصغر نموذج، كانت الإشارة الداخلية أكثر دقة بشكل ملحوظ، بينما كانت الثقة المنطوقة سيئة للغاية لدرجة أنها لا يمكن تمييزها عن رمية عملة معدنية.
نظرت الدراسة أيضاً في كيفية عمل هذه الإشارات في نظام سلامة في العالم الحقيقي، حيث قد يقرر الطبيب تجاهل إجابة الحاسوب إذا كانت درجة الثقة منخفضة جداً. عندما استخدم الباحثون احتمالية الرمز لتصفية أكثر الإجابات عدم يقين، تحسنت دقة الإجابات المتبقية تدريجياً لجميع النماذج الأربعة. ومع ذلك، عندما استخدموا درجات الثقة اللفظية لتصفية الإجابات، كانت النتال مسطحة أو حتى ضارة. بالنسبة لأصغر نموذج، جعل الاعتماد على الثقة المنطوقة النظام أقل دقة، لأن النموذج كان مخطئاً بثقة بنفس قدر كونه مصيباً بثقة. يساعد هذا الاكتشاف في تفسير سلوك غريب لوحظ في تجارب سابقة حيث كان أصغر نموذج يؤدي بشكل أسوأ عندما طُلب منه الاعتراف بأنه لا يعرف الإجابة. اقترح الباحثون أن النموذج لم يكن في الواقع "يعرف" أنه غير متأكد؛ بل كان ببساطة يبلغ درجة ثقة لا تحمل أي معلومات حقيقية، بينما ظلت الإشارة المفيدة مخفية داخل حساباته.
إن الآثار المترتبة على هذا العمل عملية وفورية لأي شخص يقوم بنشر هذه الأدوات في بيئة طبية. إذا كان بإمكان نظام حاسوبي محلي الكشف عن درجات احتماليته الداخلية، فيجب استخدام تلك البيانات لتقرير أي الإجابات تحتاج إلى مراجعة بشرية. إن الاعتماد على حديث النموذج عن ثقته ليس فقط أقل فعالية؛ بل بالنسبة لأصغر النماذج، فإنه يخلق شعوراً زائفاً بالأمان. وتخلص الدراسة إلى أنه بينما قد تكون الثقة اللفظية مقبولة لبعض النماذج الأكبر والأكثر تقدماً، إلا أنها أداة خطيرة للأنظمة الأصغر التي تركز على الخصوصية والتي أصبحت شائعة في العيادات. إن الطريقة الأكثر موثوقية لاكتشاف الأخطاء في هذه الأنظمة هي النظر في الأرقام التي يحسبها الحاسوب بالفعل ولكن لا ينطق بها أبداً. يوفر هذا النهج مساراً حقيقياً لأنظمة ذكاء اصطناعي طبية أكثر أماناً ودقة دون الحاجة إلى أجهزة باهظة الثمن أو برمجيات معقدة جديدة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.