← أحدث الأبحاث
🤖 machine learning

"very likely" Means "uncertain"? How LLMs Diverge from Humans in Linguistic Uncertainty Quantification

تتقصى هذه الورقة التباين بين البشر والنماذج اللغوية الكبيرة في التقدير اللفظي لعدم اليقين من خلال تقديم خوارزمية قائمة على الأمثلة، METHODNAME، والتي تتعلم خرائط الاحتمالات المثلى للمؤشرات اللفظية مباشرة من مخرجات النموذج للكشف عن التفاوتات المنهجية في الثقة دون الاعتماد على أخذ العينات المتكررة.

المؤلفون الأصليون: Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, Tianlong Chen

نُشر 2026-10-02
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, Tianlong Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

عندما نتحدث، غالباً ما نتحوط في كلامنا؛ فنقول إن أمراً ما "محتمل" أو "ممكن" أو "شبه مؤكد"، مستخدمين هذه الكلمات للإشارة إلى مدى معرفتنا الحقيقية. إن القدرة على التعبير عن الشك هي شكل من أشكال "ما وراء المعرفة" (metacognition)، وهي عملية فحص ذهني حيث ندرك حدود معرفتنا الخاصة. وهذا جزء حيوي من التواصل البشري، إذ يسمح لنا بالتنقل عبر حالات عدم اليقين دون التظاهر بامتلاك إجابات لا نملكها. وفي عالم الذكاء الاصطناوي، وتحديداً في النماذج اللغوية الكبيرة، أصبحت هذه القدرة ذاتها ميزة أمان بالغة الأهمية. فهذه النماذج قد تولد أحياناً معلومات تبدو واثقة ولكنها غير صحيحة واقعياً، وهي ظاهرة تُعرف باسم "الهلوسة". ولكي نثق في هذه الأنظمة، خاصة في المجالات الحساسة مثل الطب أو القانون، نحتاج إلى معرفة متى تكون غير متأكدة. ويكمكم التحدي في معرفة ما إذا كانت الكلمات التي يستخدمها الذكاء الاصطناعي للتعبير عن الشك تعني للمستمع البشري نفس المعنى الذي تعنيه للآلة نفسها.

لقد شرع فريق من الباحثين في استقصاء ما إذا كان التعبير اللفظي عن عدم اليقين لدى النماذج اللغوية الكبيرة يتوافق مع الفهم البشري. بدأوا بجمع مجموعة ضخمة من كيفية تفسير البشر لعبارات مثل "محتمل جداً" أو "غير مؤكد". ومن خلال الاستناد إلى عقود من الأبحاث في علم النفس وعلوم اتخاذ القرار، قاموا بتجميع دليل مرجعي يربط هذه العبارات الشائعة باحتمالات عددية محددة. فعلى سبيل المثال، في العقل البري، تقابل عبارة "محتمل جداً" درجة عالية من الثقة، بينما تقع كلمة "ممكن" في مكان ما في المنتصف. ثم اختبر الباحثون عدة نماذج لغوية متقدمة، بطلب الإجابة على أسئلة وشرح درجة ثقتهم باستخدام هذه العبارات الطبيعية ذاتها. وقارنوا إجابات النماذج بالدليل المرجعي البشري لمعرفة ما إذا كانت الآلات تتحدث اللغة ذاتها التي يستخدمها مستخدموها.

وكشفت النتلائج عن انفصال كبير؛ فبينما تستطيع النماذج استخدام هذه الكلمات، إلا أنها تخصص مستويات من اليقين لها تختلف عما يخص البشر. فعلى سبيل المثال، عندما يسمع الإنسان عبارة "محتمل جداً"، فإنه يفسرها على أنها احتمالية قوية، لكن النماذج في الدراسة غالباً ما استخدمت هذه العبارة لوصف مواقف كانت فيها في الواقع غير متأكدة تماماً. وعلى العكس من ذلك، قد تعبر النماذج عن درجة عالية من الثقة لعبارات يعتبرها البشر مجرد تخمينات. هذا التباين يعني أن مجرد قراءة مخرجات النموذج والافتراض بأن إشاراته اللفظية تعكس حالته الداخلية قد يكون مضللاً. وقد أظهرت الدراسة أن الاعتماد على قاموس بشري لكلمات عدم اليقين لم يكن كافياً لتقدير ثقة الآلة بدقة؛ إذ كانت للنماذج منطقها الداخلي الخاص والمتميز لما تعنيه تلك الكلمات.

ولسد هذه الفجوة، طور الباحثون طريقة جديدة تسمى "VOCAL". وبدلاً من إجبار النماذج على الامتثال للتعريفات البشرية، تتعلم هذه الطريقة المعنى المحدد لكلمات عدم اليقين مباشرة من سلوك النموذج نفسه. يقوم النظام بتحليل آلاف الاستجابات للنموذج، ملاحظاً العبارات التي يستخدمها عندما يكون محقاً وتلك التي يستخدمها عندما يكون مخطئاً. ومن ثم يبني خريطة مخصصة تترجم العادات اللفظية المحددة للنموذج إلى درجات احتمالية دقيقة. تتضمن هذه العملية تحسيناً رياضياً يعمل على تنعيم البيانات، مما يضمن أن العبارات المتشابهة في النطق تتلقى درجات متشابهة، حتى لو استخدمها النموذج نادراً. ومن خلال تفصيل التفسير ليتناسب مع الآلة المحددة، تخلق هذه الطريقة وسيلة أكثر موثوقية للكشف عن متى يكون النموذج غير متأكد.

وقد أثبتت التجارب أن هذا النهج المخصص يعمل بشكل أفضل بكثير من محاولة فرض معيار بشري على الآلة. ففي اختبارات عبر مجموعات بيانات متنوعة، بما في ذلك مسائل رياضية معقدة وأسئلة طبية، كانت الطريقة الجديدة أكثر دقة في التنبؤ بما إذا كانت إجابة النموذج صحيحة أم خاطئة مقارنة باستخدام المرجع البشري وحده. وفي بعض الحالات، كان التحسن جوهرياً، حيث حولت طريقة بالكاد تؤدي أداءً أفضل من التخمين العشوائي إلى طريقة يمكنها رصد الأخطاء بموثوقية. ووجد الباحثون أن هذه التقنية يمكنها تحقيق مستويات أداء تضاهي الطرق الأكثر تكلفة والتي تتطلب توليد إجابات متعددة ومقارنتها، ولكن دون الحاجة إلى الوقت أو قوة الحوسبة الإضافية.

تخلص الدراسة إلى أنه على الرغم من قدرة النماذج اللغوية الكبيرة على محاكاة أنماط الكلام البشري، إلا أن فهمها الداخلي لعدم اليقين يختلف جوهرياً عن فهمنا. فعبارة مثل "محتمل جداً" لا تحمل نفس الوزن بالنسبة للآلة كما هي بالنسبة للإنسان. ولجعل هذه الأنظمة جديرة بالثقة حقاً، لا يمكننا ببساطة أن نطلب منها التحدث كالبشر ونتوقع أن تعني الشيء ذاته. بدلاً من ذلك، يجب علينا تعلم قراءة لهجتها الخاصة في التعبير عن عدم اليقين. ومن خلال إنشاء خرائط مخصصة تترجم إشاراتها اللفظية الفريدة إلى إشارات واضحة للثقة، يمكننا التمييز بشكل أفضل بين الإجابة الصحيحة والهلوسة الواثقة، مما يجعل هذه التكنولوجيا أكثر أماناً وموثوقية للاستخدام في العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →