"very likely" Means "uncertain"? How LLMs Diverge from Humans in Linguistic Uncertainty Quantification
تتقصى هذه الورقة التباين بين البشر والنماذج اللغوية الكبيرة في التقدير اللفظي لعدم اليقين من خلال تقديم خوارزمية قائمة على الأمثلة، METHODNAME، والتي تتعلم خرائط الاحتمالات المثلى للمؤشرات اللفظية مباشرة من مخرجات النموذج للكشف عن التفاوتات المنهجية في الثقة دون الاعتماد على أخذ العينات المتكررة.
عندما نتحدث، غالباً ما نتحوط في كلامنا؛ فنقول إن أمراً ما "محتمل" أو "ممكن" أو "شبه مؤكد"، مستخدمين هذه الكلمات للإشارة إلى مدى معرفتنا الحقيقية. إن القدرة على التعبير عن الشك هي شكل من أشكال "ما وراء المعرفة" (metacognition)، وهي عملية فحص ذهني حيث ندرك حدود معرفتنا الخاصة. وهذا جزء حيوي من التواصل البشري، إذ يسمح لنا بالتنقل عبر حالات عدم اليقين دون التظاهر بامتلاك إجابات لا نملكها. وفي عالم الذكاء الاصطناوي، وتحديداً في النماذج اللغوية الكبيرة، أصبحت هذه القدرة ذاتها ميزة أمان بالغة الأهمية. فهذه النماذج قد تولد أحياناً معلومات تبدو واثقة ولكنها غير صحيحة واقعياً، وهي ظاهرة تُعرف باسم "الهلوسة". ولكي نثق في هذه الأنظمة، خاصة في المجالات الحساسة مثل الطب أو القانون، نحتاج إلى معرفة متى تكون غير متأكدة. ويكمكم التحدي في معرفة ما إذا كانت الكلمات التي يستخدمها الذكاء الاصطناعي للتعبير عن الشك تعني للمستمع البشري نفس المعنى الذي تعنيه للآلة نفسها.
لقد شرع فريق من الباحثين في استقصاء ما إذا كان التعبير اللفظي عن عدم اليقين لدى النماذج اللغوية الكبيرة يتوافق مع الفهم البشري. بدأوا بجمع مجموعة ضخمة من كيفية تفسير البشر لعبارات مثل "محتمل جداً" أو "غير مؤكد". ومن خلال الاستناد إلى عقود من الأبحاث في علم النفس وعلوم اتخاذ القرار، قاموا بتجميع دليل مرجعي يربط هذه العبارات الشائعة باحتمالات عددية محددة. فعلى سبيل المثال، في العقل البري، تقابل عبارة "محتمل جداً" درجة عالية من الثقة، بينما تقع كلمة "ممكن" في مكان ما في المنتصف. ثم اختبر الباحثون عدة نماذج لغوية متقدمة، بطلب الإجابة على أسئلة وشرح درجة ثقتهم باستخدام هذه العبارات الطبيعية ذاتها. وقارنوا إجابات النماذج بالدليل المرجعي البشري لمعرفة ما إذا كانت الآلات تتحدث اللغة ذاتها التي يستخدمها مستخدموها.
وكشفت النتلائج عن انفصال كبير؛ فبينما تستطيع النماذج استخدام هذه الكلمات، إلا أنها تخصص مستويات من اليقين لها تختلف عما يخص البشر. فعلى سبيل المثال، عندما يسمع الإنسان عبارة "محتمل جداً"، فإنه يفسرها على أنها احتمالية قوية، لكن النماذج في الدراسة غالباً ما استخدمت هذه العبارة لوصف مواقف كانت فيها في الواقع غير متأكدة تماماً. وعلى العكس من ذلك، قد تعبر النماذج عن درجة عالية من الثقة لعبارات يعتبرها البشر مجرد تخمينات. هذا التباين يعني أن مجرد قراءة مخرجات النموذج والافتراض بأن إشاراته اللفظية تعكس حالته الداخلية قد يكون مضللاً. وقد أظهرت الدراسة أن الاعتماد على قاموس بشري لكلمات عدم اليقين لم يكن كافياً لتقدير ثقة الآلة بدقة؛ إذ كانت للنماذج منطقها الداخلي الخاص والمتميز لما تعنيه تلك الكلمات.
ولسد هذه الفجوة، طور الباحثون طريقة جديدة تسمى "VOCAL". وبدلاً من إجبار النماذج على الامتثال للتعريفات البشرية، تتعلم هذه الطريقة المعنى المحدد لكلمات عدم اليقين مباشرة من سلوك النموذج نفسه. يقوم النظام بتحليل آلاف الاستجابات للنموذج، ملاحظاً العبارات التي يستخدمها عندما يكون محقاً وتلك التي يستخدمها عندما يكون مخطئاً. ومن ثم يبني خريطة مخصصة تترجم العادات اللفظية المحددة للنموذج إلى درجات احتمالية دقيقة. تتضمن هذه العملية تحسيناً رياضياً يعمل على تنعيم البيانات، مما يضمن أن العبارات المتشابهة في النطق تتلقى درجات متشابهة، حتى لو استخدمها النموذج نادراً. ومن خلال تفصيل التفسير ليتناسب مع الآلة المحددة، تخلق هذه الطريقة وسيلة أكثر موثوقية للكشف عن متى يكون النموذج غير متأكد.
وقد أثبتت التجارب أن هذا النهج المخصص يعمل بشكل أفضل بكثير من محاولة فرض معيار بشري على الآلة. ففي اختبارات عبر مجموعات بيانات متنوعة، بما في ذلك مسائل رياضية معقدة وأسئلة طبية، كانت الطريقة الجديدة أكثر دقة في التنبؤ بما إذا كانت إجابة النموذج صحيحة أم خاطئة مقارنة باستخدام المرجع البشري وحده. وفي بعض الحالات، كان التحسن جوهرياً، حيث حولت طريقة بالكاد تؤدي أداءً أفضل من التخمين العشوائي إلى طريقة يمكنها رصد الأخطاء بموثوقية. ووجد الباحثون أن هذه التقنية يمكنها تحقيق مستويات أداء تضاهي الطرق الأكثر تكلفة والتي تتطلب توليد إجابات متعددة ومقارنتها، ولكن دون الحاجة إلى الوقت أو قوة الحوسبة الإضافية.
تخلص الدراسة إلى أنه على الرغم من قدرة النماذج اللغوية الكبيرة على محاكاة أنماط الكلام البشري، إلا أن فهمها الداخلي لعدم اليقين يختلف جوهرياً عن فهمنا. فعبارة مثل "محتمل جداً" لا تحمل نفس الوزن بالنسبة للآلة كما هي بالنسبة للإنسان. ولجعل هذه الأنظمة جديرة بالثقة حقاً، لا يمكننا ببساطة أن نطلب منها التحدث كالبشر ونتوقع أن تعني الشيء ذاته. بدلاً من ذلك، يجب علينا تعلم قراءة لهجتها الخاصة في التعبير عن عدم اليقين. ومن خلال إنشاء خرائط مخصصة تترجم إشاراتها اللفظية الفريدة إلى إشارات واضحة للثقة، يمكننا التمييز بشكل أفضل بين الإجابة الصحيحة والهلوسة الواثقة، مما يجعل هذه التكنولوجيا أكثر أماناً وموثوقية للاستخدام في العالم الحقيقي.
ملخص تقني: هل تعني "محتمل جداً" معنى "غير مؤكد"؟ كيف تختلف النماذج اللغوية الكبيرة عن البشر في التحديد اللغوي لعدم اليقين
بيان المشكلة
بينما حققت النماذج اللغوية الكبيرة (LLMs) نجاحاً ملحوما، لا يزال هناك تحدٍ جوهري يتمثل في تحديد متى يمكن الوثوق باستجاباتها، لا سيما فيما يتعلق بالهلوسة. تندرج طرق تقدير عدم اليقين (UQ) الحالية عموماً تحت فئتين: القائمة على أخذ العينات (مثل الإنتروبيا الدلالية، وتباين المجموعات) والقائمة على اللوجيت (مثل الإنتروبيا التنبؤية، والارتباك/Perplexity). ومع ذلك، تعاني هذه الأساليب من قيود كبيرة: فالطرق القائمة على أخذ العينات مكلفة حاسوبياً وتتسبب في تأخير الاستجابة (latency)، بينما تعاني الطرق القائمة على اللوجيت غالباً من الحساسية المعجمية وتفشل في استيعاب دقة التفكير البشري.
يعبر البشر بشكل طبيعي عن عدم اليقين باستخدام علامات لفظية (مثل "ممكن"، "محتمل"، "شبه مؤكد"). وبينما استكشفت الأبحاث الحديثة التقدير اللفظي لعدم اليقين، توجد فجوة حرجة: النماذج اللغوية الكبيرة تختلف عن البشر في كيفية تفسير واستخدام هذه العلامات اللغوية. تعتمد الطرق الحالية غالباً على جداول بحث مستمدة من أدبيات علم النفس لربط العبارات اللفظية بالاحتمالات العددية. ويفترض المؤلفون أن هذه الربوط المستمدة من البشر لا تعكس بدقة حالات عدم اليقين الداخلية للنماذج اللغوية الكبيرة، مما يؤدي إلى تقدير غير موثوق.
المنهجية
1. المرجع اللفظي لعدم اليقين البشري (UM-Lookup)
قام المؤلفون أولاً ببناء جدول بحث لعلامات عدم اليقين اللفظية (UM-Lookup) واسع النطاق. يجمع هذا المورد بيانات من دراسات تأسيسية في علم النفس وعلوم اتخاذ القرار (مثل Lichtenstein & Newman, 1967؛ Beyth-Marom, 1982؛ Vogel et al., 2022).
البناء: يربط الجدول بين 115 تعبيراً لفظياً مختلفاً لعدم اليقين ودرجات احتمالية عددية بناءً على متوسط 336 تقييماً بشرياً لكل عبارة.
التجميع: عندما تولد النماذج اللغوية الكبيرة استجابة تحتوي على علامات متعددة، تقوم الطريقة (المشار إليها بـ QVU−H) بحساب متوسط الدرجات العددية للعلامات المستخرجة لإنتاج تقدير نهائي لعدم اليقين.
التقييم الأولي: قيم المؤلفون QVU−H مقابل المعايسات القياسية (الإنتروبيا التنبؤية، الإنتروبيا الدلالية) عبر نماذج مختلفة (GPT-4o, DeepSeek-V3.1) ومجموعات بيانات (GSM8K, MedQA, SciQ). وبينما أظهرت QVU−H أداءً غير ضئيل في بعض الحالات، إلا أنها كثيراً ما كان أداؤها أقل مقارنة بالطرق القائمة على أخذ العينات، وفي بعض الحالات (مثل GPT-4o على GSM8K)، كان أداؤها أسوأ من الصدفة العشوائية. وقد أكد ذلك وجود عدم توافق جوهري بين الحدس اللغوي البشري والثقة الداخلية للنماذج اللغوية الكبيرة.
2. خوارزمية VOCAL: التقدير الأمثل لعدم اليقين اللفظي
لمعالجة عدم التوافق هذا، يقترح المؤلفون VOCAL، وهي خوارزمية مبتكرة قائمة على التحسين تتعلم ربطاً خاصاً بكل نموذج لغوي كبير بين العلامات اللفظية ومستويات عدم اليقين العددية.
الهدف: تتعلم VOCAL مجموعة من الدرجات العددية (ci) لكل علامة لفظية (ui) بحيث يعكس درجة عدم اليقين المجمعة (qy) بدقة مدى صحة النموذج الفعلية. الهدف هو تخصيص درجات عدم يقين أعلى للتوليدات غير الصحيحة ودرجات أقل للصحيحة.
صياغة التحسين: تتم صياغة المشكلة كتقليل لخسارة الإنتروبيا التقاطعية الثنائية (BCE): L(c)=cminE(x,y)[−zlogcy−(1−z)log(1−cy)] حيث z هو مؤشر الصحة (1 للصحيح، 0 للخطأ)، و cy هو عدم اليقين المجمع المستمد من الدرجات المتعلمة للعلامات في التوليد y.
التنعيم الدلالي: للتعامل مع ندرة البيانات (حيث توجد أمثلة تدريب قليلة للعلامات النادرة مثل "فرصة ضئيلة")، تتضمن VOCAL منظم لابلاسيان الرسم البياني (Graph Laplacian Regularizer). يعمل هذا المنظم على فرض التنعيم من خلال معاقبة الاختلافات الكبيرة بين العلامات المتشابهة دلالياً (المقاسة بتشابه Jaccard لـ 3-grams). ويصبح الهدف الإجمالي هو L(c)+γLlap(c).
الكفاءة: على عكس الطرق القائمة على أخذ العينات، تتطلب VOCAL استجابة واحدة فقط من النموذج لتوليد درجة عدم اليقين، مما يتجنب العبء الحسابي لتوليد عينات متعددة.
المساهمات الرئيسية
جدول البحث لعدم اليقين اللفظي البشري: يقدم البحث مورداً منسقاً لـ 115 علامة لفظية مرتبطة باحتمالات عددية، مستندة إلى الأدبيات النفسية. يعمل هذا كمقياس أساسي لتحليل التباين بين البشر والنماذج اللغوية الكبيرة في المراقبة وراء المعرفية (metacognitive monitoring).
خوارزمية VOCAL: يقدم المؤلفون VOCAL، وهي طريقة خفيفة الوزن قائمة على التحسين، تعمل على تخصيص خرائط عدم اليقين اللفظي لنماذج لغوية محددة دون الحاجة إلى تحديثات للمعلمات أو ضبط دقيق (fine-tuning). فهي تتعلم كتلة الاحتمال المثلى التي يجب أن تنقلها كل علامة بناءً على الصحة التجريبية.
التحليل التجريبي الشامل: تقدم الدراسة تحليلاً متعمقاً لكيفية اختلاف النماذج اللغوية الكبيرة عن البشر. على سبيل المثال، يوضح البحث أنه بينما يقيم البشر "محتمل جداً" بأنها ثقة عالية (0.85)، فإن GPT-4o يربطها بثقة أقل بكثير (0.35) في حالته الداخلية.
النتائج
التفوق على البحث البشري: تتفوق VOCAL باستمرار على البحث البشري QVU−H. في مجموعة بيانات GSM8K، حسنت VOCAL قيمة AUROC لنموذج GPT-4o من 0.41 (باستخدام البحث البشري) إلى حوالي 0.60.
المقارنة مع أسس العينة الواحدة: تتفوق VOCAL بشكل كبير على طرق تقدير عدم اليقين ذات العينة الواحدة مثل G-NLL وPerplexity (PPL). في 5 من أصل 6 إعدادات تم تقييمها، حققت VOCAL أعلى قيمة AUROC. على سبيل المثال، في GSM-Hard مع DeepSeek-V3.1، حققت VOCAL قيمة AUROC بلغت 0.715، مقارنة بـ 0.520 لـ G-NLL.
التنافسية مع أساليب العينات المتعددة: رغم استخدامها استجابة واحدة فقط، تحقق VOCA أداءً يضاهي الأساليب متعددة العينات المكلفة (مثل Semantic Entropy وSemantic Density). في عدة حالات (مثل SciQ مع Qwen2.5-72B)، حققت VOCAL أعلى AUROC (0.717)، متفوقة على الأسس القائمة على أخذ العينات.
المعايرة: تُظهر VOCAL خصائص معايرة قوية. فعند دمجها مع طرق المعايرة اللاحقة مثل الانحدار المتساوي (Isotonic Regression - IR)، حققت متوسط خطأ معايرة متوقع (ECE) قدره 0.0281، متفوقة على غيرها من الأسس.
القابلية للنقل: تُظهر التجارب أنه بينما تعتبر مؤشرات عدم اليقين اللفظية قابلة للنقل إلى حد كبير بين النماذج اللغوية المختلفة (حيث تظل AUROC في نطاق 0.60–0.72 عند التدريب على نموذج واختباره على آخر)، فإن الضبط الخاص بكل نموذج عبر VOCAL يعطي نتائج فائقة.
الأهمية والادعاءات
يزعم البحث أن التعبيرات اللفظية لعدم اليقين تعتمد على النموذج، وأن الاعتماد على جداول ثابتة محددة بشرياً غير كافٍ لتقدير موثوق لعدم اليقين في النماذج اللغوية الكبيرة. تكمن أهمية هذا العمل في:
سد الفجوة بين الإنسان والنموذج اللغوي: يكشف البحث أن "محتمل جداً" لا تعني الشيء نفسه للنموذج اللغوي كما هو الحال للإنسان، مما يسلط الضوء على انفصال حرج في آليات الثقة الحالية.
الكفاءة والعملية: توفر VOCAL مقايضة قوية بين الدقة والكفاءة. فهي توفر تمييزاً لعدم اليقين يقارب أحدث المستويات دون التأخير والتكلفة المرتبطين بمسارات الاتساق الدلالي متعددة العينات، مما يجعلها أكثر عملية للنشر في العالم الحقيقي.
الرؤية وراء المعرفية: تشير النتائج إلى أنه بينما يمكن للنماذج اللغوية الكبيرة التعبير عن عدم اليقين لفظياً، فإن ربطها الداخلي لهذه التعبيرات بمستويات الثقة يختلف عن الإدراك البشري. توفر VOCAL آلية لمواءمة هذه التعبيرات مع موثوقية النموذج الفعلية، مما يدعم تفاعلات أكثر ثقة مع الذكاء الاصطناعي.
يخلص المؤلفون إلى أن جعل عدم اليقين في النماذج اللغوية الكبيرة مرتكزاً على التعبيرات اللفظية، عند معايرته بشكل صحيح للنموذج المحدد، يوفر مساراً قابلاً للتطبيق نحو ذكاء اصطناعي توليدي أكثر موثوقية ومسؤولية.