← أحدث الأبحاث
💻 computer science

On Verbalized Confidence Scores for LLMs

تتقصى هذه الورقة مدى موثوقية النماذج اللغوية الكبيرة في التعبير عن عدم يقينها من خلال درجات الثقة، حيث تُظهر أنه بينما يتباين التأثير باختلاف استراتيجية التلقين، يمكن لأساليب محددة أن تحقق تقديراً لمعايير عدم اليقين يكون معايرًا جيدًا ومستقلاً عن النموذج مع تكلفة إضافية منخفضة.

المؤلفون الأصليون: Daniel Yang, Yao-Hung Hubert Tsai, Makoto Yamada

نُشر 2026-05-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Daniel Yang, Yao-Hung Hubert Tsai, Makoto Yamada

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تطلب نصيحة من صديق ذكي ومطلع للغاية. أحياناً يكون متأكداً تماماً من إجابته، وأحياناً أخرى يكون مجرد تخمين. المشكلة في نماذج اللغات الكبيرة (LLMs) الحالية هي أنها غالباً ما تبدو واثقة حتى عندما تكون مخطئة. إنهم يشبهون الصديق الذي لا يقول أبداً "لست متأكداً"، حتى عندما لا يملك أدنى فكرة عما يتحدث عنه.

هذه الورقة البحثية، "حول درجات الثقة اللفظية لنماذج اللغات الكبيرة"، تبحث في فكرة بسيطة: ماذا لو طلبنا من الذكاء الاصطناعي ببساطة أن يخبرنا بمدى تأكده؟

بدلاً من النظر في الكود الداخلي للذكاء الاصطناعي أو تشغيله مئة مرة لمعرفة ما إذا كان سيعطي نفس الإجابة، طلب الباحثون ببساء من الذكاء الاصطناعي إضافة "درجة ثقة" إلى استجابته، مثل قول: "الإجابة هي X، وأنا متأكد بنسبة 85%".

إليك تفصيل لنتائجهم باستخدام تشبيهات من الحياة اليومية:

1. الهدف: "مقياس الثقة"

أراد الباحثون معرفة ما إذا كان "مقياس الثقة" هذا (درجة الثقة) يعمل حقاً. لقد أرادوا نظاماً:

  • يكون صادقاً: إذا قال الذكاء الاصطناعي إنه متأكد بنسبة 90%، فيجب أن يكون محقاً بنسبة 90% من الوقت.
  • يكون مرناً: يجب أن يعمل بغض النظر عن السؤال الذي تطرحه أو نموذج الذكاء الاصطناعي الذي تستخدمه.
  • يكون سريعاً: لا ينبغي أن يستغرق وقتاً إضافياً أو قوة حوسبة للحصول على الدرجة.

2. التجربة: اختبار "طرق مختلفة للسؤال"

أدرك الفريق أن كيفية سؤال الذكاء الاصطناعي أمر بالغ الأهمية. الأمر يشبه سؤال طفل ليخمن.

  • إذا قلت له: "ما هي عاصمة فرنسا؟ خمن!" فقد يقول فقط "باريس" ويشعر بالثقة.
  • أما إذا قلت له: "ما هي عاصمة فرنسا؟ خمن، وأخبرني مدى تأكدك على مقياس من 0 إلى 100"، فقد يفكر بعمق أكبر.

اختبر الباحثون 17 طريقة مختلفة لصياغة السؤال (التحفيزات/Prompts) عبر 11 نموذجاً مختلفاً من الذكاء الاصطناعي و 10 أنواع مختلفة من الأسئلة (مثل معلومات عامة علمية، ألغاز منطقية، ومعلومات بديهية).

3. الاكتشاف الكبير: الأمر يعتمد على "حجم دماغ" الذكاء الاصطناعي

الاكتشاف الأكثر إثارة للاهتمام هو أن أفضل طريقة للحصول على إجابة صادقة تعتمد على مدى "ذكاء" (أو ضخامة) نموذج الذكاء الاصطناعي.

  • لنماذج الذكاء الاصطناعي "الصغيرة" (المبتدئون):
    اعتبر هذه النماذج كطلاب لا يزالون في مرحلة التعلم. إذا أعطيتهم تحفيزاً معقداً وفخماً يحتوي على الكثير من الأمثلة والتعليمات، فسوف يرتبكون ويبدأون في اختلاق أشياء من وحي خيالهم.

    • ما وجدته الورقة: التحفيزات البسيطة هي الأفضل. مجرد سؤالهم ببساطة: "ما مدى تأكدك؟" يعمل بشكل أفضل من إعطائهم قائمة طويلة من القواعد.
  • لنماذج الذكاء الاصطناعي "الكبيرة" (الخبراء):
    اعتبر هؤلاء مثل خريجي الدكتوراه. لديهم الكثير من المعرفة ولكن يمكن أن يكونوا مفرطي الثقة. إذا سألتهم ببساطة، فقد يظلون يخمنون بثقة 100% حتى عندما يكونون مخطئين.

    • ما وجدته الورقة: هم يحتاجون إلى "دفعة" أكثر تعقيداً. وجد الباحثون أن الجمع بين عدة تقنيات — مثل إعطائهم بعض الأمثلة حول كيفية الإجابة، وطلب منهم شرح منطقهم، وإخبارهم صراحة بضرورة مراعاة صعوبة المهمة — جعلهم أكثر صدقاً بكثير.
    • النتيجة: مع التحفيز المعقد المناسب، استطاعت هذه النماذج الكبيرة إنتاج درجات ثقة دقيقة ضمن حوالي 7% من معدل نجاحها الفعلي. وهذا يمثل تحسناً هائلاً مقارنة بمجرد التخمين.

4. التحفيز "المدمج" (Combo Prompt)

أنشأ الباحثون "تحفيزاً خارقاً" (يسمى combo) للنماذج الكبيرة. كان الأمر يشبه إعطاء الذكاء الاصطناعي قائمة مهام:

  1. فكر في السؤال.
  2. ضع في اعتبارك مدى صعوبته.
  3. راجع معرفتك الخاصة.
  4. قدم أفضل تخمين لك.
  5. أعطِ درجة احتمالية (من 0.0 إلى 1.0).

عندما استخدموا هذا التحفيز المدمج، أصبح نماذج الذكاء الاصطناعي الكبيرة أفضل بكثير في الاعتراف بعدم تأكدهم.

5. ماذا يعني هذا (وفقاً للورقة البحثية)

تخلص الورقة إلى أن طلب "التعبير عن الثقة" من الذكاء الاصطناعي هو أداة واعدة جداً. فهي:

  • بسيطة: لا تحتاج إلى رؤية ما بداخل عقل الذكاء الاصطناعي.
  • سريعة: لا تتطلب سوى بضع كلمات إضافية لتوليدها.
  • فعالة: إذا كنت تعرف كيف تسأل السؤال الصحيح، يمكن للذكاء الاصطناعي أن يخبرك متى يخمن ومتى يعرف الإجابة.

ومع ذلك، هناك عقبة: لا يمكنك سؤال أي ذكاء اصطناعي بأي طريقة تريدها. يجب عليك تخصيص السؤال. إذا سألت ذكاءً اصطناعياً صغيراً سؤالاً معقداً، فسيفشل. وإذا سألت ذكاءً اصطناعياً كبيراً سؤالاً بسيطاً، فقد يكذب بشأن ثقته. ولكن مع "الوصفة" الصحيحة للتحفيز، يمكننا جعل هذه النماذج أكثر موثوقية.

باختصار: يمكن للذكاء الاصطناعي أن يخبرك بمدى تأكده، ولكن عليك أن تعرف كيف تسأله بالطريقة الصحيحة للحصول على إجابة صادقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →