← أحدث الأبحاث
📊 statistics

A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering

تقدم هذه الورقة Sem-ECE، وهو إطار عمل مبتكر يقيم المعايرة في الإجابة على الأسئلة مفتوحة النهايات من خلال أخذ عينات من مخرجات النموذج وتجميعها في فئات دلالية لتوفير مقياس غير منحاز وقوي يتفوق على الأساليب القائمة على التعبير اللفظي وأساليب أخذ العينات الحالية، لا سيما عندما لا تتوفر احتمالات النموذج الداخلية.

المؤلفون الأصليون: Zhanliang Wang, Jiancong Xiao, Ruochen Jin, Shu Yang, Bojian Hou, Li Shen

نُشر 2026-05-12
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Zhanliang Wang, Jiancong Xiao, Ruochen Jin, Shu Yang, Bojian Hou, Li Shen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف فريقاً من الخبراء للإجابة على أسئلة ثقافية صعبة. لا تريد معرفة ماذا يجيبون فحسب، بل تريد أيضاً معرفة مدى تأكدهم من إجاباتهم. إذا قال الخبير: "أنا متأكد بنسبة 90% أن العاصمة هي باريس"، فأنت تريد أن تعرف ما إذا كان محقاً في 90% من المرات بالفعل. هذا التوافق بين الثقة والدقة يسمى المعايرة (Calibration).

في عالم الذكاء الاصطناعي (نماذج اللغات الكبيرة)، يعد هذا أمراً معقداً. فعندما يقدم النموذج إجابة قصيرة من نوع الاختيار من متعدد، يمكننا بسهء التحقق من حساباته. ولكن عندما يكتب مقالاً طويلاً أو قصة إبداعية، فإن التحقق من ثقته يشبه محاولة قياس درجة حرارة سحابة.

تقدم هذه الورقة البحثية طريقة جديدة لقياس تلك "درجة الحرارة" تسمى Sem-ECE. وإليك كيف تعمل، مقسمة إلى تشبيهات بسيطة.

المشكلة: "الطالب الواثق بزيادة"

الطرق الحالية للتحقق من ثقة الذكاء الاصطناعي معيبة:

  1. سؤال الذكاء الاصطناعي مباشرة: إذا سألت الذكاء الاصطناعي: "ما مدى ثقتك؟"، فغالباً ما يكذب أو يخمن، وعادة ما يدعي أنه أكثر تأكداً مما هو عليه في الواقع. الأمر يشبه طالباً يرفع يده ويصرخ: "أنا متأكد بنسبة 100%!" حتى وهو يخمن فقط.
  2. النظر في الكود البرمجي (Logits): أحياناً، يمكننا إلقاء نظرة داخل عقل الذكاء الاصطناعي لرؤية حساباته الداخلية. لكن معظم خدمات الذكاء الاصطناعي التجارية (مثل تلك المستخدمة من قبل الأطباء أو المحامين) لا تسمح لنا برؤية ذلك. الأمر يشبه محاولة الحكم على خدعة ساحر من خلال مراقبة يديه، لكنه يرتدي قفازات.
  3. تكرار السؤال: إذا سألت الذكاء الاصطناعي نفس السؤال 50 مرة، فقد يعطي 50 إجابة مختلفة قليلاً. إذا قالت 49 منها "باريس" وواحدة قالت "لندن"، فقد نستنتج أنه متأكد جداً من باريس. لكن الأساليب الحالية للقيام بذلك فوضوية وتعتمد على قواعد جامدة تنكسر عندما يستخدم الذكاء الاصطناعي كلمات مختلفة لقول الشيء نفسه.

الحل: إطار عمل "Sem-ECE"

يقترح المؤلفون طريقة جديدة تسمى Sem-ECE (خطأ المعايرة المتوقع للعينات الدلالية). فكر فيها كأنها لجنة تذوق.

بدلاً من سؤال الذكاء الاصطناعي مرة واحدة، تسأله 50 مرة.

  1. أخذ العينات (Sampling): تحصل على 50 إجابة مختلفة.
  2. التجميع (التجميع الدلالي - Semantic Clustering): أنت لا تكتفي بعدّ الكلمات المتطابقة تماماً، بل تستخدم حكماً ذكياً (ذكاء اصطناعي آخر) لتجميع الإجابات التي تعني الشيء نفسه.
    • مثال: "العاصمة هي باريس"، "إنها باريس"، و"باريس، فرنسا"؛ كلها توضع في نفس الفئة وهي "باريس".
  3. التكرار (Frequency): إذا انتهت 40 إجابة من أصل 50 في فئة "باريس"، فإن ثقة الذكاء الاصطناعي هي 80%.

المقدران الجديدان: "نفس العينة" مقابل "العينة المستبعدة"

تقدم الورقة طريقتين محددتين لحساب هذه الثقة، وتقارنهما بطريقتين مختلفتين لتصحيح اختبار.

1. Sem1-ECE: درجة "نفس العينة" (الحكم المنحاز)

تختار هذه الطريقة الإجابة الأكثر شيوعاً من بين الـ 50 عينة، وتستخدم نفس الـ 50 عينة لحساب الثقة.

  • العيب: هذا يشبه معلماً يصحح اختباراً باستخدام نفس الطلاب الذين خاضوا الاختبار لتحديد درجة النجاح. ولأن المعلم اختار "الفائز" من تلك المجموعة المحددة، فمن المرجح أن يبالغ في تقدير جودة ذلك الفائز. في الإحصاء، يسمى هذا "لعنة الفائز" (Winner's Curse). يبدو الذكاء الاصطناعي أكثر ثقة مما هو عليه حقاً لأنه يحكم على نفسه باستخدام نفس البيانات التي استخدمها لاختيار الإجابة.

2. Sem2-ECE: درجة "العينة المستبعدة" (الحکم العادل)

تقسم هذه الطريقة الـ 50 عينة إلى مجموعتين:

  • المجموعة أ (25 عينة): تُستخدم لاختيار الإجابة "الفائزة".
  • المجموعة ب (25 عينة): تُستخدم فقط لعدّ عدد مرات ظهور تلك الإجابة الفائزة.
  • الميزة: هذا يشبه معلماً يختار أفضل مقال من النصف الأول من الفصل الدراسي، ثم يصحح ذلك المقال المحدد باستخدام النصف الثاني من الفصل كمرجع. ولأن المجموعة (ب) لم تساعد في اختيار الفائز، فإن درجة الثقة تكون أكثر عدلاً ودقة. فهي تتجنب "لعنة الفائز".

الاكتشاف الكبير: الأسئلة السهلة مقابل الصعبة

تثبت الورقة رياضياً أن:

  • في الأسئلة السهلة: تتفق الطريقتان. فالذكاء الاصطناعي واثق جداً لدرجة أن "لعنة الفائز" لا تؤثر كثيراً.
  • في الأسئلة الصعبة: تتباعد الطريقتان. تظل طريقة "نفس العينة" (Sem1) متفائلة للغاية، بينما تقوم طريقة "العينة المستبعدة" (Sem2) بخفض درجة الثقة بشكل صحيح.
  • الفجوة كمقياس تشخيصي: تعمل الفجوة بين الدرجتين كـ مقياس للصعوبة. إذا كانت الدرجتان متباعدتين، فالسؤال صعب والذكاء الاصطناح يعاني. وإذا كانتا متقاربتين، فالسؤال سهل.

النتائج: ما الذي وجدوه؟

اختبر المؤلفون هذا على خمسة نماذج ذكاء اصطناعي رئيسية (مثل GPT-4، Claude، Gemini) عبر ثلاث مجموعات من الأسئلة الصعبة (تتراوح من الحقائق البسيطة إلى العلوم بمستوى الخبراء).

  • انتصرت Sem2-ECE: في معظم الحالات، أعطت طريقة "العينة المستبعدة" (Sem2) صورة أكثر دقة لموثوقية الذكاء الاصطناعي الحقيقية مقارنة بسؤال الذكاء الاصطناعي مباشرة أو استخدام طريقة "نفس العينة".
  • تعمل بدون "قفازات": تعمل هذه الطريقة حتى لو لم تتمكن من رؤية الحسابات الداخلية للذكاء الاصطناعي (logits). كل ما تحتاجه هو طرح الأسئلة وقراءة الإجابات.
  • تكشف الثقة المفرطة: أظهرت الدراسة أنه عندما يخطئ النماذج، فإنها غالباً ما تعتقد أنها على حق. يكشف Sem-ECE هذا من خلال إظهار أن "ثقة" الذكاء الاصطناعي (مدى تكرار الإجابة) لا تتطابق مع "دقته" الفعلية (مدى صحة تلك الإجابة).

ملخص

تخيل أنك طيار يقود طائرة. أنت بحاجة لمعرفة ما إذا كان نظام الملاحة لديك موثوقاً.

  • الطريقة القديمة: اسأل النظام: "هل أنت متأكد؟" (سيقول "نعم!" ولكنه قد يكون مخطئاً).
  • الطريقة الجديدة (Sem-ECE): اطلب من النظام رسم المسار 50 مرة. قم بتجميع المسارات المتشابهة. إذا ذهبت 40 مساراً لليسار و10 لليمين، فأنت تعلم أنه واثق بنسبة 80%. ولكن لكي تكون متأكداً حقاً، تحقق من تلك المسارات الأربعين مقابل مجموعة جديدة من 25 محاكاة جديدة (Sem2) للتأكد من أن النظام لا يخدع نفسه فحسب.

توفر هذه الورقة البحثية الأدوات اللازمة للقيام بذلك بالضبط بالنسبة للذكاء الاصطناعي، لضمان أنه عندما يقول النموذج إنه واثق، فإنه يكون كذلك بالفعل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →