← أحدث الأبحاث
🤖 AI

Entropy Distribution as a Fingerprint for Hallucinations in Generative Models

تقدم هذه الورقة "درجة الإنتروبيا المعايرة" (CES)، وهي طريقة "الصندوق الأسود" خفيفة الوزن وذات تمريرة واحدة، تستفيد من توزيعات الإنتروبيا على مستوى الرمز (token) للكشف عن الهلوسة في النماذج اللغوية الكبيرة (LLMs) مع ضمانات خطأ رسمية وأداء يضاهي الأساليب المكلفة حاسوبيًا والقائمة على عينات متعددة.

المؤلفون الأصليون: Mattia J. Villani, Pranav Deshpande, Akshay Seshadri, Romina Yalovetzky, Niraj Kumar

نُشر 2026-05-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mattia J. Villani, Pranav Deshpande, Akshay Seshadri, Romina Yalovetzky, Niraj Kumar

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تستمع إلى راوٍ للقصص. أحياناً، يروي قصة حقيقية تماماً وتنساب بشكل طبيعي. وفي أحيان أخرى، يبدأ في "الهلوسة" — فيختلق حقائق، أو يرتبك، أو يهذي بطريقة لا معنى لها.

لفترة طويلة، كان على الحواسيب التي تحاول كشف هذه الأكاذيب أن تفعل أحد أمرين: إما أن تطلب من الراوي إعادة القصة خمس أو ست مرات لترى ما إذا كانت التفاصيل متطابقة (وهو أمر بطيء ومكلف)، أو أن تطل على ما يدور داخل عقل الراوي لترى ملاحظاته السرية (وهو أمر مستحيل غالباً مع الأنظمة المغلقة).

يقدم هذا البحث طريقة ذكية وجديدة لكشف الكاذب تتطلب فقط الاستماع إلى القصة مرة واحدة. تُسمى هذه الطريقة درجة الإنتروبيا المعايرة (Calibrated Entropy Score - CES).

إليك كيف تعمل، باستخدام تشبيهات بسيطة:

1. "مقياس الثقة" (الإنتروبيا)

في كل مرة يكتب فيها نموذج لغوي كبير (LLM) كلمة، يكون لديه "مقياس ثقة" لما سيأتي بعدها.

  • ثقة عالية: النموذج يعرف تماماً ما يجب قوله. الأمر يشبه طباخاً يعرف الوصفة بدقة. هنا تكون "الإنتروبيا" (مقياس عدم اليقين) منخفضة.
  • ثقة منخفضة: النموذج يخمن. الأمر يشبه طباخاً يحدق في ثلاجة فارغة، غير متأكد مما سيطبخه. هنا تكون "الإنتروبيا" عالية.

2. الطريقة القديمة مقابل الطريقة الجديدة

الطريقة القديمة (الارتباك - Perplexity):
كانت الطرق السابقة تنظر إلى متوسط الثقة للقصة بأكملها.

  • تشبيه: تخيل طالباً يؤدي اختباراً. الطريقة القديمة تنظر فقط إلى متوسط درجاته. إذا كان متوسطه 70%، فقد يعتبر ناجحاً. لكن هذا يخفي الحقيقة: هل حصل على كل الأسئلة بدرجة 70%؟ أم أنه أجاب على 10 أسئلة بامتياز (100%) و10 أسئلة بشكل خاطئ تماماً (0%)؟ المتوسط هو نفسه، لكن الطالب الثاني أكثر تذبذباً وعدم استقرار.

الطريقة الجديدة (CES):
أدرك المؤلفون أن شكل مقياس الثقة أهم من المتوسط.

  • تشبيه: عندما يروي النموذج قصة حقيقية، يكون مقياس ثقته ثابتاً ومتوقعاً. أما عندما يبدأ في الهلوسة، فإن المقياس يجن جنونه. قد يكون هادئاً لفترة، ثم فجأة يقفز إلى حالة من الارتباك التام، ثم يقفز مرة أخرى.
  • يزعم البحث أن هذا "النمط الجامح" هو بصمة الكذب. حتى لو بدا المتوسط طبيعياً، فإن القفزات (أقصى درمات عدم اليقين) والشكل العام للمنحنى يكشفان الأمر.

3. كيف تعمل CES (فحص "البصمة")

تعمل هذه الطريقة في خطوتين:

  1. تعلم نمط "الحقيقة": أولاً، يستمع النظام إلى العديد من القصص المعروف بأنها حقيقية. ويبني "خريطة مرجعية" (منحنى إحصائي) لما يبدو عليه مقياس ثقة القصة الحقيقية. ويدون ملاحظات مثل: "حسناً، القصص الحقيقية عادة ما تحتوي على نتوءات صغيرة هنا، لكن نادراً ما تحتوي على قفزات ضخمة هناك".
  2. اختبار المرة الواحدة: عندما تأتي قصة جديدة، يستمع إليها النظام مرة واحدة فقط. لا يطلب رأياً ثانياً. بل يتحقق من مقياس ثقة القصة بمقارنته بـ "خريطة الحقيقة".
    • إذا كانت القصة تحتوي على قفزة غريبة أو شكلاً لا يتوافق مع الخريطة، يقوم النظام بإرسال تنبيه: "هذا يبدو كأنه هلوسة!"

4. لماذا يعد هذا أمراً بالغ الأهمية؟

  • السرعة: يحتاج النظام فقط إلى مرور واحد عبر النص. الأمر يشبه كشف الكاذب بمجرد الاستماع إليه يتحدث مرة واحدة، بدلاً من جعله يعيد القصة خمس مرات.
  • صديق للأنظمة المغلقة (Black Box Friendly): لا تحتاج إلى رؤية الكود الداخلي للنموذج أو أفكاره الخفية. أنت فقط بحاجة إلى "اللوجيتس" (Logits) (أرقام الثقة الخام التي يخرجها النموذج قبل اختيار الكلمة)، والتي توفرها معظم واجهات برمجة التطبيقات (APIs).
  • إثبات إحصائي: لم يكتفِ المؤلفون بالتخمين بأن هذا يعمل، بل استخدموا الرياضيات لإثبات أنه كلما طالت القصة، انخفضت فرصة تفويت الكذبة لتصل إلى الصفر تقريباً، كما انخفضت فرصة اتهام قصة حقيقية بالخطأ لتصل أيضاً إلى الصفر تقريباً.

الملخص

فكر في CES كجهاز كشف كذب لا يحتاج إلى جهاز كشف الكذب (الباروغراف) أو مقابلة ثانية. إنه يستمع فقط إلى إيقاع عدم اليقين في النص. إذا كان الإيقاع ثابتاً، فالأرجح أنها حقيقة. وإذا كان الإيقاع يحتوي على قفزات عشوائية وجامحة (حتى لو بدا المتوسط طبيعياً)، فالأرجح أنها هلوسة.

اختبر البحث طريقة CES على 10 نماذج ذكاء اصطناعي مختلفة و8 أنواع من الأسئلة (من الرياضيات إلى المعلومات العامة)، ووجد أن هذه الطريقة "ذات المرور الواحد" تمسك بالأكاذب بنفس كفاءة الطرق المكلفة متعددة المرور، ولكنها أسرع بكثير وأقل تكلفة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →