← أحدث الأبحاث
💬 NLP

Detecting LLM Hallucinations via Embedding Cluster Geometry: A Three-Type Taxonomy with Measurable Signatures

تقترح هذه الورقة تصنيفاً هندسياً لـ "هلوسات" النماذج اللغوية الكبيرة إلى ثلاثة أنواع متميزة بناءً على هياكل عناقيد تضمين الرموز (token embedding cluster structures)، وتتحقق من هذا الإطار عبر 11 نموذجاً من نماذج المحولات (transformer models) باستخدام ثلاثة إحصاءات قابلة للقياس (الاقتران القطبي، وتماسك العنقود، وتدرج المعلومات الشعاعي) لتحديد ملفات تعريف الهشاشة المعتمدة على البنية الهندسية.

المؤلفون الأصليون: Matic Korun

نُشر 2026-02-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Matic Korun

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة سحرية ضخمة، حيث كل كتاب كتبه أمين مكتبة واثق جداً وسريع جداً (الذكاء الاصطناعي). أحياناً، قد يختلق هذا الأمين قصصاً تبدو مثالية ولكنها كاذبة تماماً. وهذا ما يسمى بـ "الهلوسة" (Hallucination).

معظم الناس يحاولون الإمساك بهذه الأكاذيب عن طريق قراءة القصة النهائية والتحقق مما إذا كانت منطقية. لكن هذه الورقة البحثية تقترح فكرة مختلفة: بدلاً من قراءة القصة، دعونا ننظر إلى خريطة دماغ أمين المكتبة أثناء تفكيره.

يقترح المؤلف، ماتيك كورون، أنه عندما يرتبك أمين المكتبة، فإن دماغه لا يصبح "فارغاً" فحسب، بل تتعثر أفكاره في أنماط غريبة ومحددة على الخريطة. ومن خلال قياس شكل هذه الأنماط، يمكننا التنبؤ بنوع الكذبة القادمة بدقة قبل حتى أن تُكتب.

إليك تفصيل لأنواع "فشل خريطة الدماغ" الثلاثة، باستخدام تشبيهات بسيطة:

الأنواع الثلاثة للهلوسة

تخيل أن دماغ أمين المكتبة عبارة عن مدينة ذات أحياء متميزة (عناقيد/Clusters) لمواضيع مختلفة، مثل "الحيوانات"، أو "الطبخ"، أو "التاريخ".

1. "المتجول الغامض" (النوع 1: الانجراف نحو المركز - Center-Drift)

  • ماذا يحدث: يُطلب من أمين المكتبة الإجابة على سؤال لا يفهمه حقاً. وبدلاً من الذهما إلى حي محدد، فإنه يتسكع في ساحة المدينة (مركز الخريطة).
  • النتيجة: يعطيك إجابة آمنة، عامة، وتبدو واثقة ولكنها لا تقول شيئاً مفيداً.
    • مثال: "ما هي عاصمة بلد 'زوغ'؟" -> "إنها مدينة مهمة جداً بها الكثير من الناس." (حقيقة، ولكنها عديمة الفائدة).
  • العلامة المميزة: الفكرة ضعيفة وتقبع في منتصف الخرائط تماماً، بعيداً عن أي حي محدد.

2. "البئر الخاطئ الواثق" (النوع 2: التقارب في البئر الخاطئ - Wrong-Well Convergence)

  • ماذا يحدث: أمين المكتبة مركز جداً! إنه يندفع مباشرة نحو حي معين، لكنه الحي الخاطئ. إنه واثق جداً في هذا الحي لدرجة أنه لن يستمع إليك.
  • النتيجة: يقدم لك كذبة مفصلة، محددة، ومقنعة.
    • مثال: "من اخترع المصباح الكهربائي؟" -> "توماس إديسون اخترع المصباح الكهربائي في عام 1805." (واثق، ومفصل، لكن التاريخ خاطئ).
  • العلامة المميزة: الفكرة عميقة داخل أحد الأحياء، لكنه الحي الخاطئ بالنسبة للسؤال.

3. "التائه في البرية" (النوع 3: فجوة التغطية - Coverage Gap)

  • ماذا يحدث: يُسأل أمين المكتبة عن شيء غريب جداً أو جديد لدرجة أنه لا يوجد حي على الخريطة لهذا الشيء. إنه يقف في وسط صحراء لا تمر بها أي طرق.
  • النتيجة: يبدأ بالهذيان، أو اختلاق الهراء، أو التنقل بين مواضيع عشوائية.
    • مثال: "ما هو لون صوت يوم الثلاثاء؟" -> "إنه بنفسجي صاخب بطعم الكهرباء."
  • العلامة المميزة: الفكرة تطفو في مساحة فارغة، بعيداً عن أي حي، دون اتجاه واضح.

أدوات "المسطرة" الثلاثة

لإثبات نجاح ذلك، صنع المؤلف ثلاث مساطر خاصة لقياس خريطة دماغ أمين المكتبة. وقد اختبروا هذه المساطر على 11 نموذجاً مختلفاً للذكاء الاصطناعي (مثل BERT و GPT-2، إلخ).

  1. مسطرة "الجانب المقابل" (اقتران القطبية، α\alpha):

    • التشبيه: في مكتبة جيدة، يجب أن تكون الكلمات ذات المعاني المتضادة (مثل "ساخن" و"بارد") في نفس الحي ولكن على جانبين متقابلين من الغرفة.
    • النتيجة: كل نموذج ذكاء اصطناعي اجتاز هذا الاختبار. أدمغتهم تنظم المتضادات بشكل صحيح طبيعياً. هذه قاعدة عالمية لكيفية تفكير هذه النماذج.
  2. مسطرة "تماسك الحي" (تماسك العنقود، β\beta):

    • التشبيه: هل الكلمات الموجودة في الحي تلتصق ببعضها البعض فعلياً؟ أم أن الحي مجرد فوضى عشوائية؟
    • النتيجة: كل نموذج ذكاء اصطناعي اجتاز هذا أيضاً. الأحياء حقيقية ومتماسكة. فالذكاء الاصطناعي يعرف أن "تفاحة" و"موزة" ينتميان معاً، وأن "سيارة" و"دراجة" ينتميان معاً.
  3. مسطرة "المسافة من الوطن" (التدرج الشعاعي، λr\lambda_r):

    • التشبيه: هذا يقيس ما إذا كانت أفكار أمين المكتبة تصبح "أثقل" أو "أخف" كلما ابتعد عن المركز. عادةً، الكلمات النادرة والمعقدة تكون بعيدة عند الحافة، والكلمات الشائعة تكون قريبة من المركز.
    • النتيجة: 9 من أصل 11 نموذجاً أظهرت نمطاً واضحاً هنا.
    • الخلل: فشل نموذجان (ALBERT و MiniLM) في هذا الاختبار. لماذا؟
      • ALBERT كان "مضغوطاً" للغاية. لقد حاول حشر مكتبة ضخمة في خزانة صغيرة جداً، مما أدى إلى ضغط كل شيء.
      • MiniLM كان "مقطراً" (تم تدريبه ليكون أصغر). لقد قام بتسطيح الخريطة لدرجة أن "المسافة" من المركز لم تعد تهم.
    • الدرس المستفاد: هذان النموذجان أكثر عرضة لارتكاب خطأ "المتجول الغامض" (النوع 1) لأن نظام تحذير "المسافة" لديهما معطل.

لماذا هذا مهم؟

عادةً، نحاول الإمساك بأكاذيب الذكاء الاصطناعي بعد وقوعها. لكن هذه الورقة تقول: "يمكننا رؤية الكذبة وهي قادمة من خلال النظر إلى شكل الفكرة."

  • إذا كانت الفكرة قريبة جداً من المركز، فهي كذبة غامضة.
  • إذا كانت الفكرة عميقة جداً في الحي الخاطئ، فهي كذبة واثقة.
  • إذا كانت الفكرة في الصحراء الفارغة، فهي كذبة هراء.

من خلال فهم "هندسة" دماغ الذكاء الاصطناعي، يمكننا بناء شبكات أمان أفضل. يمكننا إخبار نموذج ذكاء اصطناعي صغير ومضغوط (مثل MiniLM) بأن يكون حذراً للغاية عندما يكون غير متأكد، لأننا نعلم أن خريطة دماغه ضبابية بعض الشيء.

باخت-اختصار: لقد رسم المؤلف خريطة لعقل الذكاء الاصطناعي ووجد أن للأكاذيب شكلاً محدداً. وإذا استطعنا قياس هذا الشكل، يمكننا إيقاف الأكاذيب قبل أن تُنطق حتى.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →