← أحدث الأبحاث
🤖 machine learning

Low-Cost Black-Box Detection of LLM Hallucinations via Dynamical System Prediction

تقدم هذه المساهمة طريقة "الصندوق الأسود" منخفضة التكلفة للكشف عن الهلوسة، والتي تعمل على نمذجة استجابات النماذج اللغوية الكبيرة كأنظمة ديناميكية باستخدام نظرية مؤثر كوبمان لتحقيق نتائج رائدة في تمريرة واحدة دون الحاجة إلى أخذ عينات مكلفة أو استرجاع معرفة خارجية.

المؤلفون الأصليون: Dan Wilson, Mohamed Akrout

نُشر 2026-05-07
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Dan Wilson, Mohamed Akrout

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تستمع إلى حكواتي. أحياناً، يروي لك قصة حقيقية من الماضي. وفي أحيان أخرى، ينسج حكاية تبدو سلسة وواثقة تماماً، لكنها مختلقة بالكامل. هذا هو بالضبط ما تفعله النماذج اللغوية الكبيرة (LLMs): يمكنها أن "تهلوس" وتخلق حقائق تبدو حقيقية ولكنها ليست كذلك.

عادةً، يكون من الصعب كشف هذه الأكاذيب. فإما أن تضطر لسؤال الذكاء الاصطناعي نفس السؤال مئة مرة لترى ما إذا كان سيغير قصته (وهو أمر بطيء ومكلف)، أو يجب عليك إرسال الإجابة إلى مدقق حقائق منفصل (وهذا يتطلب الوصول إلى الإنترنت وأدوات إضافية).

يقترح هذا المقال طريقاً مختصراً ذكياً ومنخفض التكلفة. فبدلاً من التحقق من محتوى القصة، يستمع المؤلفون إلى الإيقاع الذي تُروى به القصة.

الفكرة الجوهرية: التقرير "الراقص"

ينظر المؤلفون إلى الذكاء الاصطناعي ليس ككاتب، بل كـ نظام ديناميكي — وهو مصطلح أنيق لوصف آلة تتحرك عبر نمط يمكن التنبؤ به، مثل راقص يخطو عبر خشبة المسرح.

  1. المسرح (فضاء التضمين): يتم تحويل كل كلمة ينطق بها الذكاء الاصطناعي إلى نقطة رياضية في فضاء ثلاثي الأبعاد (أو حتى 1000 بُعد) شاسع وغير مرئي. وبينما يولد الذكاء الاصطناعي جملة، فإنه ينتقل من نقطة إلى أخرى، مما يخلق مساراً أو "مساراً حركياً" (trajectory).
  2. أرضيتان للرقص: اكتشف الباحثون أنه عندما يروي الذكاء الاصطناعي الحقيقة، فإن مساره يتبع أرضية رقص محددة (manifold). وعندما يكذب (يهلوس)، فإنه يخطو على أرضية رقص مختلفة تماماً. ورغم أن الكلمات قد تبدو متشابهة، إلا أن "الخطوات" الرياضية بين الكلمات تكون مختلفة.
  3. لعبة التنبؤ: قاموا ببناء اثنين من "المتنبئين" (مثل مدربي رقص مختلفين):
    • المدرب (أ): تعلم خطوات "رقصة الحقيقة".
    • المدرب (ب): تعلم خطوات "رقصة الكذب".
  4. النتيجة (الدرجة): عندما تصل جملة جديدة، نسأل كلا المدربين عن التنبؤ بالخطوة التالية.
    • إذا كانت الجملة حقيقية، يتنبأ المدرب (أ) (الحقيقة) بالخطوة التالية بشكل مثالي، بينما يتعثر المدرب (ب) (الكذب).
    • إذا كانت الجملة كذبة، يتنبأ المدرب (ب) بها جيداً، ويتعثر المدرب (أ).
    • يقومون بحساب "درجة البواقي التفاضلية": وهي باختصار، مدى تفوق أحد المدربين على الآخر في الأداء. إذا فاز "مدرب الكذب"، يصنف النظام ذلك كهلوسة.

لماذا يعد هذا أمراً هاماً؟

  • إنجاز من تمريرة واحدة: معظم الطرق الأخرى تتطلب سؤال الذكاء الاصطناعي نفس السؤال عدة مرات أو البحث عن الحقائق في قاعدة بيانات. هذه الطريقة تفحص الإجابة مرة واحدة وتقرر فوراً. إنها تشبه التعرف على لوحة مزيفة بنظرة واحدة على ضربات الفرشاة، بدلاً من مقارنتها بمعرض من اللوحات الأصلية.
  • صديق لـ "الصندوق الأسود": لا تحتاج لرؤية الدماغ الداخلي للذكاء الاصطناعي (الذي تخفيه الشركات الكبرى). أنت تحتاج فقط إلى النص الذي يخرجه. إنها تعمل ككاشف لـ "الصندوق الأسود".
  • صرامة قابلة للتعديل: أضاف المؤلفون وظيفة "معايرة". تخيل أنك قاضٍ؛ أحياناً تريد أن تكون صارماً جداً وتكتشف حتى الأخطاء الصغيرة، وفي أحيان أخرى، تهتم فقط بالأكاذيب الكبيرة والواضحة. يمكن ضبط النظام ببضع أمثلة منك فقط لتحديد الحساسية المثالية لـ "جهاز كشف الكذب".

كيف اختبروا ذلك؟

اختبروا "كاشف الإيقاع" هذا على ثلاث مجموعات بيانات مختلفة:

  1. WikiBio: للتحقق من الأخطاء الواقعية في السير الذاتية.
  2. HaluEval: للتحقق من التفاصيل المختلقة في الملخصات.
  3. FELM: للتحقق من المنطق الاستدلالي في الرياضيات والعلوم.

النتائج:

  • أدت طريقتهم أداءً يضاهي أو يتفوق على أكثر الطرق المتاحة حالياً تكلفة واستهلاكاً للموارد.
  • ومن المثير للاهلاه، وجدوا أنه كلما كانت الجملة أطول (أي الرقصة أطول)، كان من الأسهل التمييز بين "رقصة الحقيقة" و"رقصة الكذب".
  • حتى عندما دربوا النظام على نموذج ذكاء اصطناعي واحد (مثل Llama-3) واختبروه على نموذج آخر (مثل Mistral)، فقد عمل بشكل جيد بشكل مفاجئ، مما يشير إلى أن "إيقاع الكذب" هو خاصية عالمية لمختلف نماذج الذكاء الاصطناعي.

الخلاصة

يقدم هذا المقال طريقة لاكتشاف أكاذيب الذكاء الاصطناعي من خلال تحليل التدفق الرياضي للكلمات بدلاً من الكلمات نفسها. إنها طريقة سريعة، غير مكلفة، لا تتطلب قواعد بيانات خارجية، وتعمل بنظرة واحدة على النص. إنها تشبه جهاز كشف الكذب الذي يستمع إلى موسيقى الكلام بدلاً من نص الكلام.

القيود المذكورة:
يشير المقال إلى أنه بينما تعد هذه الطريقة ممتازة في اكتشاف الكذبة، إلا أنها لا تخبرك ما هي الحقيقة فعلياً، ولا تصحح سلوك الذكاء الاصطناعي. إنها أداة كشف، وليست أداة تصحيح.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →