← أحدث الأبحاث
💬 NLP

HALT: Hallucination Assessment via Log-probs as Time series

تقدم الورقة البحثية HALT، وهو كاشف للهلوسة خفيف الوزن وفعال يحلل احتمالات الرموز (token log-probabilities) كسلاسل زمنية لتحقيق أداء وسرعة متفوقين مقارنة بالطرق الحالية، إلى جانب HUB، وهو معيار شامل يوحد عشر قدرات متنوعة لتقييم كشف الهلوسة عبر النماذج اللغوية الكبيرة.

المؤلفون الأصليون: Ahmad Shapiro, Karan Taneja, Ashok Goel

نُشر 2026-02-04
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Ahmad Shapiro, Karan Taneja, Ashok Goel

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تستمع إلى راوٍ يروي حكاية. أحياناً يتحدث بثقة مطلقة، وصوته ثابت وواضح. وفي أحيان أخرى، قد يتلعثم، أو يتردد، أو قد يرتعش صوته تماماً قبل أن يختلق تفصيلاً غير صحيح.

لفترة طويلة، حاول الباحثون الذين يحاولون الإمساك بالنماذج اللغوية الكبيرة (LLMs) وهي تكذب (أو "تهلوس") استخدام نهجين رئيسيين:

  1. نهج "الصندوق الأبيض" (White-Box): وهو أن تطلب من الراوي أن يريك ملاحظاته السرية وموجات دماغه. هذا أمر رائع إذا كنت تملك الراوي، ولكنه مستحيل إذا كنت مجرد مستخدم لواجهة برمجة تطبيقات عامة (مثل روبوت الدردشة).
  2. نهج "الصندوق الأسود" (Black-Box): وهو أن تطلب من الراوي تكرار القصة أو تطلب من راوٍ ثانٍ التحقق من صحة كلامه. هذا الأسلوب بطيء، ومكلف، وأحياناً يكذب الراوي الثاني أيضاً.

HALT (تقييم الهلوسة عبر احتمالات السجل كمتسلسلة زمنية) هو محقق ذكي وجديد لا يحتاج إلى الملاحظات السرية ولا إلى راوٍ ثانٍ. هو فقط يستمع إلى إيقاع ثقة الراوي.

الفكرة الجوهرية: الاستماع إلى "نبض قلب" الثقة

عندما ينتج الذكاء الاصطناعي نصاً، فإنه لا يختار كلمة فحسب؛ بل يحسب مدى احتمالية الكلمة التالية لكل كلمة ممكنة. تُسمى هذه الحسابات "الاحتمالات اللوغاريتمية" (log-probabilities). فكر في هذه الاحتمالات على أنها "مقياس الثقة" الداخلي للذكاء الاصطناعي لكل كلمة ينطق بها.

أدرك مؤلفو هذه الورقة البحثية أن مقاييس الثقة هذه لا تبقى ساكنة، بل تتحرك مثل متسلسلة زمنية (مثل نبض القلب أو مخطط البورصة).

  • عندما يروي الذكاء الاصطناعي الحقيقة، فإن مقياس ثقته يتبع عادةً إيقاعاً سلساً وثابتاً.
  • وعندما يبدأ في الهلوسة (اختلاق شيء ما)، يصبح هذا الإيقاع غريباً. فقد يرتفع فجأة، أو ينخفض فجأة، أو يتذبذب بنمط معين، حتى لو بدا الذكاء الاصطناعي واثقاً جداً.

HALT هو برنامج حاسوبي صغير وخفيف الوزن (نموذج "GRU") تم تدريبه لمراقبة إيقاع الثقة هذا. هو لا يقرأ الكلمات التي يقولها الذكاء الاصطناعي؛ بل يراقب فقط الرسم البياني لثقة الذكاء الاصطناعي أثناء حديثه.

أدوات المحقق: HALT

HALT يشبه سماعة الطبيب المتخصصة. فهو ينظر إلى أكثر 20 كلمة احتمالاً يفكر فيها الذكاء الاصطناعي عند كل خطوة، ويقيس:

  • مدى تذبذب الخيار: هل الذكاء الاصطناعي حائر بين كلمتين؟ (عدم يقين عالٍ).
  • مدى مفاجأة التغيير: هل انتقل الذكاء الاصطناعي فجأة من كونه متأكداً بنسبة 99% إلى 50%؟
  • النمط بمرور الوقت: هل يبدو منحنى الثقة كتلة ناعمة أم سلسلة جبال مسننة؟

من خلال تغذية هذا "نبض قلب الثقة" في دماغه، يتعلم HALT رصد "عدم الانتظام" الذي يحدث عندما يبدأ الذكاء الاصطناعي في الكذب.

الملعب الجديد: HUB

لاختبار ما إذا كان HALT يعمل بالفعل، بنى المؤلفون ملعب اختبار ضخم جديد يسمى HUB (المعيار الموحد للكشف عن الهلوسة).

تخيل أن الاختبارات السابقة كانت تشبه اللعب فقط في مكتبة صغيرة وهادئة (التركيز فقط على الحقائق البسيطة أو الدردشة). أما HUB فهو ملعب ضخم وفوضوي يحتوي على 10 رياضات مختلفة:

  • رياضات الاستنتاج: الرياضيات، البرمجة، الألغاز المنطقية، والخوارزميات.
  • الرياضات العامة: الدردشة، تلخيص الأخبار، والإجابة على الأسรئلة العامة.

أدرك المؤلفون أن "الهلوسة" ليست مجرد اختلاق حقائق (مثل قول إن القمر مصنوع من الجبن)، بل هي أيضاً هلوسات منطقية—حيث يصيب الذكاء الاصطناعي في الحقائق لكنه يخطئ في الخطوات الرياضية أو المنطقية للوصول إليها. يختبر HUB كل هذه الجوانب.

النتائج: صغير ولكن قوي

تقارن الورقة البحثية HALT بكواشف أخرى:

  • Lettuce: وهو كاشف ضخم وثقيل (مثل دبابة عملاقة) يقرأ النص الفعلي.
  • طرق الصندوق الأبيض: وهي الكواشف التي تحتاج لرؤية عقل الذكاء الاصطناعي الداخلي (وهو ما لا يمكنك فعله مع معظم أنظمة الذكاء الاصطناعي التجارية).

المفاجأة: HALT أصغر بـ 30 مرة من الدبابة الثقيلة (Lettuce) وأسرع بـ 60 مرة. ومع ذلك، فهو يفوز في كثير من الأحيان!

  • لقد تفوق على الدبابة الثقيلة في 7 من أصل 10 رياضات.
  • إنه يعمل بنفس كفاءة الدبابة الضخمة ولكنه لا يحتاج لقراءة النص أو رؤية عقل الذكاء الاصطناعي. هو فقط يستمع إلى إيقاع الثقة.

قيود هامة (كما ذكرت الورقة البحثية)

  • إنه خاص بنموذج معين: HALT يشبه المدرب الذي يعرف نبض لاعب واحد بعينه بدقة. إذا دربت HALT على ذكاء اصطناعي يسمى "Llama"، فسيصبح خبيراً في كشف أكاذيب "Llama". وإذا حاولت استخدام نفس الـ HALT على ذكاء اصطناعي آخر يسمى "Qwen"، فسيصاب بالارتباك؛ لأن أنماط "نبض القلب" تختلف من نموذج لآخر.
  • يحتاج للوصول إلى "أرقام الثقة": أنت لا تحتاج لعقل الذكاء الاصطناعي، ولكنك تحتاج لأن توفر لك واجهة برمجة التطبيقات (API) أعلى 20 رقم ثقة لكل كلمة. إذا كانت واجهة برمجة التطبيقات تخفي هذه الأرقام تماماً، فلن يتمكن HALT من العمل.
  • يكتشف ولا يصلح: HALT هو بمثابة جهاز إنذار للحريق. هو يخبرك متى يهلوِس الذكاء الاصطناعي، لكنه لا يخبرك لماذا أو كيف تصلح القصة.

تشبيه ملخص

تخيل الذكاء الاصطناعي كساحر يؤدي خدعة.

  • الكواشف القديمة حاولت التلصص تحت قبعة الساحر (الصندوق الأبيض) أو طلب التصويت من الجمهور لمعرفة ما إذا كانت الخدعة حقيقية أم لا (تحليل النص - الصندوق الأسود).
  • أما HALT فيكتفي بمراقبة حركة يدي الساحر. هو يعلم أنه عندما يوشك الساحر على إخراج أرنب مزيف من القبعة، تصبح حركات يده مهتزة وغير متوقعة قلياً، حتى لو كان يبتسم بثقة. لقد تم تدريب HALT على رصد نمط "اليد المهتزة" هذا في أرقام ثقة الذكاء الاصطناعي، مما يسمح له بكشف الكذبة فوراً دون الحاجة لرؤية الخدعة أو سؤال أي شخص آخر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →