Low-Cost Black-Box Detection of LLM Hallucinations via Dynamical System Prediction
تقدم هذه المساهمة طريقة "الصندوق الأسود" منخفضة التكلفة للكشف عن الهلوسة، والتي تعمل على نمذجة استجابات النماذج اللغوية الكبيرة كأنظمة ديناميكية باستخدام نظرية مؤثر كوبمان لتحقيق نتائج رائدة في تمريرة واحدة دون الحاجة إلى أخذ عينات مكلفة أو استرجاع معرفة خارجية.
تخيل أنك تستمع إلى حكواتي. أحياناً، يروي لك قصة حقيقية من الماضي. وفي أحيان أخرى، ينسج حكاية تبدو سلسة وواثقة تماماً، لكنها مختلقة بالكامل. هذا هو بالضبط ما تفعله النماذج اللغوية الكبيرة (LLMs): يمكنها أن "تهلوس" وتخلق حقائق تبدو حقيقية ولكنها ليست كذلك.
عادةً، يكون من الصعب كشف هذه الأكاذيب. فإما أن تضطر لسؤال الذكاء الاصطناعي نفس السؤال مئة مرة لترى ما إذا كان سيغير قصته (وهو أمر بطيء ومكلف)، أو يجب عليك إرسال الإجابة إلى مدقق حقائق منفصل (وهذا يتطلب الوصول إلى الإنترنت وأدوات إضافية).
يقترح هذا المقال طريقاً مختصراً ذكياً ومنخفض التكلفة. فبدلاً من التحقق من محتوى القصة، يستمع المؤلفون إلى الإيقاع الذي تُروى به القصة.
الفكرة الجوهرية: التقرير "الراقص"
ينظر المؤلفون إلى الذكاء الاصطناعي ليس ككاتب، بل كـ نظام ديناميكي — وهو مصطلح أنيق لوصف آلة تتحرك عبر نمط يمكن التنبؤ به، مثل راقص يخطو عبر خشبة المسرح.
المسرح (فضاء التضمين): يتم تحويل كل كلمة ينطق بها الذكاء الاصطناعي إلى نقطة رياضية في فضاء ثلاثي الأبعاد (أو حتى 1000 بُعد) شاسع وغير مرئي. وبينما يولد الذكاء الاصطناعي جملة، فإنه ينتقل من نقطة إلى أخرى، مما يخلق مساراً أو "مساراً حركياً" (trajectory).
أرضيتان للرقص: اكتشف الباحثون أنه عندما يروي الذكاء الاصطناعي الحقيقة، فإن مساره يتبع أرضية رقص محددة (manifold). وعندما يكذب (يهلوس)، فإنه يخطو على أرضية رقص مختلفة تماماً. ورغم أن الكلمات قد تبدو متشابهة، إلا أن "الخطوات" الرياضية بين الكلمات تكون مختلفة.
لعبة التنبؤ: قاموا ببناء اثنين من "المتنبئين" (مثل مدربي رقص مختلفين):
المدرب (أ): تعلم خطوات "رقصة الحقيقة".
المدرب (ب): تعلم خطوات "رقصة الكذب".
النتيجة (الدرجة): عندما تصل جملة جديدة، نسأل كلا المدربين عن التنبؤ بالخطوة التالية.
إذا كانت الجملة حقيقية، يتنبأ المدرب (أ) (الحقيقة) بالخطوة التالية بشكل مثالي، بينما يتعثر المدرب (ب) (الكذب).
إذا كانت الجملة كذبة، يتنبأ المدرب (ب) بها جيداً، ويتعثر المدرب (أ).
يقومون بحساب "درجة البواقي التفاضلية": وهي باختصار، مدى تفوق أحد المدربين على الآخر في الأداء. إذا فاز "مدرب الكذب"، يصنف النظام ذلك كهلوسة.
لماذا يعد هذا أمراً هاماً؟
إنجاز من تمريرة واحدة: معظم الطرق الأخرى تتطلب سؤال الذكاء الاصطناعي نفس السؤال عدة مرات أو البحث عن الحقائق في قاعدة بيانات. هذه الطريقة تفحص الإجابة مرة واحدة وتقرر فوراً. إنها تشبه التعرف على لوحة مزيفة بنظرة واحدة على ضربات الفرشاة، بدلاً من مقارنتها بمعرض من اللوحات الأصلية.
صديق لـ "الصندوق الأسود": لا تحتاج لرؤية الدماغ الداخلي للذكاء الاصطناعي (الذي تخفيه الشركات الكبرى). أنت تحتاج فقط إلى النص الذي يخرجه. إنها تعمل ككاشف لـ "الصندوق الأسود".
صرامة قابلة للتعديل: أضاف المؤلفون وظيفة "معايرة". تخيل أنك قاضٍ؛ أحياناً تريد أن تكون صارماً جداً وتكتشف حتى الأخطاء الصغيرة، وفي أحيان أخرى، تهتم فقط بالأكاذيب الكبيرة والواضحة. يمكن ضبط النظام ببضع أمثلة منك فقط لتحديد الحساسية المثالية لـ "جهاز كشف الكذب".
كيف اختبروا ذلك؟
اختبروا "كاشف الإيقاع" هذا على ثلاث مجموعات بيانات مختلفة:
WikiBio: للتحقق من الأخطاء الواقعية في السير الذاتية.
HaluEval: للتحقق من التفاصيل المختلقة في الملخصات.
FELM: للتحقق من المنطق الاستدلالي في الرياضيات والعلوم.
النتائج:
أدت طريقتهم أداءً يضاهي أو يتفوق على أكثر الطرق المتاحة حالياً تكلفة واستهلاكاً للموارد.
ومن المثير للاهلاه، وجدوا أنه كلما كانت الجملة أطول (أي الرقصة أطول)، كان من الأسهل التمييز بين "رقصة الحقيقة" و"رقصة الكذب".
حتى عندما دربوا النظام على نموذج ذكاء اصطناعي واحد (مثل Llama-3) واختبروه على نموذج آخر (مثل Mistral)، فقد عمل بشكل جيد بشكل مفاجئ، مما يشير إلى أن "إيقاع الكذب" هو خاصية عالمية لمختلف نماذج الذكاء الاصطناعي.
الخلاصة
يقدم هذا المقال طريقة لاكتشاف أكاذيب الذكاء الاصطناعي من خلال تحليل التدفق الرياضي للكلمات بدلاً من الكلمات نفسها. إنها طريقة سريعة، غير مكلفة، لا تتطلب قواعد بيانات خارجية، وتعمل بنظرة واحدة على النص. إنها تشبه جهاز كشف الكذب الذي يستمع إلى موسيقى الكلام بدلاً من نص الكلام.
القيود المذكورة: يشير المقال إلى أنه بينما تعد هذه الطريقة ممتازة في اكتشاف الكذبة، إلا أنها لا تخبرك ما هي الحقيقة فعلياً، ولا تصحح سلوك الذكاء الاصطناعي. إنها أداة كشف، وليست أداة تصحيح.
خاتمة تقنية: كشف الهلوسة في النماذج اللغوية الكبيرة (LLMs) بفعالية من حيث التكلفة عبر التنبؤ بالأنظمة الديناميكية
بيان المشكلة
تنتج النماذج اللغوية الكبيرة (LLMs) محتوىً بليغاً ولكنه غير صحيح واقعياً، وهي ظاهرة تُعرف بالهلوسة (Hallucination). تمثل هذه المشكلة عائقاً حرجاً أمام نشر هذه النماذج في المجالات عالية الخطورة مثل الرعاية الصحية، والقانون، والتمويل. وعلى الرغم من أن الهلوسة حتمية نظرياً بسبب المقايضة بين البيانات المحدودة في التدريب والتوليد مفتوح النهايات، إلا أن طرق الكشف الحالية تواجه قيوداً كبيرة:
طرق الصندوق الأبيض/الرمادي (White-Box/Gray-Box): تتطلب الوصول إلى الحالات الداخلية للنموذج (الحالات الخفية، خرائط الانتباه) أو احتمالات مستوى الرمز (token-level probabilities)، وهي أمور غير متاحة للنماذج التجارية مغلقة المصدر التي يتم الوصول إليها عبر واجهات برمجة التطبيقات (APIs).
طرق الصندوق الأسود الموجودة (Existing Black-Box Methods): تعتمد عادةً على فحوصات الاتساق القائمة على أخذ العينات المكثفة حسابياً (مثل SelfCheckGPT) أو استرجاع المعرفة الخارجية. وتتسبب هذه النهج في تكاليف عالية لواجهات برمجة التطبيقات، وزمن انتقال مرتفع، وأعباء إضافية في الموارد، مما يجعلها غير عملية للتطبيقات التي تعمل في الوقت الفعلي وتتعامل مع عينات مفردة.
هناك حاجة ملحة لإطار عمل مستقل وفعال من حيث التكلفة للكشف، يعمل حصرياً على النص المُولد، دون الحاجة إلى مرجع خارجي أو عمليات أخذ عينات متعددة.
المنهجية
يقترح المؤلفون التعامل مع النموذج اللغوي الكبير (LLM) كـ نظام ديناميكي (DS) أسود الصندوق. فبدلاً من تحليل الرموز (tokens) كوحدات مستقلة، تقوم الطريقة بنمذجة التطور الزمني لتمثيلات الرموز (embeddings) باعتبارها تجليات ملحوظة لديناميكيات الحالة الكامنة للنموذج.
الإطار الأساسي
صياغة النظام الديناميكي: يتم نمذجة مخرجات النموذج اللغوي الكبير كنظام منفصل وغير خطي: xk+1=F(xk),yk=H(xk) حيث تمثل xk الحالات الداخلية وتمثل yk تمثيلات الرموز الملحوظة. يستخدم المؤلفون نظرية مؤثر كوبمان (Koopman Operator Theory) لجعل ديناميكيات هذه الملحوظات خطية، مما يسمح بالتنبؤ بالحالات المستقبلية بناءً على الملاحظات الماضية.
المرحلة الأولى: الاستدلال القائم على البيانات للنظام الديناميكي (التكيف غير المتصل - Offline Adaptation):
تستخدم الطريقة مجموعة صغيرة من البيانات المصنفة التي تحتوي على ردود فعل حقيقية ومهلوسة على حد سواء.
يتم "رفع" (lifting) تمثيلات الرموز إلى فضاء عالي الأبعاد باستخدام طريقة تفكيك النمط الديناميكي الممتد (Extended DMD).
يتم استنتاج نموذجين ديناميكيين خطيين متميزين:
Ac: مؤثر الانتقال للردود الحقيقية (الصحيحة).
Ah: مؤثر الانتقال للردود المهلوسة.
الفرضية هي أن الردود الحقيقية والمهلوسة تتطور على "منوعات" (manifolds) مختلفة (Mc و Mh) داخل فضاء التمثيل، مما يؤدي إلى تقديرات مختلفة لمؤثر كوبمان.
المرحلة الثانية: التصنيف عبر درجة البواقي التفاضلية (الاستدلال - Inference):
بالنسبة لاستجابة جديدة غير معروفة، تحسب الطريقة خطأ التنبؤ (الباقي/residual) لمسار تمثيل الرموز باستخدام كلا النموذجين (Ac و Ah).
على مستوى الاستجابة، يتم حساب درجة البواقي التفاضلية (ΔE): ΔE=∑ϵh,j2−∑ϵc,j2 حيث تمثل ϵ خطأ التنبؤ.
المنطق: إذا كانت الاستجابة مهلوسة، فإن النموذج المتكيف مع الهلوسة (Ah) يجب أن يتنبأ بالمسار بدقة أكبر من النموذج الحقيقي (Ac)، مما يؤدي إلى ΔE سالبة. وعلى العكس من ذلك، فإن النص الحقيقي يعطي ΔE موجبة.
يتم تطبيق عتبة قرار η على ΔE لتصنيف المخرج كحقيقي (0) أو مهلوس (1).
المعايرة الواعية بالتفضيلات (Preference-Aware Calibration): لتلبية متطلبات المستخدمين المتنوعة (مثل الصرامة مقابل التسامح مع عدم الدقة الطفيفة)، يقدم المؤلفون آلية معايرة. باستخدام مجموعة صغيرة من العروض التوضيحية التي قام المستخدم بتدوينها، يتم تحسين العتبة η لتتماشى مع تفضيلات الحساسية المحددة، مما يسمح للمكتشف بالتكيف مع حالات الاستخدام الفردية.
المساهمات الرئيسية
منظور ديناميكي مبتكر: يعد هذا العمل الأول الذي يعامل مخرجات النماذج اللغوية الكبيرة كأنظمة ديناميكية سوداء الصندوق، حيث تتطور الردود الحقيقية والمهلوسة على منوعات مختلفة في فضاء الحالة.
كشف فعال من pass واحد (Single-Pass): على عكس الطرق القائمة على الاسترجاع أو أخذ العينات المتعددة، تحدد هذه الطة الهلوسة في إجراء تمريرة واحدة دون الحاجة إلى احتمالات الرموز، أو قواعد معرفية خارجية، أو تمريرات أمامية متعددة.
أداء يضاهي أحدث المعايير (State-of-the-Art): تحقق الطريقة نتائج تنافسية أو متفوقة مقارنة بالنماذج المرجعية المستهلكة للموارد عبر ثلاثة اختبارات معيارية مختلفة (WikiBio, HaluEval, FELM).
معايرة متمحورة حول المستخدم: تتيح آلية ضبط عتبات التصنيف بناءً على مستويات الصرامة المحددة من قبل المستخدم القدرة على الكشف الشخصي.
النتائج التجريبية
تم تقييم الطريقة على ثلاث مجموعات بيانات: WikiBio (السير الذاتية)، HaluEval (التلخيص)، و FELM (الاستدلال في الرياضيات والعلوم والمنطق).
الأداء:
في مهمة التلخيص HaluEval، حققت الطريقة دقة بلغت 99.3% باستخدام نموذج تمثيل Llama-3، متفوقة بشكل كبير على الكواشف ذات التمرير الصفري (zero-shot) وغيرها من نماذج الصندوق الأسود.
في WikiBio، حققت الطريقة AUC-PR قدرها 85.3 (باستخدام Llama-3) للكشف عن الجمل غير الحقيقية، متجاوزة SelfCheckGPT (81.96).
في FELM، حقق متغير Llama-3 دقة متوازنة بلغت 68.4، مساوية أو متفوقة على GPT-4 والنماذج القوية الأخرى.
طول التسلسل: يتحسن الأداء مع سلاسل الرموز الأطول، حيث توفر المسارات الطويلة معلومات دلالية أغنى. وتستفيد نماذج التمثيل الأصغر بشكل أكبر من زيادة أطوال التسلسل، بينما تحافظ النماذج الأكبر (مثل Llama-3) على أداء عالٍ حتى مع التسلسلات القصيرة.
التعميم عبر نماذج التمثيل (Cross-Embedding Generalization): لاحظت الدراسة قابلية نقل مفاجئة؛ حيث يمكن للنماذج الديناميكية التي تم تكييفها على فضاء تمثيل واحد (مثل Qwen3) أن تتعمم جزئياً لتقييم الاستجابات الممثلة في فضاء مختلف (مثل Llama-3). وهذا يشير إلى وجود بصمات ديناميكية عالمية للواقعية عبر منوعات التمثيل المختلفة.
الكفاءة: تتجنب الطريقة زمن الانتظار وتكاليف الاسترجاع الخارجي أو أخذ العينات المتعددة، مما يوفر حلاً منخفض التكاليف مناسباً للتطبيقات في الوقت الفعلي.
الأهمية والادعاءات
يزعم المؤلفون أن هذا العمل يقدم بديلاً فعالاً من حيث التكلفة وقابلاً للتوسع لطرق كشف الهلوسة الحالية. ومن خلال إعادة صياغة المشكلة من منظور الأنظمة الديناميكية، فقد أثبتوا أن التطور الزمني لتمثيلات الرموز يشفر بطبيعته الفرق بين المحتوى الحقيقي والمهلوس.
يؤكد العمل أن طريقتهم:
لا تتطلب الوصول إلى مكونات النموذج الداخلية (صندوق أسود حقيقي)،
لا تتطلب استرجاع المعرفة الخارجية،
لا تتطلب عمليات أخذ عينات متعددة،
تحقق نتائج تضاهي أحدث المعايير مع تقليل الأعباء الموردية.
يقر المؤلفون بوجود بعض القيود، مشيرين إلى أنه بينما تكتشف الطريقة الهلوسة، فإنها لا تقدم تصحيحات واقعية خارجية أو تقدم استراتيجية للتخفيف من الهلوسة (مثل تعديل الأوامر/Prompts). ومع ذلك، فهم يضعون هذا العمل كخطوة أساسية نحو أطر كشف مستقلة وذاتية لتشغيل النماذج اللغوية الكبيرة بشكل موثوق في المجالات الحرجة.