Faithfulness-Aware Uncertainty Quantification for Fact-Checking the Output of Retrieval Augmented Generation
تقدم هذه الورقة البحثية FRANQ، وهي طريقة مبتكرة للكشف عن الهلوسة في نماذج التوليد المعزز بالاسترجاع (RAG)، تعمل على تحسين تحديد الأخطاء الواقعية من خلال تطبيق تقنيات متميزة لتقدير عدم اليقين مشروطة بمدى أمانة العبارة تجاه الأدلة المسترجعة، والتي تم التحقق من صحتها عبر مجموعة بيانات جديدة مُصنفة لكل من الواقعية والأمانة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة البحث "FRANQ: تقدير عدم اليقين الواعي بالأمانة للتحقق من الحقائق" باستخدام لغة بسيطة وتشبيهات إبداعية.
الصورة الكبيرة: مشكلة "أمين المكتبة الذكي"
تخيل أن لديك أمين مكتبة فائق الذكاء (الذكاء الاصطناعي) يعرف الكثير عن العالم. لكن هذا الأمين لديه عادة سيئة: أحياناً يختلق أشياء، أو يتذكر الأشياء بشكل خاطئ. هذا ما يسمى بـ "الهلوسة" (Hallucination).
لإصلاح ذلك، تعطيه مجموعة من الكتب المرجعية (المستندات المسترجعة) وتقول له: "أجب عن السؤال باستخدام ما هو موجود في هذه الكتب فقط". هذا ما يسمى بـ RAG (التوليد المعزز بالاسترجاع).
المشكلة:
حتى مع وجود الكتب، لا يزال أمين المكتبة يرتكب الأخطاء.
- خطأ "الكتاب الخاطئ": يقرأ أمين المكتبة كتاباً يحتوي على خطأ مطبعي أو كذبة، فيكرر الكذبة ظناً منه أنها حقيقة لأنها موجودة في الكتاب.
- خطأ "المعرفة الخارجية": يتجاهل أمين المكتبة الكتب ويجيب من ذاكرته الخاصة، والتي قد تكون صحيحة أو خاطئة.
الطريقة القديمة في التحقق:
كانت الطرق السابقة تشبه معلماً صارماً يقول: "إذا لم يكن مكتوباً في الكتاب، فهو كذب!".
هذا غير عادل. فإذا كان أمين المكتبة يعرف الإجابة من ذاكرته (وهي صحيحة بالفعل)، ولكن الكتاب لم يذكرها، فإن الطريقة القديمة ستعتبرها "هلوسة". لقد خلطت بين "هل اتبعت القواعد؟" وبين "هل الإجابة صحيحة حقاً؟".
الحل: FRANQ (المحقق الذكي)
ابتكر المؤلفون طريقة جديدة تسمى FRANQ. تخيل FRANQ كمحقق يتكون من خطوتين، لا يكتفي فقط بالتحقق مما إذا كان أمين المكتبة قد اتبع القواعد، بل يتحقق أيضاً مما إذا كانت الإجابة حقيقية بالفعل.
يقسم FRANQ عملية التحقق من الحقيقة إلى سؤالين متميزين:
الخطوة 1: فحص "الأمانة" (هل التزم بالنص؟)
- التشبيه: تخيل أمين المكتبة ممثلاً. "الكتب المرجعية" هي النص (السيناريو).
- السؤال: "هل التزم الممثل بالنص، أم أنه ارتجل؟"
- كيف يقوم FRANQ بذلك: يستخدم أداة تسمى AlignScore لقياس مدى تطابق الإجابة مع النص الموجود في الكتب.
- درجة عالية: الإجابة موجودة تماماً في الكتب.
- درجة منخفضة: الإجابة جاءت من رأس أمين المكتبة.
الخطوة 2: فحص "الواقعية" (هل الإجابة حقيقية حقاً؟)
هنا يصبح FRANQ ذكياً. فهو يطرح سؤالاً مختلفاً بناءً على نتيجة الخطوة الأولى.
السيناريو (أ): أمين المكتبة اتبع النص (أمين)
- المخاطرة: قد يكون النص نفسه خاطئاً! (ربما كان هناك خطأ مطبعي في الكتاب).
- حركة المحقق: يسأل FRANQ: "إذا كان أمين المكتبة يقرأ النص فقط، فما مدى ثقته في قراءته؟" إنه يتحقق من احتمالية ظهور الكلمات. إذا كان أمين المكتبة يتلعثم أو يبدو غير متأكد أثناء قراءة النص، فمن المرجح أن الإجابة مهتزة.
السيناريو (ب): أمين المكتبة ارتجل (غير أمين)
- المخاطرة: أمين المكتبة يخمن من ذاكرته الخاصة.
- حركة المحقق: يتجاهل FRANQ الكتب تماماً. ويسأل: "بناءً على معرفته الداخلية، ما مدى احتمالية أن يكون هذا صحيحاً؟" إنه يتحقق من الثقة الداخلية لأمين المكتبة دون النظر إلى الكتب.
المعادلة السحرية: مزج الدرجات
يقوم FRANQ بدمج هذين الفحصين في "درجة حقيقة" واحدة.
فكر في الأمر مثل "السموذي" (العصير المخلوط):
- القاعدة: كم جاءت الإجابة من الكتب؟ (الأمانة).
- الفاكهة: ما مدى صحة الإجابة إذا جاءت من الكتب؟ (الواقعية المعتمدة على النص).
- الزبادي: ما مدى صحة الإجابة إذا جاءت من عقل أمين المكتبة؟ (الواقعية المعتمدة على المعرفة الذاتية).
يقوم FRANQ بخلط هذه المكونات بناءً على الوصفة. إذا كانت الإجابة بنسبة 90% من الكتب، فإن "حقيقة الكتاب" تكون أكثر أهمية. وإذا كانت بنسبة 90% من عقل أمين المكتبة، فإن "حقيقة العقل" تكون أكثر أهمية.
لماذا يهم هذا (لحظة الإدراك)
في الماضي، إذا قدم أمين المكتبة إجابة صحيحة ولكنها لم تكن في الكتاب، كانت الأنظمة القديمة تصنفها كخطأ.
- النظام القديم: "لم تستخدم الكتاب! هذه هلوسة!" (إنذار كاذب).
- FRANQ: "لم تستخدم الكتاب، لكن إجابتك صحيحة بالفعل بناءً على معرفتك الخاصة. لا بأس بذلك!" (دقيق).
وعلى العكس، إذا نسخ أمين المكتبة كذبة من كتاب بشكل أعمى:
- النظام القديم: "لقد استخدمت الكتاب! إذن لا بد أنها حقيقة." (تجاهل الخطأ).
- FRANQ: "لق توقفت عند الكتاب، لكن الكتاب يبدو مشبوهاً، وأنت تبدو غير متأكد. هذه على الأرجح كذبة." (كشف الخطأ).
مجموعة البيانات الجديدة (ساحة التدريب)
لتعليم هذا المحقق الجديد، بنى المؤلفون مجموعة بيانات جديدة تماماً.
- تخيل مكتبة ضخمة من الأسئلة والأجوبة.
- لم يكتفوا بتصنيفها كـ "صحيح" أو "خاطئ".
- بل صنفوها بـ علامتين (Tags):
- هل هي موجودة في الكتاب؟ (الأمانة).
- هل هي حقيقية بالفعل؟ (الواقعية).
- استخدموا مزيجاً من الذكاء الاصطناعي والخبراء البشريين للتأكد من أن هذه التصنيفات مثالية، خاصة في الحالات المعقدة التي ارتبك فيها الذكاء الاصطناعي.
النتيجة
عندما اختبروا FRANQ مقابل الطرق الأخرى، كان الأمر يشبه إحضار شرلوك هولمز لخوض معركة ضد شخص يحمل عدسة مكبرة.
- لقد كشف المزيد من الأكاذيب.
- ارتكب اتهامات كاذبة أقل ضد الإجابات الصحيحة.
- عمل بشكل جيد سواء كانت الإجابات قصيرة (مثل أسئلة المعلومات العامة) أو طويلة (مثل المقالات).
ملخص في جملة واحدة
FRANQ هو مدقق حقائق ذكي يدرك الفرق بين "اتباع القواعد" و"قول الحقيقة"، مما يضمن عدم معاقبة الإجابات الصحيحة لمجرد أنها لم تكن في الكتاب المرجعي، وعدم الثقة في الإجابات الخاطئة لمجرد أنها موجودة في الكتاب.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.