EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models
تقدم الورقة البحثية EvidenceRL، وهو إطار عمل للتعلم التعزيزي يستخدم تحسين السياسة النسبية للمجموعات (GRPO) لفرض الالتزام بالأدلة في النماذج اللغوية الكبيرة، مما يقلل بشكل كبير من الهلوسة ويحسن التأسيس والأمانة في المجالات عالية المخاطر مثل تشخيص أمراض القلب والاستدلال القانوني دون المساس بدقة المهام.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك طالباً ذكياً جداً ومطلعاً يدعى LLM (نموذج لغوي كبير). يمكن لهذا الطالب كتابة مقالات رائعة، وحل مشكلات معقدة، والتحدث بثقة مذهلة. ومع ذلك، هناك عقبة: LLM يحب اختلاق الأمور.
إذا طلبت من LLM نصيحة طبية أو استنتاجاً قانونياً، فقد يعطيك إجابة تبدو مثالية ولكنها في الواقع محض افتراء. الأمر يشبه طالباً حفظ أسلوب الكتاب المدرسي لكنه نسي قراءة الحقائق فعلياً. في المجالات عالية الخطورة مثل الرعاية الصحية أو القانون، يكون هذا "الهلوسة" أمراً خطيراً لأن الإجابة الخاطئة قد تؤذي شخصاً ما.
تقدم الورقة البحثية التي شاركتها طريقة تدريب جديدة تسمى EvidenceRL. فكر في الأمر كمدرب صارم وشديد الملاحظة يجبر الطالب على التوقف عن التخمين والبدء في إثبات عمله.
إليك كيف يعمل ذلك، مقسماً إلى مفاهيم بسيطة:
1. المشكلة: "الكاذب الواثق"
حالياً، إذا سألت ذكاءً اصطناعياً لتشخيص حالة قلبية، فقد يقول: "المريض يعاني من X"، ثم يخترع سبباً زائفاً لذلك. حتى لو أعطيت الذكاء الاصطناعي كومة من السجلات الطبية الحقيقية (الأدلة)، فغالباً ما يتجاهلها الذكاء الاصطناعي ويعتمد على ما "يتذكره" من بيانات تدريبه. الأمر يشبه محامياً يجادل في قضية عبر اختلاق حقائق لأنها تبدو جيدة، بدلاً من النظر في تقرير الشرطة الفعلي.
2. الحل: EvidenceRL (المدرب الذي يضع "الدليل أولاً")
قام الباحثون بإنشاء نظام تدريب جديد يسمى EvidenceRL. بدلاً من مجرد إخبار الذكاء الاصطناعي: "لقد حصلت على الإجابة الصحيحة"، قاموا بتغيير قواعد اللعبة. الآن، لا يحصل الذكاء الاصطناعي على "درجة جيدة" إلا إذا استطاع إثبات إجابته باستخدام الوثائق المقدمة تحديداً.
لقد استخدموا تقنية تسمى التعلم التعزيزي (Reinforcement Learning). تخيل جلسة تدريب للكلاب:
- الطريقة القديمة: الكلب يجلس، فتعطيه مكافأة لأنه يبدو لطيفاً.
- طريقة EvidenceRL: الكلب يحصل على المكافأة فقط إذا جلس وأحضر لك الكرة المحددة التي طلبتها. إذا جلس وأحضر حذاءً، فلا توجد مكافأة.
3. كيف يتحقق المدرب من العمل (خدعة "التركيز ثم التحقق")
التحقق مما إذا كان الذكاء الاصطناعي يقول الحقيقة أمر صعب. إذا سألت: "هل هذه المقالة بأكملها صحيحة؟"، فسيكون السؤال غامضاً للغاية. قد يصيب الذكاء الاصطناعي في جملة واحدة ويخطئ في عشر جمل أخرى، وتصبح الدرجة باهتة وغير دقيقة.
ابتكر الباحثون خدعة ذكية تسمى التركيز ثم التحقق (Focus-Then-Verify):
- الاستعارة: تخيل محققاً ينظر إلى مسرح جريمة ضخم. بدلاً من محاولة التحقق من مسرح الجريمة بأكمله دفعة واحدة، يختار المحقق دليلاً واحداً محدداً (مثل أثر قدم طينية) ويسأل: "هل هذا الدليل المحدد يدعم رواية المشتبه به؟"
- الجانب التقني: يقوم النظام بتفكيك إجابة الذكاء الاصطناعي جملة بجملة. يأخذ جملة واحدة من الإجابة وقطعة واحدة من الأدلة (مثل تقرير طبي) ويسأل "قاضياً" متخصصاً (ذكاء اصطناعي أصغر): "هل هذا الدليل يثبت هذه الجملة؟"
- إذا كان الدليل يدعمها، يحصل الذكاء الاصطناعي على نقاط. وإذا اخترع الذكاء الاصطناعي حقيقة تتعارض مع الأدلة، فسيتم معاقبته بشدة.
4. النتائج: من "التخمين المحظوظ" إلى "القائم على الأدلة"
اختبرت الورقة هذا النظام في وظيفتين خطيرتين للغاية: التشخيص القلبي (أطباء القلب) والاستدلال القانوني (المحامون).
- قبل EvidenceRL: كان الذكاء الاصطناعي مثل المقامر. قد يصل إلى التشخيص الصحيح (التخمين المحظوظ)، لكنه لا يستطيع شرح لماذا باستخدام سجلات المريض الفعلية. كان غالباً يخمّن بناءً على الأنماط التي رآها من قبل.
- بعد EvidenceRL: أصبح الذكاء الاصطناعي محققاً.
- انخفاض الهلوسة: انخفض عدد الحقائق المختلقة بنحو 5 أضعاف.
- زيادة الأدلة: قفز عدد الإجابات المدعومة بالأدلة فعلياً من حوالي 32% إلى 61%.
- دقة أفضل: للمفارقة، من خلال إجبار الذكاء الاصطناعي على الالتزام بالحقائق، حصل بالفعل على إجابات أكثر صحة، وليس أقل.
5. لماذا يهم هذا؟
الخلاصة الأكثر أهمية هي أنه لا يمكنك مجرد "تصفية" الإجابات السيئة بعد أن يولدها الذكاء الاصطناعي. يجب عليك تغيير طريقة تفكير الذكاء الاصطناعي أثناء تعلمه.
- ضوابط وقت الاستنتاج (Inference-time controls) (مثل طلب "التفكير بعمق أكبر" من الذكاء الاصطناعي أو "التحقق من عمله" بعد أن يكتب) تشبه إخبار الكاذب بأن "يحاول أن يكون صادقاً" بعد أن يكون قد كذب بالفعل. هذا لا يعمل بشكل جيد.
- EvidenceRL يغير عقل الذكاء الاصطناعي أثناء التدريب. إنه يعلم الذكاء الاصطناعي أن الحقيقة لا تكون صالحة إلا إذا كان لها إيصال (دليل).
ملخص الاستعارة
فكر في الذكاء الاصطناعي كـ مرشد سياحي.
- الذكاء الاصطناعي القديم: المرشد يعرف المدينة جيداً ولكنه غالباً ما يختلق قصصاً عن المعالم السياحية ليبدو ممتعاً. السياح يشعرون بالارتباك والضياع.
- الذكاء الاصطناعي بنظام EvidenceRL: المرشد الآن ملزم بحمل خريطة والإشارة إلى المكان المحدد على الخريطة لكل قصة يرويها. إذا لم يستطع الإشارة إلى المكان، فلا يُسمح له برواية القصة.
النتيجة؟ الجولة لا تزال ممتعة وغنية بالمعلومات، لكنها الآن موثوقة. في مجالات مثل الطب والقانون، هذا النوع من الثقة هو الفرق بين قرار جيد وكارثة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.