K-FinHallu: A Hallucination Detection Benchmark for Multi-Turn RAG in Korean Finance
تقدم هذه الورقة البحثية K-FinHallu، وهو أول معيار اختبار مصمم للكشف عن الهلوسة في أنظمة التوليد المعزز بالاسترجاع متعددة الأدوار ضمن المجال المالي الكوري، مما يكشف أن حتى النماذج اللغوية الكبيرة المتقدمة تعاني في عمليات التشخيص دقيقة التفاصيل والامتناع المبرر.
المؤلفون الأصليون:Eunbyeol Cho, Yunseung Lee, Mirae Kim, Jeewon Yang, Youngjun Kwak, Edward Choi
تخيل أنك وظفت مساعداً ذكياً جداً ومطلعاً للإجابة على أسئلتك حول حسابك البنكي، أو القروض، أو الضرائب. لقد أعطيته مجموعة من الوثائق المصرفية الرسمية ليقرأها أولاً. عادةً، يقوم بعمل رائع. لكن في بعض الأحيان، يزداد ثقةً ويبدأ في اختلاق أشياء من خياله، أو يخلط بين الأرقام، أو يتجاهل الوثائق تماماً. في عالم التمويل، يمكن لرقم واحد مخترع أن يكلف شخصاً ما مدخرات حياته بالكامل.
تقدم هذه الورقة البحثية K-FinHallu، وهو في الأساس بمثابة صالة ألعاب رياضية للتدريب واختبار نهائي مصمم لتعليم الحواسيب كيفية اكتشاف متى يكون "مساعد المال" الخاص بهم يكذب أو يرتكب أخطاء. لقد تم بناؤه خصيصاً للمحادثات المالية باللغة الكورية، والتي لها قواعدها الفريدة وسماتها اللغوية الخاصة التي تغفل عنها الاختبارات الأخرى.
المشكلة: لماذا تفشل الاختبارات الحالية؟
يقول المؤلفون إن الاختبارات الحالية لـ "هلوسة" الذكاء الاصطناعي (اختلاق المعلومات) تشبه اختبارات القيادة التي تُجرى فقط على طرق سريعة مستقيمة وخالية من الزحام في بلدان ناطقة بالإنجليزية. فهي لا تهيئ الذكاء الاصطناعي لـ:
المحادثات الطويلة: العمل المصرفي الحقيقي ليس مجرد سؤال وجواب واحد. بل هو دردشة حيث تقول: "كم يبلغ قرضي؟" ثم لاحقاً: "هل يمكنني سداد ذلك مبكراً؟". يجب على الذكılığı أن يتذكر إلى ماذا يشير لفظ "ذلك". الاختبارات الحالية تركز غالباً على أسئلة منفصلة ومعزولة.
القواعد المالية الكورية: تمتلك كوريا أنظمة مالية فريدة (مثل نوع محدد من الودائع الإيجارية يسمى Jeonse) ولغة قانونية معقدة. ترجمة اختبار أمريكي لن ينجح لأن القواعد والكلمات مختلفة تماماً.
الحل: بناء "دردشة بنكية مزيفة"
قام الفريق ببناء معيار جديد يسمى K-FinHallu. وإليكم كيف صنعوه:
المادة المصدرية: أخذوا وثائق مالية كورية رسمية وحقيقية (مثل قوانين من هيئة الرقابة المالية).
الدردشة "الجيدة": استخدموا الذكاء الاصطناعي لمحاكاة محادثة مثالية بين عميل وموظف بنك، حيث يجيب الموظف على كل سؤال بشكل صحيح بناءً فقط على الوثائق.
الحقن "السيئ" (الخدعة): هذا هو الجزء الذكي. قاموا بتفكيك الإجابات المثالية بشكل منهجي لإنشاء "هلوسات". لم يكتفوا بحذف الكلمات فحسب؛ بل صنعوا أخطاءً دقيقة وخطيرة، مثل:
خدعة "الرقم الخاطئ": تغيير سعر فائدة القرض من 3% إلى 4%.
خدعة "الكلمة الخاطئة": استبدال "قرض مضمون" (مدعوم بمنزل) بـ "قرض غير مضمون" (بدون ضمانات).
خدعة "الإجابة الشبحية": الإجابة على سؤال بينما تقول الوثائق في الواقع: "ليس لدينا معلومات كافية للإجابة على هذا".
خدعة "الرفض": قول "لا يمكنني الإجابة على ذلك" بينما تحتوي الوثائق بوضوح على الإجابة.
لقد نظموا هذه الأخطاء في تصنيف (شجرة عائلة للأخطاء) لمعرفة كيف فشل الذكاء الاصطناعي بالضبط.
التجربة: من هو أفضل محقق؟
أخذ الباحثون أكثر نماذج الذكاء الاصطناي تقدماً في العالم (مثل GPT-5، وGemini، وLlama) وطلبوا منهم لعب دور مفتش مراقبة الجودة. كانت مهمتهم هي النظر في جولة من الدردشة وقول: "هل هذه الإجابة كذبة؟" أو "هل هذه الإجابة صادقة؟".
النتائج:
النماذج الكبيرة تعاني: حتى نماذج الذكاء الاصطناعي الأكثر قوة وتكلفة واجهت صعوبة. كانت جيدة في اكتشاف الأكاذيب الواضحة، لكنها كانت سيئة جداً في اكتشاف الأخطاء المالية الدقيقة أو معرفة متى تقول: "لا أعرف".
مشكلة "الرفض": كان الجزء الأصعب لجميع النماذج هو الامتناع المبرر. وهو القدرة على قول: "لا يمكنني الإجابة على هذا لأن الوثائق لا تذكر ذلك". حاولت معظم النماذج التخمين على أي حال، وهو أمر خطير في التمويل.
مفاجأة النموذج الصغير: أخذ الباحثون نموذجاً أصغر مفتوح المصدر (Qwen3-8B) وأعطوه "ورقة غش" (مجموعة تدريب تحتوي على تفسيرات لسبب كون الإجابة صحيحة أو خاطئة). بعد هذا التدريب، أصبح هذا النموذج الصغير أفضل من النماذج العملاقة والمكلفة في اكتشاف هذه الأكاذيب المالية المحددة.
النتائج الرئيسية
السياق هو الملك: في التمويل، لا يمكنك مجرد النظر إلى جملة واحدة. يجب عليك النظر إلى تاريخ المحادثة بأكمله والوثائق المحددة المقدمة.
الدقة في التفاصيل مهمة: الهلوسات الأكثر خطورة ليست الاختراعات الجامحة؛ بل هي التغييرات الطفيفة في الأرقام أو المصطلحات القانونية التي تبدو صحيحة ولكنها خاطئة.
معرفة ما لا تعرفه: أهم مهارة للذكاء الاصطناعي المالي ليست مجرد الإجابة بشكل صحيح؛ بل هي معرفة متى يجب الصمت لأن الأدلة غير موجودة. حالياً، معظم أنظمة الذكاء الاصطناعي متحمسة جداً للكلام.
ما لم يدّعوه
لم يقولوا إن هذا النظام مستخدم حالياً في البنوك الحقيقية لمنع الاحتيال.
لم يدّعوا أن هذا يحل جميع مشايات الذكاء الاصطناعي في الرعاية الصحية أو القانون (فقط التمويل).
لم يقولوا إن النموذج الصغير مثالي؛ بل قالوا فقط إنه قدم أداءً جيداً بشكل مفاجئ مقارنة بالعمالقة.
باختصار، K-FinHallu هو بمثابة "اختبار قيادة" متخصص للذكاء الاصطناعي في القطاع المالي الكوري، يكشف أن حتى السيارات الأكثر ذكاءً (نماذج الذكاء الاصطناعي) تحتاج إلى تدريب محدد للتنقل في الطرق الضيقة والمتعرجة للوائح المالية دون الاصطدام.
ملخص تقني: K-FinHallu
بيان المشكلة
بينما حققت النماذج اللغوية الكبيرة (LLMs) تقدماً في الأتمتة المالية من خلال التوليد المعزز بالاسترجاع (RAG)، لا تزال الهلوسة تشكل عائقاً حرجاً أمام النشر في البيئات المالية عالية المخاطر. تعاني معايير قياس كشف الهلوسة الحالية من فجوتين رئيسيتين عند تطبيقها على الخدمات المالية في العالم الحقيقي:
محدودية الدور الواحد (Single-Turn): تركز معظم معايير القياس على مهام الدور الواحد، مما يفشل في استيعاب تعقيدات الحوارات متعددة الأدوار حيث تنشأ الهلوسة من فشل تتبع السياق، أو أخطاء حل الإحالة (anaphora resolution)، أو عدم الاتساق المنطقي مع الأدوار السابقة.
الفجوات اللغوية والتنظيمية: تهيمن على مجموعات البيانات الحالية اللغة الإنجليزية والمؤسسات الغربية، متجاهلةً الفروق الدقيقة الفريدة للمجال المالي الكوري. ويشمل ذلك الأطر التنظيمية المحددة (مثل نظام تأجير "Jeonse")، والتركيب الصرفي التجميعي (agglutinative morphology)، والمصطلحات التقنية الصينية-الكورية متعددة المعاني التي لا يمكن معالجتها عبر الترجمة البسيطة.
وبناءً على ذلك، هناك نقص في أطر التقييم الصارمة للكشف عن الهلوسة الخاصة بالمجال في أنظمة RAG الكورية متعددة الأدوار، لا سيما فيما يتعلق بـ "الامتناع المبرر" (معرفة متى يجب عدم الإجابة).
المنهجية
يقدم المؤلفون K-FinHallu، وهو أول معيار لكشف الهلوسة في نظام RAG المالي الكوري متعدد الأدوار، والذي تم بناؤه من وثائق مالية كورية أصلية.
بناء مجموعة البيانات
المتن المصدر: بُنيت مجموعة البيانات على "مجموعة فهم القراءة الآلية للوثائق المالية والقانونية الكورية" من AI-Hub، بعد تصفيتها للفئات المالية. ولمنع تسرب البيانات، تم استخراج مجموعة الاختبار من هيئة الرقابة المالية (FSS) ووكالة المستهلك الكورية، بينما استخدمت مجموعة التدريب مؤسسات منفصلة.
توليد حوار أمين: يقوم مسار عمل (pipeline) باستخدام GPT-4o بمحاكاة حوارات متعددة الأدوار (4-8 أدوار) بين مستخدم ومساعد. يقوم المساعد بتوليد استجابات تستند بدقة إلى النصوص الذهبية والنصوص الإرشادية من الوثائق المصدرية. يتضمن مسار العمل أدوار "إعادة التأكيد" لاختبار تتبع السياق.
محاكاة الاسترجاع: لعزل كشف الهلوسة عن أخطاء الاسترجاع، يقوم النظام بمحاكاة RAG من خلال توفير سياقات استرجاع محكومة (Pn).
سيناريوهات قابلة للإجابة: تحتوي Pn على النص الذهبي.
سيناريوهات غير قابلة للإجابة: تتكون Pn بالكامل من "سلبيات صعبة" (passages متشابهة دلالياً ولكنها تفتقر إلى الإجابة).
حقن الهلوسة: يقوم مسار عمل مؤتمت بحقن هلوسات دقيقة في الحوارات الأمينة بناءً على تصنيف هرمي مقترح. تشمل الاستراتيجيات تعديلات طفيفة (مثل تبديل المصطلحات المالية، أو تغيير الأرقام/المعدلات) للحفاظ على الطبيعية مع إدخال أخطاء حرجة. تم استخدام مصدرين للحقن (GPT-4o و Gemini-2.5-Flash) لتقليل الآثار الناتجة عن نماذج محددة.
ضبط الجودة: تخضع الحوارات والهلوسات المحقونة لعملية تصفية صارمة عبر "النموذج كحكم" (LLM-as-a-judge) والتدوين البشري، مما يضمن توافقاً عالياً (Gwet's AC1 > 0.70) على معايير مثل القدرة على الإجابة، والمعقولية، والطبيعية.
تصنيف الهلوسة
يقترح البحث تصنيفاً يعتمد على قابلية الإجابة في السياق:
السيناريوهات القابلة للإجابة:
متناقض (Contradictory): الاستجابة تتعارض مع السياق أو تاريخ الحوار.
غير قابل للتحقق (Unverifiable): تتضمن الاستجابة ادعاءات خارجية غير مدعومة بالسياق.
غير ذي صلة (Irrelevance): الاستجابة غير متصلة منطقياً بنية المستخدم.
الرفض الخاطئ (False Refusal): يرفض النموذج الإجابة رغم وجود أدلة كافية.
السيناريوهات غير القابلة للإجابة:
القبول الخاطئ (False Acceptance): يقدم النموذج إجابة رغم افتقاره للأدلة.
الرفض الحقيقي (True Refusal): يمتنع النموذج بشكل صحيح (السلوك المرغوب).
المساهمات الرئيسية
معيار K-FinHallu: إصدار أول معيار لكشف الهلوسة متعدد الأدوار لـ RAG المالي الكوري، مبني على وثائق أصلية ويغطي مجالات مالية متنوعة (مثل الاقتصاد المالي، والتأمين).
التصنيف الهرمي: تصنيف مبتكر يأخذ في الاعتبار صراحةً الامتناع المبرر في الحوارات متعددة الأدوار، ويميز بين "الرفض الخاطئ" و"الرفض الحقيقي".
مسار بناء قابل للتوسع: إثبات أن مسار الحقن يمكنه توليد تقسيم تدريبي تلقائياً، مما يسمح بضبط النماذج الأصغر (8B) لتضاهي أو تتفوق على النماذج اللغوية الرائدة.
النتائج التجريبية
قام المؤلفون باختبار النماذج اللغوية الكبيرة الرائدة والمفتوحة المصدر (بما في ذلك GPT-5، Gemini-2.5، Llama-3، Qwen3، والنماذج المتمحورة حول كوريا) ككواشف للهلوسة.
الكشف الثنائي: تصدرت النماذج المغلقة المصدر الأداء، حيث حقق Gemini-2.5-Flash أعلى درجة F1 (0.860). أظهرت النماذج مفتوحة المصدر مثل Qwen3-32B (F1 0.732) أداءً تنافسياً، بينما تأخرت النماذج المتمحورة حول كوريا عن نظيراتها العالمية من نفس الحجم.
الكشف متعدد الفئات: انخفض الأداء بشكل كبير عند الانتقال من الكشف الثنائي إلى التشخيص متعدد الفئات (تحديد نوع الهلوسة المحدد). حتى أقوى النماذج واجهت صعوبة في التشخيصات دقيقة التفاصيل.
سلوك الرفض: ظل "الامتناع المبرر" هو المحور الأضعف في جميع النماذج. فشلت معظم النماذج الأساسية في التمييز بين الرفض الحقيقي والخاطئ، وغالباً ما كانت تتنبأ بنوع واحد حصرياً.
تأثير الضبط الدقيق (Fine-Tuning): حقق ضبط نموذج 8B (Qwen3-8B) باستخدام الإشراف بالتعليل (تدريب النموذج على إخراج مسار استدلال قبل الملصق/Label) دقة إجمالية بلغت 0.896، متفوقاً على جميع النماذج الأساسية، بما في ذلك GPT-5 (0.855). حسن هذا النهج بشكل كبير دقة كشف الهلوسة (من 0.446 إلى 0.864).
تحليل الأنواع الفرعية: ظل "سوء فهم المصطلحات المالية" عائقاً رئيسياً، حيث أظهر تحسناً طفيفاً حتى مع زيادة أحجام النماذج (حتى 32B)، مما يشير إلى الحاجة إلى خبرة معرفية أعمق تتجاوز المطابقة المعجمية.
الأهمية والادعاءات
يدعي البحث أن K-FinHallu يعالج فجوة حرجة في تقييم الذكاء الاصطناعي المالي، وتحديداً الحاجة إلى معايير متعددة الأدوار، دقيقة لغوياً، وواعية تنظيمياً. ويؤكد المؤلفون أن:
الامتناع المبرر أمر بالغ الأهمية: القدرة على رفض الإجابة بشكل صحيح عند غياب الأدلة هي بُعد حيوي ولكنه لم يحظَ بالتقييم الكافي في أنظمة RAG المالية.
النماذج الصغيرة يمكنها المنافسة: مع الإشراف بالتعليل، يمكن لنموذج 8B مضبوط بدقة أن يحقق أداءً تنافسياً أو متفوقاً على النماذج الرائدة، مما يوفر مساراً عملياً لتطوير كواشف مفتوحة المصدر.
الخصوصية النوعية للمجال مهمة: إن استمرار الأخطاء في فهم المصطلحات المالية يسلط الضوء على أن قوانين التوسع العامة لا تحل تلقائياً التحولات الدلالية الخاصة بالمجال في المصطلحات المالية الكورية.
يعمل هذا العمل كاختبار جهد للنماذج اللغوية الكبيرة الحالية، كاشفاً أن حتى النماذج الأكثر تطوراً تعاني مع التشخيصات دقيقة التفاصيل وسلوكيات الرفض المطلوبة للنشر الموثوق في البيئات المالية عالية المخاطر.