← أحدث الأبحاث
🤖 machine learning

K-FinHallu: A Hallucination Detection Benchmark for Multi-Turn RAG in Korean Finance

تقدم هذه الورقة البحثية K-FinHallu، وهو أول معيار اختبار مصمم للكشف عن الهلوسة في أنظمة التوليد المعزز بالاسترجاع متعددة الأدوار ضمن المجال المالي الكوري، مما يكشف أن حتى النماذج اللغوية الكبيرة المتقدمة تعاني في عمليات التشخيص دقيقة التفاصيل والامتناع المبرر.

المؤلفون الأصليون: Eunbyeol Cho, Yunseung Lee, Mirae Kim, Jeewon Yang, Youngjun Kwak, Edward Choi

نُشر 2026-05-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Eunbyeol Cho, Yunseung Lee, Mirae Kim, Jeewon Yang, Youngjun Kwak, Edward Choi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

الصورة الكبيرة: "جهاز كشف كذب" للحديث عن المال

تخيل أنك وظفت مساعداً ذكياً جداً ومطلعاً للإجابة على أسئلتك حول حسابك البنكي، أو القروض، أو الضرائب. لقد أعطيته مجموعة من الوثائق المصرفية الرسمية ليقرأها أولاً. عادةً، يقوم بعمل رائع. لكن في بعض الأحيان، يزداد ثقةً ويبدأ في اختلاق أشياء من خياله، أو يخلط بين الأرقام، أو يتجاهل الوثائق تماماً. في عالم التمويل، يمكن لرقم واحد مخترع أن يكلف شخصاً ما مدخرات حياته بالكامل.

تقدم هذه الورقة البحثية K-FinHallu، وهو في الأساس بمثابة صالة ألعاب رياضية للتدريب واختبار نهائي مصمم لتعليم الحواسيب كيفية اكتشاف متى يكون "مساعد المال" الخاص بهم يكذب أو يرتكب أخطاء. لقد تم بناؤه خصيصاً للمحادثات المالية باللغة الكورية، والتي لها قواعدها الفريدة وسماتها اللغوية الخاصة التي تغفل عنها الاختبارات الأخرى.

المشكلة: لماذا تفشل الاختبارات الحالية؟

يقول المؤلفون إن الاختبارات الحالية لـ "هلوسة" الذكاء الاصطناعي (اختلاق المعلومات) تشبه اختبارات القيادة التي تُجرى فقط على طرق سريعة مستقيمة وخالية من الزحام في بلدان ناطقة بالإنجليزية. فهي لا تهيئ الذكاء الاصطناعي لـ:

  1. المحادثات الطويلة: العمل المصرفي الحقيقي ليس مجرد سؤال وجواب واحد. بل هو دردشة حيث تقول: "كم يبلغ قرضي؟" ثم لاحقاً: "هل يمكنني سداد ذلك مبكراً؟". يجب على الذكılığı أن يتذكر إلى ماذا يشير لفظ "ذلك". الاختبارات الحالية تركز غالباً على أسئلة منفصلة ومعزولة.
  2. القواعد المالية الكورية: تمتلك كوريا أنظمة مالية فريدة (مثل نوع محدد من الودائع الإيجارية يسمى Jeonse) ولغة قانونية معقدة. ترجمة اختبار أمريكي لن ينجح لأن القواعد والكلمات مختلفة تماماً.

الحل: بناء "دردشة بنكية مزيفة"

قام الفريق ببناء معيار جديد يسمى K-FinHallu. وإليكم كيف صنعوه:

  1. المادة المصدرية: أخذوا وثائق مالية كورية رسمية وحقيقية (مثل قوانين من هيئة الرقابة المالية).
  2. الدردشة "الجيدة": استخدموا الذكاء الاصطناعي لمحاكاة محادثة مثالية بين عميل وموظف بنك، حيث يجيب الموظف على كل سؤال بشكل صحيح بناءً فقط على الوثائق.
  3. الحقن "السيئ" (الخدعة): هذا هو الجزء الذكي. قاموا بتفكيك الإجابات المثالية بشكل منهجي لإنشاء "هلوسات". لم يكتفوا بحذف الكلمات فحسب؛ بل صنعوا أخطاءً دقيقة وخطيرة، مثل:
    • خدعة "الرقم الخاطئ": تغيير سعر فائدة القرض من 3% إلى 4%.
    • خدعة "الكلمة الخاطئة": استبدال "قرض مضمون" (مدعوم بمنزل) بـ "قرض غير مضمون" (بدون ضمانات).
    • خدعة "الإجابة الشبحية": الإجابة على سؤال بينما تقول الوثائق في الواقع: "ليس لدينا معلومات كافية للإجابة على هذا".
    • خدعة "الرفض": قول "لا يمكنني الإجابة على ذلك" بينما تحتوي الوثائق بوضوح على الإجابة.

لقد نظموا هذه الأخطاء في تصنيف (شجرة عائلة للأخطاء) لمعرفة كيف فشل الذكاء الاصطناعي بالضبط.

التجربة: من هو أفضل محقق؟

أخذ الباحثون أكثر نماذج الذكاء الاصطناي تقدماً في العالم (مثل GPT-5، وGemini، وLlama) وطلبوا منهم لعب دور مفتش مراقبة الجودة. كانت مهمتهم هي النظر في جولة من الدردشة وقول: "هل هذه الإجابة كذبة؟" أو "هل هذه الإجابة صادقة؟".

النتائج:

  • النماذج الكبيرة تعاني: حتى نماذج الذكاء الاصطناعي الأكثر قوة وتكلفة واجهت صعوبة. كانت جيدة في اكتشاف الأكاذيب الواضحة، لكنها كانت سيئة جداً في اكتشاف الأخطاء المالية الدقيقة أو معرفة متى تقول: "لا أعرف".
  • مشكلة "الرفض": كان الجزء الأصعب لجميع النماذج هو الامتناع المبرر. وهو القدرة على قول: "لا يمكنني الإجابة على هذا لأن الوثائق لا تذكر ذلك". حاولت معظم النماذج التخمين على أي حال، وهو أمر خطير في التمويل.
  • مفاجأة النموذج الصغير: أخذ الباحثون نموذجاً أصغر مفتوح المصدر (Qwen3-8B) وأعطوه "ورقة غش" (مجموعة تدريب تحتوي على تفسيرات لسبب كون الإجابة صحيحة أو خاطئة). بعد هذا التدريب، أصبح هذا النموذج الصغير أفضل من النماذج العملاقة والمكلفة في اكتشاف هذه الأكاذيب المالية المحددة.

النتائج الرئيسية

  • السياق هو الملك: في التمويل، لا يمكنك مجرد النظر إلى جملة واحدة. يجب عليك النظر إلى تاريخ المحادثة بأكمله والوثائق المحددة المقدمة.
  • الدقة في التفاصيل مهمة: الهلوسات الأكثر خطورة ليست الاختراعات الجامحة؛ بل هي التغييرات الطفيفة في الأرقام أو المصطلحات القانونية التي تبدو صحيحة ولكنها خاطئة.
  • معرفة ما لا تعرفه: أهم مهارة للذكاء الاصطناعي المالي ليست مجرد الإجابة بشكل صحيح؛ بل هي معرفة متى يجب الصمت لأن الأدلة غير موجودة. حالياً، معظم أنظمة الذكاء الاصطناعي متحمسة جداً للكلام.

ما لم يدّعوه

  • لم يقولوا إن هذا النظام مستخدم حالياً في البنوك الحقيقية لمنع الاحتيال.
  • لم يدّعوا أن هذا يحل جميع مشايات الذكاء الاصطناعي في الرعاية الصحية أو القانون (فقط التمويل).
  • لم يقولوا إن النموذج الصغير مثالي؛ بل قالوا فقط إنه قدم أداءً جيداً بشكل مفاجئ مقارنة بالعمالقة.

باختصار، K-FinHallu هو بمثابة "اختبار قيادة" متخصص للذكاء الاصطناعي في القطاع المالي الكوري، يكشف أن حتى السيارات الأكثر ذكاءً (نماذج الذكاء الاصطناعي) تحتاج إلى تدريب محدد للتنقل في الطرق الضيقة والمتعرجة للوائح المالية دون الاصطدام.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →