← नवीनतम पेपर
🤖 machine learning

K-FinHallu: A Hallucination Detection Benchmark for Multi-Turn RAG in Korean Finance

यह शोध पत्र K-FinHallu को प्रस्तुत करता है, जो कोरियाई वित्तीय डोमेन के भीतर मल्टी-टर्न रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम में मतिभ्रम (hallucinations) का पता लगाने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह प्रकट करता है कि उन्नत लार्ज लैंग्वेज मॉडल भी सूक्ष्म निदान और न्यायसंगत परित्याग (justified abstention) में संघर्ष करते हैं।

मूल लेखक: Eunbyeol Cho, Yunseung Lee, Mirae Kim, Jeewon Yang, Youngjun Kwak, Edward Choi

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eunbyeol Cho, Yunseung Lee, Mirae Kim, Jeewon Yang, Youngjun Kwak, Edward Choi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ K-FinHallu पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी तस्वीर: पैसों की बातचीत के लिए एक "झूठ पकड़ने वाला यंत्र" (Lie Detector)

कल्पना कीजिए कि आपने अपने बैंक खाते, ऋण (loans), या टैक्स के बारे में सवालों के जवाब देने के लिए एक बहुत ही बुद्धिमान और जानकार सहायक को काम पर रखा है। आप उन्हें सबसे पहले पढ़ने के लिए आधिकारिक बैंक दस्तावेजों का एक ढेर देते हैं। आमतौर पर, वे बहुत अच्छा काम करते हैं। लेकिन कभी-कभी, वे बहुत आत्मविश्वासी हो जाते हैं और अपनी ओर से बातें बनाने लगते हैं, नंबरों को मिला देते हैं, या दस्तावेजों को पूरी तरह से अनदेखा कर देते हैं। वित्त (finance) की दुनिया में, एक गलत नंबर भी किसी की जीवन भर की जमापूंजी को नुकसान पहुँचा सकता है।

यह पेपर K-FinHallu पेश करता है, जो मूल रूप से एक प्रशिक्षण जिम (training gym) और एक टेस्ट एग्जाम है, जिसे कंप्यूटर को यह सिखाने के लिए बनाया गया है कि उनका "मनी असिस्टेंट" कब झूठ बोल रहा है या गलतियाँ कर रहा है। इसे विशेष रूप से कोरियाई (Korean) वित्तीय बातचीत के लिए बनाया गया है, जिनके अपने अनूठे नियम और भाषाई बारीकियां हैं जिन्हें अन्य परीक्षण पकड़ नहीं पाते।

समस्या: वर्तमान परीक्षण क्यों विफल होते हैं?

लेखकों का कहना है कि AI "हलुसिनेशन" (अपनी ओर से बातें बनाना) के मौजूदा परीक्षण उन ड्राइविंग टेस्ट की तरह हैं जो केवल अंग्रेजी बोलने वाले देशों के खाली, सीधे राजमार्गों पर किए जाते हैं। वे AI को इनके लिए तैयार नहीं करते:

  1. लंबी बातचीत: वास्तविक बैंकिंग केवल एक सवाल और एक जवाब नहीं है। यह एक चैट है जहाँ आप कहते हैं, "मेरा लोन कितना है?" और फिर बाद में, "क्या मैं उसे समय से पहले चुका सकता हूँ?" AI को याद रखना होगा कि "उसे" का संदर्भ क्या है। वर्तमान परीक्षण ज्यादातर एकल, अलग-अलग सवालों पर ध्यान केंद्रित करते हैं।
  2. कोरियाई मनी रूल्स: कोरिया में अनूठी वित्तीय प्रणालियाँ हैं (जैसे कि Jeonse नामक एक विशिष्ट प्रकार का रेंटल डिपॉजिट) और जटिल कानूनी भाषा है। अमेरिकी टेस्ट का अनुवाद करना काम नहीं आता क्योंकि नियम और शब्द पूरी तरह से अलग होते हैं।

समाधान: एक "नकली बैंक चैट" बनाना

टीम ने एक नया बेंचमार्क बनाया जिसे K-FinHallu कहा जाता है। उन्होंने इसे इस प्रकार बनाया:

  1. स्रोत सामग्री (The Source Material): उन्होंने वास्तविक, आधिकारिक कोरियाई वित्तीय दस्तावेजों (जैसे वित्तीय सेवा आयोग के कानून) को लिया।
  2. "अच्छी" चैट: उन्होंने AI का उपयोग करके एक ग्राहक और बैंक एजेंट के बीच एक आदर्श बातचीत का अनुकरण किया, जहाँ एजेंट केवल दस्तावेजों के आधार पर हर सवाल का सही जवाब देता है।
  3. "बुरी" इंजेक्शन (The Trick): यह सबसे चतुर हिस्सा है। उन्होंने सटीक उत्तरों को व्यवस्थित रूप से बिगाड़ा ताकि "हलुसिनेशन" पैदा किए जा सकें। उन्होंने केवल शब्द नहीं हटाए; उन्होंने सूक्ष्म और खतरनाक गलतियाँ कीं, जैसे:
    • "गलत नंबर" का तरीका: ऋण की ब्याज दर को 3% से बदलकर 4% कर देना।
    • "गलत शब्द" का तरीका: "सुरक्षित ऋण" (जो घर द्वारा समर्थित है) को "असुरक्षित ऋण" (बिना किसी गारंटी के) से बदल देना।
    • "भूतिया उत्तर" (Ghost Answer) का तरीका: एक ऐसे सवाल का जवाब देना जब दस्तावेजों में वास्तव में लिखा था, "हमारे पास इसका उत्तर देने के लिए पर्याप्त जानकारी नहीं है।"
    • "मना करने" का तरीका: यह कहना कि "मैं इसका उत्तर नहीं दे सकता" जबकि दस्तावेजों में स्पष्ट रूप से उत्तर मौजूद था।

उन्होंने इन गलतियों को एक टैक्सोनॉमी (गलतियों का वंशवृक्ष) में व्यवस्थित किया ताकि यह देखा जा सके कि AI वास्तव में कैसे विफल हुआ।

प्रयोग: सबसे अच्छा जासूस कौन है?

शोधकर्ताओं ने दुनिया के सबसे उन्नत AI मॉडल (जैसे GPT-5, Gemini, और Llama) को लिया और उनसे क्वालिटी कंट्रोल इंस्पेक्टर की भूमिका निभाने को कहा। उनका काम एक चैट टर्न को देखना और यह कहना था, "क्या यह उत्तर एक झूठ है?" या "क्या यह उत्तर ईमानदार है?"

परिणाम:

  • बड़े मॉडल संघर्ष करते हैं: यहाँ तक कि सबसे शक्तिशाली, महंगे AI मॉडलों को भी कठिनाई हुई। वे स्पष्ट झूठ पकड़ने में अच्छे थे लेकिन सूक्ष्म वित्तीय त्रुटियों को पकड़ने या यह जानने में बहुत खराब थे कि कब कहना है, "मुझे नहीं पता।"
  • "मना करने" की समस्या: सभी मॉडलों के लिए सबसे कठिन हिस्सा था जस्टिफाइड एब्स्टेंशन (Justified Abstention)। यह कहने की क्षमता कि, "मैं इसका उत्तर नहीं दे सकता क्योंकि दस्तावेजों में यह नहीं दिया गया है।" अधिकांश मॉडलों ने फिर भी अनुमान लगाने की कोशिश की, जो वित्त में खतरनाक है।
  • छोटे मॉडल का सरप्राइज: शोधकर्ताओं ने एक छोटे, ओपन-सोर्स मॉडल (Qwen3-8B) को लिया और उसे एक "चीट शीट" (एक प्रशिक्षण सेट जिसमें यह समझाया गया था कि कोई उत्तर क्यों सही या गलत था) दी। इस प्रशिक्षण के बाद, यह छोटा मॉडल इन विशिष्ट वित्तीय झूठों को पकड़ने में विशाल, महंगे मॉडलों से बेहतर बन गया।

मुख्य निष्कर्ष

  • संदर्भ ही राजा है (Context is King): वित्त में, आप केवल एक वाक्य को नहीं देख सकते। आपको पूरी बातचीत के इतिहास और दिए गए विशिष्ट दस्तावेजों को देखना होगा।
  • सूक्ष्मता मायने रखती है: सबसे खतरनाक हलुसिनेशन बेतुकी कल्पनाएँ नहीं हैं; वे नंबरों या कानूनी शब्दों में किए गए छोटे बदलाव हैं जो सही लगते हैं लेकिन गलत होते हैं।
  • यह जानना कि आप क्या नहीं जानते: वित्तीय AI के लिए सबसे महत्वपूर्ण कौशल केवल सही उत्तर देना नहीं है; बल्कि यह जानना है कि कब चुप रहना है क्योंकि साक्ष्य मौजूद नहीं हैं। वर्तमान में, अधिकांश AI बहुत अधिक बोलने के लिए उत्सुक रहते हैं।

उन्होंने क्या दावा नहीं किया

  • उन्होंने यह नहीं कहा कि यह सिस्टम धोखाधड़ी रोकने के लिए वास्तविक बैंकों में तैनात किया गया है।
  • उन्होंने यह दावा नहीं किया कि यह स्वास्थ्य सेवा या कानून की सभी समस्याओं को हल करता है (केवल वित्त)।
  • उन्होंने यह नहीं कहा कि छोटा मॉडल पूर्ण है; उन्होंने केवल यह कहा कि इसने दिग्गजों की तुलना में आश्चर्यजनक रूप से अच्छा प्रदर्शन किया।

संक्षेप में, K-FinHallu कोरियाई वित्तीय क्षेत्र में AI के लिए एक विशेष "ड्राइविंग टेस्ट" है, जो यह प्रकट करता है कि भले ही सबसे स्मार्ट कारें (AI मॉडल) हों, उन्हें वित्तीय नियमों की कठिन और संकरी सड़कों पर बिना दुर्घटना के चलने के लिए विशिष्ट प्रशिक्षण की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →