KGHaluBench: A Knowledge Graph-Based Hallucination Benchmark for Evaluating the Breadth and Depth of LLM Knowledge
यह शोध पत्र KGHaluBench प्रस्तुत करता है, जो एक नवीन नॉलेज ग्राफ-आधारित बेंचमार्क है जो बहुआयामी प्रश्नों को गतिशील रूप से उत्पन्न करता है और 25 फ्रंटियर लार्ज लैंग्वेज मॉडल्स की व्यापकता, गहराई और सत्यता का व्यापक मूल्यांकन करने के लिए एक स्वचालित सत्यापन पाइपलाइन का उपयोग करता है, जिससे भ्रम (hallucinations) को प्रेरित करने वाले कारकों के बारे में गहरी अंतर्दृष्टि प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, सुशिक्षित छात्र है जिसका नाम "द एआई" (The AI) है। यह छात्र सुंदर निबंध लिख सकता है, दिलचस्प कहानियाँ सुना सकता है, और अविश्वसनीय रूप से आत्मविश्वासी लग सकता है। लेकिन एक पेच है: एआई कभी-कभी चीजें बना देता है। यह आत्मविश्वास के साथ आपको बता सकता है कि चंद्रमा पनीर से बना है या किसी प्रसिद्ध अभिनेता का जन्म अलग शताब्दी में हुआ था। इसे "हलुसिनेशन" (hallucination - भ्रम) कहा जाता है।
लंबे समय से, हमने इस छात्र को मानक क्विज़ के साथ परखने की कोशिश की है। लेकिन उन क्विज़ में दो बड़ी समस्याएँ हैं:
- वे स्थिर (static) हैं: प्रश्न हर बार एक जैसे होते हैं, इसलिए छात्र अंततः उत्तर याद कर लेता है बजाय इसके कि वह वास्तव में तथ्यों को जाने।
- वे उथले (shallow) हैं: वे आमतौर पर सरल "X कौन है?" जैसे प्रश्न पूछते हैं, जो यह नहीं परखते कि क्या छात्र वास्तव में विषय की गहराई को समझता है।
इस शोध पत्र के लेखकों ने एक नया, अधिक स्मार्ट परीक्षण सिस्टम बनाया है जिसे KGHaluBench कहा जाता है। इसे एक गतिशील, अनंत ट्रिविया गेम के रूप में सोचें जो हर बार खेलने पर बदल जाता है।
यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:
1. अनंत पुस्तकालय (द नॉलेज ग्राफ)
प्रश्नों की एक निश्चित सूची के बजाय, शोधकर्ताओं ने अपने परीक्षण को एक विशाल डिजिटल लाइब्रेरी से जोड़ा है जिसे नॉलेज ग्राफ (Knowledge Graph) कहा जाता है (एक विशाल, परस्पर जुड़े हुए मानचित्र की तरह जो दुनिया के सभी तथ्यों को दर्शाता है, जो विकिपीडिया के समान है लेकिन कंप्यूटरों के लिए संरचित है)।
- उपमा: एक गेम शो की कल्पना करें जहाँ होस्ट स्क्रिप्ट से प्रश्न नहीं चुनता। इसके बजाय, वे पूरे विश्व में से किसी भी व्यक्ति, स्थान या वस्तु को चुनने के लिए एक विशाल पहिया घुमाते हैं। फिर, वे एआई को उस विशिष्ट चीज़ के बारे में एक कहानी बताने के लिए कहते हैं, जिसमें तीन विशिष्ट विवरण शामिल हों (जैसे "उनका जन्म कहाँ हुआ?", "उनका काम क्या है?", और "उनके बच्चे कौन हैं?")।
- ट्विस्ट: क्योंकि पहिया रैंडम तरीके से घूमता है, एआई उत्तरों को रट नहीं सकता। उसे वास्तव में जानकारी को जानना होगा।
2. "डिफिकल्टी डायल" (सेलिब्रिटी बायस से बचना)
रैंडम पहियों के साथ एक समस्या है: वे "टेलर स्विफ्ट" (बहुत प्रसिद्ध) या "1924 की एक विशिष्ट पेंटिंग" (बहुत अल्पज्ञात) पर रुक सकते हैं।
- यदि एआई को टेलर स्विफ्ट के बारे में पूछा जाता है, तो इसकी संभावना है कि वह उत्तर जानता होगा क्योंकि उसने उसके बारे में लाखों बार पढ़ा है।
- यदि इसे उस अल्पज्ञात पेंटिंग के बारे में पूछा जाता है, तो यह अनुमान लगा सकता है और गलत हो सकता है, इसलिए नहीं कि वह "मूर्ख" है, बल्कि इसलिए क्योंकि विषय दुर्लभ है।
KGHaluBench इस समस्या को एक "डिफिकल्टी स्कोर" (कठिनाई स्कोर) की गणना करके हल करता है।
- उपमा: एक छात्र के गणित परीक्षण को ग्रेड देने की कल्पना करें। यदि परीक्षण आसान प्रश्नों (1+1) से भरा है, तो 100% अंक प्राप्त करना प्रभावशाली नहीं है। यदि परीक्षण उन्नत कैलकुलस से भरा है, तो 80% प्राप्त करना अद्भुत है।
- यह सिस्टम देखता है कि विषय कितना प्रसिद्ध है और प्रश्न कितना जटिल है। फिर यह अंतिम स्कोर को समायोजित करता है ताकि एक कठिन प्रश्न को सही बताने के लिए एक आसान प्रश्न की तुलना में अधिक अंक मिलें। यह विभिन्न एआई मॉडल के बीच निष्पक्ष तुलना सुनिश्चित करता है।
3. दो-परत वाला जासूस (उत्तरों की जाँच करना)
जब एआई उत्तर देता है, तो सिस्टम केवल "सही" या "गलत" नहीं कहता। यह एक दो-चरणीय जासूस की तरह कार्य करता है:
चरण 1: "कौन?" की जाँच (व्यापकता - Breadth):
सबसे पहले, सिस्टम पूछता है: "क्या एआई को पता था कि हम किसके बारे में बात कर रहे थे?"
यदि एआई गलत व्यक्ति के बारे में बात करने लगता है या कहता है "मुझे नहीं पता," तो इसे तुरंत फ्लैग कर दिया जाता है। यह ज्ञान की व्यापकता (Breadth) को मापता है (एआई का जाल कितना चौड़ा है)।- रूपक: यदि आप एक विशिष्ट कुत्ते के बारे में पूछते हैं, और एआई बिल्ली के बारे में बात करने लगता है, तो वह पहले परीक्षण में विफल रहा।
चरण 2: "विवरण" की जाँच (गहराई - Depth):
यदि एआई "कौन" को सही पहचान लेता है, तो सिस्टम फिर विशिष्ट तथ्यों की जाँच करता है। क्या उसने जन्म का वर्ष सही बताया? क्या उसने नौकरी का पद सही बताया?
यह ज्ञान की गहराई (Depth) को मापता है।- रूपक: एआई ने कुत्ते को सही पहचाना, लेकिन उसने कहा कि कुत्ता 2025 में पैदा हुआ था जबकि वह 2020 था। वह पहले परीक्षण में पास हुआ लेकिन दूसरे में विफल रहा।
4. परिणाम: उन्होंने क्या पाया?
शोधकर्ताओं ने 25 अलग-अलग एआई मॉडलों का परीक्षण किया (छोटे, ओपन-सोर्स मॉडलों से लेकर बड़ी टेक कंपनियों के विशाल, महंगे मॉडलों तक)।
- "आत्मविश्वासी झूठा" (Confident Liar) की समस्या: उन्होंने पाया कि सबसे स्मार्ट एआई भी अक्सर बहुत आत्मविश्वासी लगते हैं जबकि विशिष्ट विवरणों को गलत बताते हैं। यह एक ऐसे छात्र की तरह है जो एक आदर्श निबंध लिखता है लेकिन युद्ध की तारीखें गलत कर देता है।
- आकार मायने रखता है (लेकिन सब कुछ नहीं): बड़े मॉडल आम तौर पर अधिक तथ्य जानते हैं और कम गलतियाँ करते हैं। हालाँकि, सबसे बड़े मॉडल अभी भी गहरे विवरणों के लिए संघर्ष करते हैं। वे जानते हैं कि व्यक्ति कौन है, लेकिन अक्सर विशिष्ट विवरण गलत कर देते हैं।
- "मुझे नहीं पता" वाला कारक: कुछ मॉडल यह बताने में बेहतर होते हैं कि वे अनिश्चित हैं। यह वास्तव में एक अच्छी बात है! अनिश्चित होने पर "मुझे नहीं पता" कहना, आत्मविश्वास से झूठ बोलने से बेहतर है। यह सिस्टम उन मॉडलों को पुरस्कृत करता है जो जानते हैं कि कब रुकना है और कहना है, "मुझे इस बारे में यकीन नहीं है।"
यह क्यों मायने रखता है?
यह शोध पत्र हमें एआई की सत्यनिष्ठा को मापने के लिए एक बेहतर पैमाना देता है। केवल यह पूछने के बजाय कि "क्या एआई स्मार्ट है?", अब हम पूछ सकते हैं:
- "क्या एआई सामान्य चीजों के बारे में स्मार्ट है, या दुर्लभ चीजों के बारे में?"
- "क्या एआई सतही तथ्यों को जानता है, या गहरे विवरणों को?"
- "क्या एआई इस बारे में ईमानदार है कि वह क्या नहीं जानता?"
इस नए, गतिशील और निष्पक्ष परीक्षण पद्धति का उपयोग करके, डेवलपर्स ऐसे एआई बना सकते हैं जो न केवल प्रवाहपूर्ण और प्रभावशाली है, बल्कि विश्वसनीय और सत्यनिष्ठ भी है। यह सुनिश्चित करने की दिशा में एक कदम है कि हमारे एआई सहायक केवल आत्मविश्वासी कहानीकार नहीं, बल्कि उपयोगी विशेषज्ञ हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।