MUCH: A Multilingual Claim Hallucination Benchmark
यह शोध पत्र MUCH को प्रस्तुत करता है, जो दावा-स्तरीय अनिश्चितता मात्रा निर्धारण (claim-level uncertainty quantification) के लिए पहला बहुभाषी बेंचमार्क है, जिसमें एक अत्यधिक कुशल नियत विभाजन एल्गोरिदम (deterministic segmentation algorithm) शामिल है और चार यूरोपीय भाषाओं में लार्ज लैंग्वेज मॉडल की विश्वसनीयता के निष्पक्ष, पुनरुत्पादनीय और यथार्थवादी मूल्यांकन को सक्षम करने के लिए जनरेशन लॉजिट्स (generation logits) जारी किए गए हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, बहुत तेज़ रोबोट लाइब्रेरियन (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो आपके द्वारा पूछे गए किसी भी प्रश्न का उत्तर दे सकता है। समस्या यह है कि कभी-कभी यह लाइब्रेरियन दूसरों को खुश करने के लिए इतना उत्सुक हो जाता है कि वह मनगढ़ंत बातें बनाने लगता है। वे आपको बता सकते हैं कि फ्रांस की राजधानी पेरिस है, "लेकिन साथ ही एक विशाल पनीर का पहिया भी है," और वे इसे इतने आत्मविश्वास के साथ कहते हैं कि आप उन पर विश्वास कर लेते हैं। इसे हैलुसिनेशन (hallucination) कहा जाता है।
"MUCH" नामक शोध पत्र एक नया तरीका पेश करता है जिससे हम यह परीक्षण कर सकें कि हम इन झूठों को परेशानी पैदा करने से पहले कितनी अच्छी तरह पकड़ सकते हैं। यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल भाषा में।
1. समस्या: "पूरा केक" बनाम "खराब टुकड़ा"
पहले, यदि आप रोबोट लाइब्रेरियन से एक लंबा प्रश्न पूछते और आपको एक लंबा उत्तर मिलता, तो मौजूदा परीक्षण पूरे उत्तर को एक ही ग्रेड देते थे।
- पुराना तरीका: यदि लाइब्रेरियन 10 पन्नों का निबंध लिखता और पेज 7 पर एक छोटी सी तथ्य गलत हो जाता, तो पूरे निबंध को "F" ग्रेड मिल जाता। यदि अन्य 9 पन्ने एकदम सही थे, तो यह अनुचित है।
- नया तरीका (MUCH): लेखक चाहते थे कि केक के स्लाइस किए जाएं। वे प्रत्येक "दावे" (प्रत्येक अलग विचार) को व्यक्तिगत रूप से जांचना चाहते थे। क्या उन्होंने कीमत सही बताई? क्या उन्होंने तारीख सही बताई? इसे क्लेम-लेवल अनसर्टेनिटी क्वांटिफिकेशन (Claim-Level Uncertainty Quantification) कहा जाता है।
2. समाधान: "MUCH" बेंचमार्क बनाना
टीम ने MUCH (मल्टीलिंगुअल क्लेम हैलुसिनेशन बेंचमार्क) नामक एक विशाल परीक्षण मैदान बनाया। इसे एक "हैलुसिनेशन जिम" के रूप में सोचें।
यहाँ वे चार विशेष उपकरण दिए गए हैं जो उन्होंने इस जिम के लिए बनाए:
A. बहुभाषी खेल का मैदान (The Multilingual Playground)
उन्होंने केवल अंग्रेजी में परीक्षण नहीं किया। उन्होंने जिम को चार भाषाओं में बनाया: अंग्रेजी, फ्रेंच, स्पेनिश और जर्मन। यह सुनिश्चित करता है कि रोबोट केवल एक भाषा में झूठ बोलने में अच्छे नहीं हैं, बल्कि उनका परीक्षण हर जगह किया जाए। उन्होंने चार अलग-अलग AI मॉडलों से लगभग 5,000 प्रश्न और उत्तर एकत्र किए।
B. "एक्स-रे चश्मा" (Logits)
अधिकांश AI परीक्षण केवल उस अंतिम टेक्स्ट को देखते हैं जो रोबोट लिखता है। लेकिन लेखकों ने महसूस किया कि बेहतर झूठ पकड़ने वाले उपकरण बनाने के लिए, आपको यह देखने की आवश्यकता है कि रोबोट लिखते समय क्या सोच रहा था।
- उपमा: कल्पना कीजिए कि एक जादूगर टोपी से खरगोश निकाल रहा है। अधिकांश लोग केवल खरगोश को देखते हैं। लेखकों ने "जादू के करतब" के लॉग (जिन्हें लॉगिट्स/logits कहा जाता है) रखे। ये लॉग दिखाते हैं कि रोबोट ने उस हर शब्द के लिए क्या संभावना (probability) निर्धारित की थी जिसे उसने विचार में लिया।
- यह क्यों मायने रखता है: यह शोधकर्ताओं को "व्हाइट-बॉक्स" डिटेक्टर बनाने की अनुमति देता है जो रोबोट के दिमाग में झांककर देख सके कि शब्द बोलने से पहले वह उस शब्द के बारे में अनिश्चित था या नहीं।
C. "सुपर-फास्ट स्लाइसर" (much_segmenter)
व्यक्तिगत दावों की जांच करने के लिए, आपको पहले लंबे उत्तर को छोटे, आसानी से खाए जाने वाले टुकड़ों में काटना होगा।
- पुरानी समस्या: पिछले तरीकों में टेक्स्ट को काटने के लिए अन्य AI या मनुष्यों का उपयोग किया जाता था। यह धीमा, महंगा और कभी-कभी असंगत था (जैसे ब्रेड काटने के लिए कांपते हाथ का उपयोग करना)।
- MUCH समाधान: उन्होंने much_segmenter नामक एक नया टूल बनाया। यह एक सरल, नियम-आधारित एल्गोरिदम (एक बहुत ही सटीक चाकू की तरह) है जो विराम चिह्नों और सामान्य शब्दों के आधार पर टेक्स्ट को काटता है।
- गति: यह अविश्वसनीय रूप से तेज़ है। इसमें रोबोट द्वारा उत्तर लिखने में लगने वाले समय का केवल 0.2% समय लगता है। यह ब्रेड के लोफ को पलक झपकते ही काटने जैसा है जबकि बेकर अभी भी आटा गूंथ रहा होता है। यह वास्तविक समय में झूठ की जांच करना संभव बनाता है।
D. "सिल्वर स्टैंडर्ड" जज
आदर्श रूप से, मनुष्य हर तथ्य की जांच करेंगे। लेकिन 20,000+ दावों के साथ, इसमें वर्षों लग जाएंगे।
- चाल: उन्होंने तथ्यों की जांच करने के लिए दो सुपर-स्मार्ट AI जजों (GPT-4o और GPT-4.1) का उपयोग किया जो विकिपीडिया के विरुद्ध तथ्यों को देखते हैं।
- सुरक्षा जाल: उन्होंने केवल उन्हीं उत्तरों को रखा जहाँ दोनों AI जजों ने सहमति जताई। यदि जजों के बीच असहमति थी, तो उन्होंने उस उत्तर को हटा दिया। इसने एक "सिल्वर स्टैंडर्ड" बनाया—एक ऐसा डेटासेट जो मानव-जांच वाले डेटा के लगभग समान है लेकिन इसे बहुत तेज़ी से बनाया गया था।
3. परिणाम: रोबोट अभी भी झूठ बोल रहे हैं
लेखकों ने उनके नए जिम पर सबसे अच्छे मौजूदा "झूठ पकड़ने वाले" तरीकों का परीक्षण किया।
- अच्छी खबर: ये तरीके रैंडम गेसिंग (अंदाजे) से बेहतर काम करते हैं।
- बुरी खबर: वे वास्तविक जीवन के लिए अभी भी पर्याप्त नहीं हैं।
- सटीकता (Accuracy): सबसे अच्छा तरीका केवल आधे झूठ ही पकड़ पाया जब वह "भेड़िया आया" (गलत अलार्म) की चेतावनी देने में बहुत सावधान रहने की कोशिश कर रहा था।
- गति (Speed): सबसे अच्छा तरीका वास्तव में रोबोट के उत्तर लिखने की तुलना में धीमा था! उत्तर लिखने की तुलना में इसे लिखने में 124% अधिक समय लगा। यह एक सुरक्षा गार्ड को नियुक्त करने जैसा है जिसे आपकी आईडी चेक करने में आपके दरवाजे से गुजरने में लगने वाले समय से अधिक समय लगता है।
4. निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि हमारे पास AI उत्तरों को विस्तार से जांचने और कई भाषाओं में परीक्षण करने का एक शानदार नया खेल का मैदान (MUCH) और एक सुपर-फास्ट चाकू (much_segmenter) है। हालाँकि, आज के "झूठ पकड़ने वाले उपकरण" अभी भी बहुत धीमे और इतने सटीक नहीं हैं कि वास्तविक दुनिया में भरोसा किया जा सके।
संक्षेप में: हमारे पास अंततः AI झूठ को विस्तार से और कई भाषाओं में परखने का एक तरीका है, लेकिन हमें इन रोबदों पर अपनी सबसे महत्वपूर्ण जानकारी के लिए भरोसा करने से पहले बेहतर, तेज़ झूठ पकड़ने वाले उपकरणों के आविष्कार की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।