Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights
यह शोध पत्र मतिभ्रम (hallucination) का पता लगाने वाले बेंचमार्क के लिए वांछनीयता (desiderata) के एक नए सेट का प्रस्ताव करता है, लॉन्ग-कॉन्टेक्स्ट RAG परिदृश्यों और यथार्थवादी लेबल शोर के संबंध में मौजूदा डेटासेटों में महत्वपूर्ण अंतराल की पहचान करता है, और इन सीमाओं को दूर करने के साथ-साथ वर्तमान डिटेक्शन विधियों के प्रदर्शन में नई अंतर्दृष्टि प्रदान करने के लिए ओपन-सोर्स TRIVIA+ बेंचमार्क प्रस्तुत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) अविश्वसनीय रूप से प्रतिभाशाली लेकिन कभी-कभी अति-आत्मविश्वासी शेफ हैं। वे अद्भुत व्यंजन (उत्तर) बना सकते हैं, लेकिन कभी-कभी वे ऐसी सामग्री डाल देते हैं जो रेसिपी बुक में मौजूद ही नहीं होती (हैलुसिनेशन/भ्रम)। यह एक बड़ी समस्या है क्योंकि यदि आप किसी शेफ से किसी चिकित्सा उपचार या कानूनी तथ्य के बारे में पूछते हैं, तो आपको यह जानने की आवश्यकता होती है कि वह सच बोल रहा है या बस मनगढ़ंत बातें बना रहा है।
लंबे समय से, शोधकर्ता "स्वाद चखने वाले" (डिटेक्टर्स) बनाने की कोशिश कर रहे हैं ताकि वे इन नकली सामग्रियों को पकड़ सकें। उन्होंने यह परीक्षण करने के लिए "प्रशिक्षण रसोई" (बेंचमार्क) भी बनाई हैं कि हमारे स्वाद चखने वाले कितने अच्छे हैं। हालाँकि, इस पेपर के लेखक तर्क देते हैं कि मौजूदा प्रशिक्षण रसोईएँ खराब हैं। वे कुकिंग क्लास की तरह हैं जहाँ शिक्षक केवल शेफ को जानबूझकर केक जलाने का नाटक करने के लिए कहता है, बजाय इसके कि वास्तव में उन्हें एक असली भोजन बनाते हुए देखे।
यहाँ इस पेपर के कार्यों का विवरण दिया गया, जिसमें सरल उपमाओं का उपयोग किया गया है:
1. समस्या: "नकली" प्रशिक्षण रसोई
लेखकों ने भ्रम (hallucinations) के लिए परीक्षण करने के सभी मौजूदा तरीकों को देखा और पाया कि उनमें दो प्रमुख खामियां हैं:
- "स्क्रिप्टेड" भ्रम: अधिकांश मौजूदा परीक्षण AI को जानबूझकर झूठ बोलने के लिए मजबूर करते हैं। यह एक जादूगर से यह दिखाने के लिए कहने जैसा है कि उसने गेंद गिरा दी है ताकि आप गेंद पकड़ने का अभ्यास कर सकें। यह आपको तब तैयार नहीं करता जब एक असली जादूगर वास्तव में प्रदर्शन के दौरान गलती से गेंद गिरा देता है। ये "स्क्रिप्टेड" झूठ पकड़ना बहुत आसान होता है।
- "छोटी" रेसिपी: कई परीक्षण बहुत छोटे संदर्भों (जैसे एक पैराग्राफ) का उपयोग करते हैं। लेकिन वास्तविक दुनिया में, AI को उत्तर देने के लिए एक पूरी किताब (लॉन्ग कॉन्टेक्स्ट) पढ़नी पड़ती है। मौजूदा परीक्षण AI को यह चुनौती नहीं देते कि जब घास का ढेर (haystack) एक स्टेडियम के आकार का हो, तो उसमें से सुई कैसे ढूँढनी है।
- "परफेक्ट" लेबल: वास्तविक दुनिया में, उत्तरों को ग्रेड देने वाले लोग (एनोटेटर्स) गलतियाँ करते हैं। लेकिन अधिकांश परीक्षण यह मान लेते हैं कि ग्रेडिंग एकदम सटीक है। लेखक तर्क देते हैं कि हमें अपने डिटेक्टर्स का परीक्षण तब करना चाहिए जब ग्रेडिंग स्वयं अव्यवस्थित और शोर भरी (noisy) हो, ठीक वैसे ही जैसे वास्तविक जीवन में होता है।
2. समाधान: "TRIVIA+" का परिचय
इसे ठीक करने के लिए, टीम ने एक नई, अत्यधिक चुनौतीपूर्ण प्रशिक्षण रसोई बनाई है जिसे TRIVIA+ कहा जाता है। इसे AI डिटेक्टर्स के लिए एक "सर्वाइवल कुकिंग चैलेंज" के रूप में समझें।
- असली सामग्री: उन्होंने AI को झूठ बोलने के लिए मजबूर नहीं किया। उन्होंने AI को स्वाभाविक रूप से खाना पकाने दिया और फिर यह जांचा कि क्या उसने वास्तव में रेसिपी बुक से सामग्री का उपयोग किया था। ये "ऑर्गेनिक" भ्रम हैं, जिन्हें पकड़ना बहुत कठिन है।
- विशाल घास का ढेर (Giant Haystack): उन्होंने अत्यंत लंबे दस्तावेज़ों (94,000 वर्णों तक!) का उपयोग किया। यह AI को एक साधारण प्रश्न का उत्तर देने के लिए एक पूरा उपन्यास पढ़ने के लिए मजबूर करता है, जिससे झूठ को ढूंढना बहुत कठिन हो जाता है।
- अव्यवस्थित ग्रेडिंग: उन्होंने केवल एक परफेक्ट ग्रेड नहीं दिया। उन्होंने "नॉइजी" ग्रेड के चार अलग-अलग संस्करण बनाए। कुछ को अन्य AI द्वारा ग्रेड किया गया था, और कुछ को ऐसे मनुष्यों द्वारा ग्रेड किया गया था जो आपस में असहमत थे। यह वास्तविक दुनिया का अनुकरण करता है जहाँ हमारे पास हमेशा एक सटीक उत्तर कुंजी नहीं होती।
- मानवीय पैनल: यह सुनिश्चित करने के लिए कि "सत्य" वास्तविक था, उन्होंने प्रत्येक वाक्य को छह अलग-अलग मानव विशेषज्ञों तक से ग्रेड करवाया। यदि वे असहमत थे, तो वे तब तक और विशेषज्ञों को लेकर आए जब तक कि वे सुनिश्चित नहीं हो गए।
3. परिणाम: स्वाद चखने वाले अभी भी संघर्ष कर रहे हैं
लेखकों ने वर्तमान में उपलब्ध सर्वश्रेष्ठ "स्वाद चखने वाले" (डिटेक्टर्स) को लिया और उन्हें TRIVIA+ चुनौती के माध्यम से गुजारा। परिणाम आश्चर्यजनक थे:
- अंतर बहुत बड़ा है: पुराने, आसान परीक्षणों पर, डिटेक्टर्स लगभग पूर्ण (99% सटीकता) थे। लेकिन नए, कठिन TRIVIA+ परीक्षण पर, उनका प्रदर्शन काफी गिर गया (लगभग 66-69%)। यह पता चला है कि हमारे डिटेक्टर्स वास्तव में विश्वसनीय होने से पहले हमें एक लंबा रास्ता तय करना है।
- "जज" आश्चर्यजनक है: आमतौर पर, हम सोचते हैं कि जटिल, प्रशिक्षित मॉडल सबसे अच्छे होते हैं। लेकिन इस कठिन परीक्षण पर, एक सरल विधि जिसे "LLM-as-a-Judge" कहा जाता है (जहाँ आप बस एक स्मार्ट AI से पूछते हैं, "क्या यह सच है?") ने जटिल और महंगे मॉडलों के समान ही प्रदर्शन किया।
- शोर (Noise) नुकसान पहुँचाता है: जब प्रशिक्षण डेटा में "नॉइजी" लेबल (ग्रेडिंग में गलतियाँ) थे, तो डिटेक्टर्स भ्रमित हो गए और उनका प्रदर्शन खराब हो गया। यह साबित करता है कि यदि हम AI को अव्यवस्थित डेटा पर प्रशिक्षित करते हैं, तो AI भी अव्यवस्थित होना सीख जाता है।
- लॉन्ग-कॉन्टेक्स्ट सीमा: जब टेक्स्ट बहुत लंबा हो गया (5,000 वर्णों से अधिक), तो कई डिटेक्टर्स ने हार मान ली या विफल हो गए क्योंकि टेक्स्ट उनके "मेमोरी" के लिए बहुत बड़ा था।
4. निष्कर्ष
लेखक निष्कर्ष निकालते हैं कि हम केवल पुराने, आसान परीक्षणों का उपयोग करना जारी नहीं रख सकते। वे एक खाली पार्किंग लॉट में कार चलाने के समान हैं; वे आपको तूफानी हाईवे के लिए तैयार नहीं करते हैं।
लेखकों ने अपनी नई "सर्वाइवल किचन" (TRIVIA+) को जनता के लिए जारी कर दिया है। वे आशा करते हैं कि यह शोधकर्ताओं को बेहतर डिटेक्टर्स बनाने के लिए मजबूर करेगा जो निम्नलिखित को संभाल सकें:
- वास्तविक, प्राकृतिक झूठ (न कि स्क्रिप्टेड वाले)।
- टेक्स्ट की विशाल मात्रा (लॉन्ग कॉन्टेक्स्ट)।
- अव्यवस्थित, अपूर्ण ग्रेडिंग (यथार्थवादी शोर)।
जब तक हम ऐसे डिटेक्टर्स नहीं बना लेते जो TRIVIA+ चुनौती को पास कर सकें, हम जटिल, वास्तविक दुनिया की स्थितियों में AI को सच बोलने के लिए पूरी तरह से भरोसा नहीं कर सकते।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।