Faithfulness-Aware Uncertainty Quantification for Fact-Checking the Output of Retrieval Augmented Generation
यह शोधपत्र FRANQ प्रस्तुत करता है, जो रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) के लिए एक नवीन मतिभ्रम (hallucination) पहचान पद्धति है, जो प्राप्त साक्ष्यों की सत्यनिष्ठा (faithfulness) के आधार पर विशिष्ट अनिश्चितता मात्रा निर्धारण (uncertainty quantification) तकनीकों को लागू करके तथ्यात्मक त्रुटि पहचान में सुधार करती है, जिसे तथ्यवत्ता (factuality) और सत्यनिष्ठा (faithfulness) दोनों के लिए एनोटेट किए गए एक नए डेटासेट के माध्यम से सत्यापित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ शोध पत्र "FRANQ: Faithfulness-Aware Uncertainty Quantification for Fact-Checking" का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।
बड़ी तस्वीर: "स्मार्ट लाइब्रेरियन" की समस्या
कल्पना कीजिए कि आपके पास एक सुपर-इंटेलिजेंट लाइब्रेरियन (AI) है जिसे दुनिया के बारे में बहुत कुछ पता है। लेकिन इस लाइब्रेरियन की एक बुरी आदत है: कभी-कभी वे चीजें बना लेते हैं, या उन्हें चीजें गलत याद रहती हैं। इसे हैलुसिनेशन (hallucination) कहा जाता है।
इसे ठीक करने के लिए, आप लाइब्रेरियन को संदर्भ पुस्तकों (Reference Books) का एक ढेर देते हैं और कहते हैं: "केवल इन किताबों में जो लिखा है, उसी का उपयोग करके उत्तर दें।" इसे RAG (Retrieval-Augmented Generation) कहा जाता है।
समस्या:
किताबों के होने के बावजूद, लाइब्रेरियन गलतियाँ करता रहता है।
- "गलत किताब" वाली गलती: लाइब्रेरियन एक ऐसी किताब पढ़ता है जिसमें टाइपो (लिखने की गलती) या झूठ है, और वह उस झूठ को सच मानकर दोहरा देता है क्योंकि वह किताब में लिखा है।
- "बाहरी ज्ञान" वाली गलती: लाइब्रेरियन किताबों को अनदेखा कर देता है और अपनी याददाश्त से उत्तर देता है, जो सही भी हो सकता है और गलत भी।
जांच करने का पुराना तरीका:
पिछले तरीके एक सख्त शिक्षक की तरह थे जो कहता था: "अगर यह किताब में नहीं लिखा है, तो यह झूठ है!"
यह अनुचित है। यदि लाइब्रेरियन अपनी याददाश्त से उत्तर देता है (और वह वास्तव में सच है), लेकिन किताब में उसका उल्लेख नहीं था, तो पुराना तरीका उसे अभी भी "हैलुसिनेशन" कहेगा। इसने "क्या आपने नियमों का पालन किया?" और "क्या उत्तर वास्तव में सच है?" के बीच भ्रम पैदा कर दिया था।
समाधान: FRANQ (स्मार्ट जासूस)
लेखकों ने FRANQ नामक एक नया तरीका बनाया है। FRANQ को एक दो-चरणीय जासूस (two-step Detective) के रूप में सोचें जो केवल यह नहीं देखता कि लाइब्रेरियन ने नियमों का पालन किया या नहीं, बल्कि यह भी देखता है कि उत्तर वास्तव में सच है या नहीं।
FRANQ तथ्य-जांच की प्रक्रिया को दो अलग-अलग प्रश्नों में विभाजित करता है:
चरण 1: "फिथफुलनेस" चेक (क्या उन्होंने स्क्रिप्ट का पालन किया?)
- उपमा: कल्पना कीजिए कि लाइब्रेरियन एक अभिनेता है। "संदर्भ पुस्तकें" एक स्क्रिप्ट हैं।
- प्रश्न: "क्या अभिनेता ने स्क्रिप्ट का पालन किया, या उसने अपनी मर्जी से कुछ भी बोल दिया (इम्प्रोवाइज किया)?"
- FRANQ इसे कैसे करता है: यह यह मापने के लिए AlignScore नामक टूल का उपयोग करता है कि उत्तर किताबों के टेक्स्ट से कितनी निकटता से मेल खाता है।
- उच्च स्कोर (High Score): उत्तर किताबों में मौजूद है।
- कम स्कोर (Low Score): उत्तर लाइब्रेरियन के अपने दिमाग से आया है।
चरण 2: "फैक्टुअलिटी" चेक (क्या उत्तर वास्तव में सच है?)
यहीं पर FRANQ चतुर बनता है। यह चरण 1 के परिणाम के आधार पर एक अलग प्रश्न पूछता है।
परिदृश्य A: लाइब्रेरियन ने स्क्रिप्ट का पालन किया (Faithful)
- जोखिम: स्क्रिप्ट खुद गलत हो सकती है! (शायद किताब में कोई टाइपो था)।
- जासूस की चाल: FRANQ पूछता है, "यदि लाइब्रेरियन केवल स्क्रिप्ट पढ़ रहा है, तो वह इसे पढ़ने में कितना आश्वस्त है?" यह शब्दों के आने की संभावना (probability) की जांच करता है। यदि लाइब्रेरियन स्क्रिप्ट पढ़ते समय हकला रहा है या अनिश्चित है, तो उत्तर संदिग्ध है।
परिदृश्य B: लाइब्रेरियन ने अपनी मर्जी से बोला (Unfaithful)
- जोखिम: लाइब्रेरियन अपनी याददाश्त से अनुमान लगा रहा है।
- जासूस की चाल: FRANQ किताबों को पूरी तरह से अनदेखा कर देता है। वह पूछता है, "लाइब्रेरियन के अपने आंतरिक ज्ञान के आधार पर, इसकी सच्चाई की कितनी संभावना है?" यह किताबों को देखे बिना लाइब्रेरियन के आंतरिक आत्मविश्वास (internal confidence) की जांच करता है।
जादुई फॉर्मूला: स्कोर को मिलाना
FRANQ इन दोनों जांचों को एक अंतिम "ट्रुथ स्कोर" (सत्य स्कोर) में मिलाता है।
इसे एक स्मूदी (Smoothie) की तरह समझें:
- आधार (Base): उत्तर का कितना हिस्सा किताबों से आया? (Faithfulness)।
- फल (Fruit): यदि उत्तर किताबों से आया है, तो वह कितना सच है?
- दही (Yogurt): यदि उत्तर लाइब्रेरियन के अपने दिमाग से आया है, तो वह कितना सच है?
FRANQ रेसिपी के आधार पर इन सामग्रियों को मिलाता है। यदि उत्तर 90% किताबों से है, तो "बुक ट्रुथ" अधिक महत्वपूर्ण है। यदि उत्तर 90% लाइब्रेरियन के दिमाग से है, तो "ब्रेन ट्रुथ" अधिक महत्वपूर्ण है।
यह क्यों महत्वपूर्ण है (The "Aha!" Moment)
अतीत में, यदि लाइब्रेरियन एक सही उत्तर देता था जो किताब में नहीं था, तो पुराने सिस्टम उसे त्रुटि के रूप में चिह्नित कर देते थे।
- पुराना सिस्टम: "आपने किताब का उपयोग नहीं किया! यह एक हैलुसिनेशन है!" (गलत आरोप/False Alarm)।
- FRANQ: "आपने किताब का उपयोग नहीं किया, लेकिन आपका उत्तर वास्तव में आपके अपने ज्ञान के आधार पर सही है। यह ठीक है!" (सटीक)।
इसके विपरीत, यदि लाइब्रेरियन ने किताब से किसी झूठ की नकल की होती:
- पुराना सिस्टम: "आपने किताब का उपयोग किया! यह सच ही होगा।" (गलती पकड़ने में विफल/Missed Error)।
- FRANQ: "आपने किताब का उपयोग किया, लेकिन किताब संदिग्ध लग रही है, और आप भी अनिश्चित लग रहे हैं। यह संभवतः एक झूठ है।" (गलती पकड़ ली/Caught Error)।
नया डेटासेट (प्रशिक्षण का मैदान)
इस नए जासूस को सिखाने के लिए, लेखकों ने एक नया डेटासेट बनाया।
- कल्पना कीजिए कि प्रश्नों और उत्तरों का एक विशाल पुस्तकालय है।
- उन्होंने उन्हें केवल "सही" या "गलत" के रूप में लेबल नहीं किया।
- उन्होंने उन्हें दो टैग्स के साथ लेबल किया:
- क्या यह किताब में है? (Faithfulness)
- क्या यह वास्तव में सच है? (Factuality)
- उन्होंने AI और मानव विशेषज्ञों के मिश्रण का उपयोग किया ताकि सुनिश्चित किया जा सके कि उनके लेबल सटीक हों, विशेष रूप से उन जटिल मामलों में जहाँ AI भ्रमित था।
परिणाम
जब उन्होंने अन्य तरीकों के मुकाबले FRANQ का परीक्षण किया, तो यह एक मैग्निफाइंग ग्लास (आवर्धक लेंस) के साथ शरलॉक होम्स को लड़ाई में उतारने जैसा था।
- इसने अधिक झूठ पकड़े।
- इसने सही उत्तरों के खिलाफ कम गलत आरोप लगाए।
- यह छोटे उत्तरों (जैसे ट्रिविया प्रश्न) और लंबे उत्तरों (जैसे निबंध) दोनों के लिए अच्छी तरह से काम किया।
एक वाक्य में सारांश
FRANQ एक स्मार्ट फैक्ट-चेकर है जो यह जानता है कि "नियमों का पालन करना" और "सच बोलना" के बीच क्या अंतर है, यह सुनिश्चित करता है कि हम सही उत्तरों को इसलिए दंडित न करें क्योंकि वे संदर्भ पुस्तक में नहीं थे, और हम गलत उत्तरों पर भरोसा न करें क्योंकि वे किताब में लिखे थे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।