← नवीनतम पेपर
💬 NLP

Precision Is Not Faithfulness: Coverage-Aware Evaluation of Grounded Generation with a Complete Oracle

यह शोध पत्र ग्राउंडेड जनरेशन के लिए एक कवरेज-अवेयर मूल्यांकन ढांचे को प्रस्तुत करता है जो फॉर्मूला 1 और मौसम डोमेन में पूर्ण-ओरेकल बेंचमार्क के माध्यम से यह प्रदर्शित करके मौजूदा प्रिसिजन-ओनली फेथफुलनेस मेट्रिक्स की सीमाओं को उजागर करता है कि वर्तमान मॉडल प्रासंगिक तथ्यों को कम रिपोर्ट करके उच्च फेथफुलनेस प्राप्त करते हैं, और एक एकीकृत स्कोर एवं वर्िफायर-गाइडेड पद्धति का प्रस्ताव करता है जो प्रिसिजन और रिकॉल दोनों में सुधार करती है।

मूल लेखक: Juan S. Santillana

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Juan S. Santillana

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: "मौन ही स्वर्णिम है" (लेकिन यह केवल आधा सच है)

कल्पना कीजिए कि आप एक शिक्षक हैं जो एक छात्र के निबंध का मूल्यांकन कर रहे हैं। आपका एक सख्त नियम है: "आपके द्वारा लिखा गया हर वाक्य 100% सत्य होना चाहिए।"

यदि छात्र 500 शब्दों का निबंध लिखता है लेकिन एक तथ्य भी गलत बताता है, तो वह फेल हो जाता है। लेकिन यहाँ एक चाल है: यदि छात्र केवल एक वाक्य लिखता है जो सत्य है, और उसके अलावा कुछ भी नहीं कहता, तो उसे 100% का परफेक्ट स्कोर मिलता है।

यही वह समस्या है जिसे यह शोध पत्र वर्तमान AI मूल्यांकन उपकरणों (evaluation tools) के साथ पहचानता है। ये उपकरण प्रिसिजन (Precision) को मापते हैं (AI ने जो कुछ भी कहा, उनमें से कितने सच थे)। वे AI को बहुत अधिक सावधान रहने और बहुत कम बोलने के लिए पुरस्कृत करते हैं। यह उस छात्र की तरह है जो तब तक किसी भी प्रश्न का उत्तर देने से इनकार कर देता है जब तक कि वह 100% निश्चित न हो, जिसके परिणामस्वरूप एक खाली टेस्ट पेपर मिलता है जिसे किसी तरह "A" ग्रेड मिल जाता है क्योंकि उस पर कुछ भी गलत नहीं है।

यह शोध पत्र तर्क देता है कि फेथफुलनेस (Faithfulness) (एक अच्छा, ईमानदार AI होना) का मतलब केवल "झूठ न बोलना" नहीं होना चाहिए। इसका मतलब यह भी होना चाहिए कि "महत्वपूर्ण चीजों को छोड़ना भी नहीं चाहिए।"

समाधान: "पूर्ण उत्तर पत्र" (The Complete Answer Sheet)

इसे साबित करने के लिए, शोधकर्ताओं को न केवल यह मापने के तरीके की आवश्यकता थी कि AI ने क्या सही कहा, बल्कि यह भी कि उसने क्या छोड़ दिया। इसे रिकॉल (Recall) कहा जाता है।

आमतौर पर, यह असंभव है। यदि आप AI को पेरिस में एक सामान्य दिन के बारे में कहानी लिखने के लिए कहते हैं, तो आप कैसे जानेंगे कि उसने कोई विवरण छोड़ दिया है? एक रचनात्मक कहानी के लिए कोई "उत्तर कुंजी" (answer key) नहीं होती है।

शोधकर्ताओं की तरकीब: फॉर्मूला 1 रेसिंग
शोधकर्ताओं ने अपने "उत्तर कुंजी" के रूप में फॉर्मूला 1 (F1) रेसिंग डेटा का उपयोग किया।

  • उपमा (Analogy): एक F1 रेस को गणित की एक समस्या की तरह समझें जिसका एक निर्विवाद समाधान होता है। हम जानते हैं कि किस लैप पर ड्राइवर ने पिट स्टॉप लिया, उन्होंने कौन से टायर इस्तेमाल किए, और उन्होंने किसे ओवरटेक किया। इसमें कोई अनुमान नहीं होता।
  • "कम्प्लीट ओरकल" (The Complete Oracle): क्योंकि डेटा इतना सटीक है, शोधकर्ता हर रेस निर्णय के लिए एक "पूर्ण उत्तर पत्र" बना सके। वे ठीक से जानते थे कि एक आदर्श स्पष्टीकरण में कौन-कौन से तथ्य शामिल होने चाहिए थे।

इसने शोधकर्ताओं को दो चीजों पर AI को ग्रेड देने की अनुमति दी:

  1. प्रिसिजन (Precision): क्या इसके द्वारा बताए गए तथ्य उत्तर कुंजी से मेल खाते हैं? (क्या यह झूठ बोल रहा है?)
  2. रिकॉल (Recall/Coverage): क्या इसने उन सभी तथ्यों का उल्लेख किया जो उत्तर कुंजी में थे? (क्या यह मददगार हो रहा है?)

चौंकाने वाली खोज: "स्मार्ट" AI वास्तव में आलसी था

शोधकर्ताओं ने F1 रेस की रणनीतियों को समझाने के लिए दुनिया के सबसे उन्नत AI मॉडल (जैसे Grok, GPT-5, और Gemini) का परीक्षण किया।

  • परिणाम: जिस मॉडल का "प्रिसिजन" स्कोर सबसे अधिक था (वह जो कभी झूठ नहीं बोलता था), वह वास्तव में मददगार होने में सबसे खराब था।
  • क्यों? वह सुरक्षित खेल रहा था। वह कहता, "ड्राइवर ने 12वें लैप पर पिट स्टॉप लिया।" (सच है! 100% स्कोर)। लेकिन वह इस तथ्य को छोड़ देता कि ड्राइवर ने हार्ड टायरों पर स्विच किया, या उसने 5 सेकंड गंवा दिए, या उसने प्रतिद्वंद्वी से बचाव किया।
  • उलटफेर: जब शोधकर्ताओं ने तथ्यों को छोड़ने के लिए दंड (penalty) जोड़ दिया, तो रैंकिंग पूरी तरह से बदल गई। वे मॉडल जो थोड़े कम "परफेक्ट" थे लेकिन बहुत अधिक बातूनी और विस्तृत थे, विजेता बन गए।

रूपक (Metaphor):
कल्पना कीजिए कि दो डॉक्टर आपको निदान (diagnosis) दे रहे हैं।

  • डॉक्टर A कहता है: "आप जीवित हैं।" (100% सटीक, 0% मददगार)।
  • डॉक्टर B कहता है: "आपका पैर टूटा हुआ है, टखना मोच आया है, और सिर में चोट (concussion) लगी है। यहाँ प्रत्येक के लिए उपचार दिया गया है।" (95% सटीक, 100% मददगार)।

वर्तमान AI उपकरण डॉक्टर A को एक परफेक्ट स्कोर देंगे और डॉक्टर B को कम स्कोर देंगे क्योंकि डॉक्टर B ने एक विवरण पर थोड़ा जोखिम लिया। यह शोध पत्र कहता है: डॉक्टर A को पुरस्कृत करना बंद करें।

मौसम का परीक्षण: यह केवल रेसिंग के बारे में नहीं है

यह सुनिश्चित करने के लिए कि यह केवल F1 डेटा की कोई अजीब विशेषता नहीं थी, उन्होंने उसी विचार का मौसम के पूर्वानुमान (Weather Forecasts) पर परीक्षण किया।

  • उन्होंने AI को वास्तविक मौसम डेटा (तापमान, हवा, बारिश की संभावना) दिया और उससे पूर्वानुमान लिखने को कहा।
  • परिणाम: वही हुआ। सबसे "सटीक" (precise) AI वह था जिसने सबसे कम कहा। सबसे "फेथफुल" (सटीक + पूर्ण) AI वह था जिसने सभी तथ्यों को कवर किया, भले ही उसने एक या दो छोटी गलतियाँ की हों।

समाधान: एक "वेरिफायर" (Verifier) जो AI को निर्देशित करता है

शोध पत्र एक समाधान भी प्रदान करता है। केवल AI से "कहानी लिखने" के लिए कहने के बजाय, उन्होंने एक ऐसी प्रणाली बनाई जहाँ:

  1. AI एक ड्राफ्ट लिखता है।
  2. एक "वेरिफायर" (एक सख्त चेकर) डेटा के विरुद्ध ड्राफ्ट की जांच करता है।
  3. वेरिफायर AI को बताता है: "आपने यह तथ्य सही बताया, लेकिन आप हवा की गति का उल्लेख करना भूल गए, और आपने बारिश के बारे में झूठ बोला।"
  4. AI इसे ठीक करता है और फिर से प्रयास करता है।

इस "वेरिफायर-गाइडेड" पद्धति ने AI को बिना किसी मानव द्वारा पुनर्गठन के, सटीक और पूर्ण दोनों बनने में मदद की।

मुख्य निष्कर्षों का सारांश

  1. प्रिसिजन \neq फेथफुलनेस: केवल इसलिए कि एक AI झूठ नहीं बोल रहा है, इसका मतलब यह नहीं है कि वह अच्छा काम कर रहा है। यदि वह कुछ नहीं कहता है, तो वह झूठ नहीं बोल सकता, लेकिन वह बेकार है।
  2. "एब्स्टेंशन" (Abstention) का जाल: वर्तमान AI बेंचमार्क मॉडलों को चुप रहने और जोखिमों से बचने के लिए पुरस्कृत करते हैं।
  3. द कम्प्लीट ओरकल (The Complete Oracle): आप केवल तभी यह माप सकते हैं कि AI ने कौन से तथ्य छोड़े हैं, जब आपके पास एक पूर्ण सूची हो कि वहां क्या होना चाहिए (जैसे F1 डेटा या मौसम के रिकॉर्ड)।
  4. रैंकिंग का उलटफेर: जब आप सटीकता और पूर्णता दोनों को मापते हैं, तो "सर्वश्रेष्ठ" AI बदल जाता है। वे मॉडल जो अधिक बोलने और अधिक तथ्यों को कवर करने के लिए साहसी हैं, वास्तव में सबसे अच्छे होते हैं, भले ही वे पूर्ण न हों।
  5. भाषा मायने नहीं रखती: यह समस्या अंग्रेजी, स्पेनिश और पुर्तगाली में समान रूप से होती है।

संक्षेप में: हमें AI को केवल इस आधार पर ग्रेड देना बंद करना होगा कि वे सच बोलते हैं या नहीं, और उन्हें इस आधार पर ग्रेड करना शुरू करना होगा कि वे पूरा सच बताते हैं या नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →