Improved Evidence Extraction and Metrics for Document Inconsistency Detection with LLMs
यह शोध पत्र एक रेडैक्ट-एंड-रिट्राय (redact-and-retry) फ्रेमवर्क को पेश करके LLM-आधारित दस्तावेज़ विसंगति का पता लगाने पर सीमित शोध को संबोधित करता है, जिसमें सीमित फ़िल्टरिंग और नए व्यापक मेट्रिक्स शामिल हैं, जो साक्ष्य निष्कर्षण प्रदर्शन में महत्वपूर्ण सुधार करते हैं और एक नए जारी किए गए अर्ध-सिंथेटिक डेटासेट का उपयोग करके मान्य किए जाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त न्यूज़रूम में एक सीनियर एडिटर हैं। आपका काम लंबी, जटिल रिपोर्ट पढ़ना और उसमें से वह एक वाक्य ढूँढना है जो दूसरे वाक्य का खंडन करता हो। शायद रिपोर्ट कहती है, "CEO 2020 में रिटायर हो गए," और तीन पन्ने बाद, यह कहता है, "CEO वर्तमान में टीम का नेतृत्व कर रहे हैं।"
एक इंसान के लिए, एक छोटे ईमेल में ऐसे "ग्लिच" (खामियां) ढूँढना आसान है। लेकिन 50 पन्नों के दस्तावेज़ में जहाँ विरोधाभास मीलों दूर हों? यह थका देने वाला है। हम अक्सर उन्हें मिस कर देते हैं।
यह पेपर AI (विशेष रूप से लार्ज लैंग्वेज मॉडल्स या LLMs) को वह 'सुपर-एडिटर' बनने के लिए सिखाने के बारे में है। अमेरिकन एक्सप्रेस के शोधकर्ताओं ने महसूस किया कि हालांकि AI यह कहने में बहुत अच्छा है कि "वहाँ एक गलती है," लेकिन यह अक्सर आपको ठीक से दिखाने में बहुत खराब है कि वह गलती कहाँ है।
यहाँ इस बात की कहानी है कि उन्होंने इसे कैसे ठीक किया, कुछ रचनात्मक उपमाओं (analogies) का उपयोग करते हुए।
1. समस्या: "आलसी जासूस" (The Lazy Detective)
कल्पना कीजिए कि आपने एक जासूस (AI) को घर में चोरी हुए कुकी (cookie) को खोजने के लिए काम पर रखा है।
- पुराना तरीका: आप जासूस से पूछते हैं, "क्या कोई कुकी गायब है?" वे कहते हैं, "हाँ!" लेकिन जब आप पूछते हैं, "सबूत कहाँ है?" तो वे बस पूरे घर की ओर इशारा करते हैं और कहते हैं, "यह कहीं यहाँ है।"
- परिणाम: आपको पता है कि कुछ गलत है, लेकिन आपको पता ही नहीं कि कहाँ देखना है। AI तकनीकी रूप से समस्या के अस्तित्व के बारे में "सही" है, लेकिन वास्तव में उसे ठीक करने के लिए बेकार है।
पेपर का तर्क है कि AI को वास्तव में उपयोगी होने के लिए, उसे दो चीजें करनी चाहिए:
- वर्गीकृत करना (Classify): कहना कि "हाँ, यहाँ एक विरोधाभास है।"
- निकालना (Extract): उन सटीक वाक्यों की ओर इशारा करना जो आपस में लड़ रहे हैं।
2. नया पैमाना: "अच्छे" साक्ष्य को मापना
शोधकर्ताओं ने महसूस किया कि AI को ग्रेड देने के पुराने तरीके केवल इस आधार पर छात्र को ग्रेड देने जैसे थे कि क्या उसने हाथ उठाया, न कि इस आधार पर कि क्या उसने सही उत्तर दिया।
उन्होंने यह देखने के लिए नए "रिपोर्ट कार्ड" (metrics) पेश किए कि AI वास्तव में वाक्यों को कितनी अच्छी तरह से खोजता है:
- "सब कुछ या कुछ भी नहीं" टेस्ट (The "All or Nothing" Test): क्या AI ने हर एक विरोधाभासी वाक्य को ढूँढा? (यदि उसने एक भी छोड़ दिया, तो वह फेल है)।
- "प्रिसिजन" टेस्ट (The "Precision" Test): क्या AI ने निर्दोष वाक्यों पर गलत आरोप लगाए बिना सही वाक्यों को ढूँढा? (अगर एक वाक्य खराब है, तो पूरे पैराग्राफ को फ्लैग न करें)।
- "रिकॉल" टेस्ट (The "Recall" Test): क्या AI ने अधिकांश खराब वाक्यों को ढूँढा, भले ही वह एकदम सटीक न रहा हो?
3. समाधान: "रिडैक्ट-एंड-रिट्राय" गेम (The "Redact-and-Retry" Game)
शोधकर्ताओं ने एक चतुर नई रणनीति का आविष्कार किया जिसे Redact-and-Retry कहा जाता है। इसे "हॉट एंड कोल्ड" या "व्हैक-ए-मोल" (Whac-A-Mole) के खेल की तरह समझें।
यहाँ Redact-and-Retry फ्रेमवर्क कैसे काम करता है:
- राउंड 1: आप AI को पूरा दस्तावेज़ दिखाते हैं। यह पहला विरोधाभास ढूँढता है (जैसे, "CEO 2020 में रिटायर हो गए")।
- रिडैक्ट (मिटाना/Redact): AI उन विशिष्ट वाक्यों को लेता है और उन्हें दस्तावेज़ से मिटा देता है। यह ऐसा है जैसे उन्हें लाल मार्कर से काट देना।
- रिट्राय (दोबारा देखना/Retry): आप AI को बाकी का दस्तावेज़ (जिसमें पहला विरोधाभास हटा दिया गया है) फिर से दिखाते हैं।
- इससे क्या मदद मिलती है? पहले के व्यवधान को हटाकर, AI अपना "दिमाग" अगले विरोधाभास को खोजने में लगा सकता है, जो शायद पहले शोर के बीच छिपा हुआ था।
- दोहराना (Repeat): AI विरोधाभास ढूँढता रहता है, उन्हें मिटाता रहता है, और फिर से देखता रहता है जब तक कि वह यह न कह दे, "मुझे और कोई नहीं मिल रहा है।"
4. "फ़िल्टर": सख्त मैनेजर (The "Filter": The Strict Manager)
कभी-कभी, AI बहुत उत्साहित हो जाता है। गलतियाँ ढूँढने की अपनी उत्सुकता में, वह उन वाक्यों को भी फ्लैग कर सकता है जो वास्तव में ठीक हैं।
इसे ठीक करने के लिए, शोधकर्ताओं ने एक फ़िल्टर जोड़ा। कल्पना कीजिए कि एक सख्त मैनेजर जासूस की संदिग्धों की सूची की समीक्षा करता है।
- अनकन्स्ट्रेंड फ़िल्टर (Unconstrained Filter): मैनेजर कह सकता है, "वास्तव में, कोई संदिग्ध ही नहीं है," और पूरी जांच रद्द कर सकता है।
- कन्स्ट्रेंड फ़िल्टर (Consted Filter - विजेता): मैनेजर कहता है, "आपने कुछ संदिग्ध पाए हैं। मैं उन लोगों को काट दूँगा जो निर्दोष दिखते हैं, लेकिन आपको सूची में कम से कम एक संदिग्ध रखना ही होगा।"
शोधकर्ताओं ने पाया कि यह Constrained Filter सबसे सटीक बिंदु था। इसने AI की गलतियों को साफ किया बिना उसे वास्तविक त्रुटियों को खोजने से रोकने के।
5. नया डेटासेट: "दो कुकी टेस्ट" (The "Two-Cookie Test")
अपने नए सिस्टम का परीक्षण करने के लिए, उन्हें एक बेहतर टेस्ट की आवश्यकता थी। पुराना टेस्ट (ContraDoc) में केवल एक विरोधाभास वाले दस्तावेज़ थे। यह एक ऐसे जासूस को टेस्ट करने जैसा था जिसे केवल एक ही कुकी ढूँढनी थी।
शोधकर्ताओं ने ContraDocPaired नामक एक नया डेटासेट बनाया। उन्होंने एक-एक विरोधाभास वाले दो दस्तावेज़ लिए और उन्हें आपस में जोड़ दिया। अब, AI को एक लंबे दस्तावेज़ में दो विरोधाभास ढूँढने थे। यह एक ही घर में दो अलग-अलग चोरी हुई कुकीज़ को ढूँढने के लिए जासूस को भेजने जैसा था। इसने साबित कर दिया कि उनका "Redact-and-Retry" तरीका वास्तव में कई समस्याओं को खोजने में सक्षम है, न कि केवल एक।
मुख्य निष्कर्ष (The Big Takeaway)
पेपर दिखाता है कि यदि आप चाहते हैं कि AI लंबे दस्तावेज़ों में विसंगतियों को ढूँढे, तो आपको उससे केवल एक बार नहीं पूछना चाहिए। इसके बजाय, आपको:
- एक समस्या ढूँढने के लिए कहें।
- उसे काट दें।
- शेष टेक्स्ट में अगली समस्या ढूँढने के लिए कहें।
- वास्तविक गलतियों को हटाने के लिए एक सख्त मैनेजर से सूची की समीक्षा करवाएं।
यह दृष्टिकोण AI को बहुत अधिक विश्वसनीय बनाता है, जिससे वह एक "अस्पष्ट अलार्म बजाने वाले" से बदलकर एक "सटीक संपादक" बन जाता है जिस पर आप भारी काम करने के लिए भरोसा कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।