StepGap: A Hybrid NLI-LLM Checker for Step-Level Evidence-Gap Detectionin Multi-Hop Question Answering
यह शोध पत्र StepGap को प्रस्तुत करता है, जो एक हाइब्रिड NLI-LLM निर्णय वृक्ष (decision tree) है जो LLM-मात्र बेसलाइनों की तुलना में अधिक संरचनात्मक पारदर्शिता के साथ मल्टी-हॉप प्रश्न उत्तर देने में विशिष्ट चरण-स्तरीय साक्ष्य अंतराल (step-level evidence gaps) का पता लगाता है, और एक टाइप किए गए प्रोसेस रिवॉर्ड के रूप में इसकी प्रभावशीलता को प्रदर्शित करता है जो Qwen2.5-7B-Instruct के सटीक मिलान (exact match) प्रदर्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि यह पता लगाना कि "फिल्म मेमोरीज़ ऑफ़ मर्डर के निर्देशक का जन्म किस देश में हुआ था?"
उत्तर पाने के लिए, आप केवल अनुमान नहीं लगाते; आपको कई चरणों से गुजरना पड़ता है:
- यह पता लगाना कि फिल्म का निर्देशन किसने किया।
- यह पता लगाना कि उस व्यक्ति का जन्म कहाँ हुआ था।
- उन तथ्यों को जोड़कर अंतिम उत्तर प्राप्त करना।
AI की दुनिया में, ये "चरण" अक्सर एक रोबोट (एक लार्ज लैंग्वेज मॉडल) द्वारा किए जाते हैं जो सुराग खोजने के लिए इंटरनेट की खोज करता है। कभी-कभी, वह रोबोट सही होता है। लेकिन अक्सर, वह प्रक्रिया के बीच में ही कोई गलती कर देता है, और क्योंकि वह इतना आत्मविश्वासी होता है, वह गलत रास्ते पर चलता रहता है जब तक कि वह एक गलत अंतिम उत्तर न दे दे।
समस्या: "गलत मोड़" का अंधा धब्बा (The "Wrong Turn" Blind Spot)
वर्तमान में, जब हम इन AI रोबोटों का परीक्षण करते हैं, तो हम केवल अंतिम उत्तर को देखते हैं। यदि उत्तर गलत है, तो हम बस कहते हैं, "विफल (Fail)।" हमें यह नहीं पता चलता कि वह कहाँ गलत हुआ। क्या उसने गलत व्यक्ति की खोज की? क्या उसने किसी सुराग को ऐसे पढ़ा जो वास्तव में वैसा नहीं था जैसा उसने सोचा था? क्या उसने कोई आवश्यक चरण छोड़ दिया?
यह एक शिक्षक की तरह है जो केवल अंतिम संख्या देखकर गणित के टेस्ट को ग्रेड करता है। यदि छात्र ने लिखा है "5 + 5 = 12," तो शिक्षक उसे गलत बताता है, लेकिन उसे यह नहीं पता चलता कि छात्र ने गलत जोड़ा, गलत नंबर कॉपी किए, या सिर्फ अनुमान लगाया। छात्र यह नहीं सीख सकता कि अपनी विशिष्ट गलती को कैसे सुधारा जाए।
समाधान: स्टेपगैप (StepGap)
लेखकों ने एक टूल बनाया जिसे स्टेपगैप (StepGap) कहा जाता है। स्टेपगैप को एक अति-सतर्क संपादक (super-attentive editor) के रूप में सोचें जो रोबोट की सोचने की प्रक्रिया के हर चरण में उसके साथ चलता है।
केवल "सही" या "गलत" कहने के बजाय, स्टेपगैप एक ट्रैफिक पुलिसकर्मी की तरह तीन विशिष्ट हाथों के संकेतों के साथ कार्य करता है, जिनमें से प्रत्येक रोबोट को बताता है कि अपनी गलती को कैसे ठीक करना है:
"रुकें और वापस लें" का संकेत (विरोधाभासी दावा - Contradicted Claim):
- स्थिति: रोबोट कहता है, "निर्देशक पार्क चान-वूक है," लेकिन जो प्रमाण उसे मिले हैं वे स्पष्ट रूप से कहते हैं, "निर्देशक बोंग जून-हो है।"
- सुधार: स्टेपगैप कहता है, "रुको! तुम प्रमाण का खंडन कर रहे हो। पीछे जाओ और उस बयान को वापस लो।"
"गलत पता" का संकेत (अप्रासंगिक साक्ष्य - Irrelevant Evidence):
- स्थिति: रोबोट निर्देशक को खोज रहा है, लेकिन वह गलती से किसी अन्य अभिनेता को खोज लेता है और उसके जीवन परिचय को पढ़ लेता है।
- सुधार: स्टेपगैप कहता है, "तुम गलत व्यक्ति को देख रहे हो। पीछे जाओ और सही व्यक्ति की खोज करो।"
"लुप्त कड़ी" का संकेत (Missing Bridge):
- स्थिति: रोबोट ने सही व्यक्ति (बोंग जून-हो) को ढूंढ लिया है और उसकी फिल्मों की एक सूची भी मिल गई है, लेकिन वह उस सूची से उसके जन्म के देश का अनुमान लगाने की कोशिश करता है। सूची में वास्तव में यह नहीं लिखा है कि उसका जन्म कहाँ हुआ था।
- सुधार: स्टेपगैप कहता है, "तुम्हारे पास सही व्यक्ति है, लेकिन तुम्हारे पास एक महत्वपूर्ण कड़ी गायब है। तुम्हें उसके जन्मस्थान के बारे में विशिष्ट तथ्य खोजने के लिए एक और खोज करने की आवश्यकता है।"
यह कैसे काम करता है (हाइब्रिड इंजन)
स्टेपगैप एक "हाइब्रिड" टूल है। यह दो अलग-अलग प्रकार के दिमागों के मिलकर काम करने का उपयोग करता है:
- रचनात्मक मस्तिष्क (LLM): यह हिस्सा टेक्स्ट को पढ़ता है और संदर्भ को समझता है, जैसे कि यह जांचना कि क्या रोबोट सही व्यक्ति के बारे में बात कर रहा है।
- तार्किक मस्तिष्क (NLI): यह हिस्सा एक सख्त तर्क मशीन है। यह प्रमाण और रोबोट के दावे को देखता है और एक सरल प्रश्न पूछता है: "क्या प्रमाण दावे को सिद्ध करता है?"
इन दोनों को मिलाकर, स्टेपगैप उन गलतियों से बचता है जो केवल एक प्रकार के मस्तिष्क का उपयोग करने से होती हैं। यह एक ऐसे जासूस की तरह है जो लोगों को पढ़ने में भी कुशल है और एक ऐसे न्यायाधीश की तरह भी जो कानून को लागू करने में कुशल है।
परिणाम: रोबोट को सिखाना
लेखकों ने केवल एक चेकर नहीं बनाया; उन्होंने इसका उपयोग AI को सिखाने के लिए किया। उन्होंने AI को स्टेपगैप के संकेतों के आधार पर एक "पुरस्कार प्रणाली" दी।
- यदि AI अपनी गलती पकड़ लेता है और उसे ठीक करता है (वापस लेता है, फिर से खोजता है, या कड़ी जोड़ता है), तो उसे एक छोटा पुरस्कार मिलता है।
- यदि वह गलती को अनदेखा करता है और आगे बढ़ता रहता है, तो उसे दंड मिलता है।
परिणाम:
जब उन्होंने इस नए सिस्टम के साथ AI को प्रशिक्षित किया, तो AI बहु-चरणीय प्रश्नों के उत्तर देने में काफी बेहतर हो गया।
- पहले: AI लगभग 32% उत्तर सही देता था।
- बाद में: AI लगभग 35% उत्तर सही देता था।
यद्यपि यह संख्या छोटी लग सकती है, लेकिन AI अनुसंधान की दुनिया में, यह एक बड़ी बात है। अधिक महत्वपूर्ण बात यह है कि AI अपने उत्तरों को तथ्यों के आधार पर (grounding) बताने में बहुत बेहतर हो गया। इसने तथ्य बनाना बंद कर दिया और वास्तव में उन लुप्त हिस्सों को खोजने लगा जिनकी उसे आवश्यकता थी।
वह "जाल" जिससे वे बचे
यह पेपर सफलता को मापने के तरीके के बारे में एक "जाल" के बारे में भी चेतावनी देता है। कुछ चेकर इतने सख्त होते हैं कि वे हर चरण को एक गलती के रूप में चिह्नित करते हैं। यदि आप सफलता को इस आधार पर मापते हैं कि "क्या आपने कोई गलती पाई?", तो वह चेकर एकदम सही दिखता है। लेकिन वह बेकार है क्योंकि वह आपको यह नहीं बताता कि वह किस प्रकार की गलती है। स्टेपगैप इस जाल से बचता है क्योंकि यह सटीक है, यह सुनिश्चित करता है कि उसके द्वारा चिह्नित प्रत्येक "गलती" एक वास्तविक, सुधारात्मक समस्या है।
सारांश में
स्टेपगैप एक ऐसा टूल है जो AI को गलत उत्तर की ओर अंधे होकर अनुमान लगाने से रोकता है। यह एक चरण-दर-चरण कोच की तरह कार्य करता है, जो सटीक रूप से पहचानता है कि तर्क कहाँ टूट रहा है (क्या यह एक विरोधाभास है? एक गलत खोज है? या एक लुप्त तथ्य है?) और AI को आगे बढ़ने से पहले उस विशिष्ट त्रुटि को ठीक करने का तरीका सिखाता है। यह AI को अधिक विश्वसनीय और ईमानदार बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।