CRiT-QA: Evaluating Multi-hop Reasoning with Counterfactual Chains and Distractor Traps
यह शोध पत्र CRiT-QA प्रस्तुत करता है, जो एक नवीन डेटासेट है जिसे पैरामीट्रिक ज्ञान पर निर्भरता को समाप्त करने के लिए काउंटरफैक्चुअल चेन्स (counterfactual chains) और शॉर्टकट शोषण को रोकने के लिए डिस्ट्रैक्टर ट्रैप्स (distractor traps) का उपयोग करके बड़े भाषा मॉडलों की मल्टी-हॉप रीजनिंग क्षमताओं का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिससे मानक बेंचमार्क की तुलना में महत्वपूर्ण प्रदर्शन अंतराल का पता चलता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप "डिटेक्टिव" का एक हाई-स्टेक्स गेम खेल रहे हैं, लेकिन आपके पास आवर्धक लेंस (magnifying glass) के बजाय एक सुपर-स्मार्ट रोबोट दोस्त है जिसने लगभग लिखी गई हर किताब पढ़ ली है। आप रोबोट को एक रहस्य सुलझाने के लिए देते हैं, जैसे, "उस कंपनी की स्थापना किसने की जिसने फिल्म UHF वितरित की थी?"
पुराने दिनों में, यदि आप रोबate को एक रहस्य सुलझाने के लिए कागजों का एक ढेर (संदर्भ/context) देते, तो वह अक्सर उन कागजों को पूरी तरह से अनदेखा कर देता। वह अपनी आँखें बंद कर लेता, अपने विशाल मेमोरी बैंक से तथ्यों में डूब जाता जो उसने प्रशिक्षण के दौरान सीखे थे, और उत्तर चिल्लाकर देता: "माइक मेडवॉय!" उसे सही उत्तर मिल गया, ठीक है, लेकिन उसने उन सुरागों को वास्तव में पढ़े बिना ही उत्तर देकर धोखाधड़ी की जो आपने उसे दिए थे। यह एक ऐसे छात्र की तरह था जो अपने दिमाग में उत्तर रटकर इतिहास की परीक्षा में टॉप करता है, बजाय इसके कि वह आपके द्वारा दिए गए टेक्स्टबुक चैप्टर को पढ़े।
दूसरे समय में, रोबोट पढ़ने की कोशिश तो करता, लेकिन वह एक आलसी शॉर्टकट ले लेता। यदि प्रश्न पूछता, "मार्क डिस्मोर का जन्म किस काउंटी में हुआ था?" और पहले पैराग्राफ में "हैनकॉकर काउंटी" का उल्लेख होता, तो वह केवल उस शब्द को पकड़ लेता क्योंकि वह प्रश्न में मौजूद "काउंटी" शब्द से मेल खाता था। उसने असली जन्मस्थान खोजने के लिए अलग-अलग पैराग्राफों के बीच संबंध बनाने की कठिन प्रक्रिया को छोड़ दिया। यह एक भूलभुलैया को केवल दीवार के रंग के आधार पर निकास का अनुमान लगाकर हल करने जैसा था, बजाय इसके कि वह वास्तव में रास्ते पर चले।
बड़ा खुलासा
इस शोध पत्र के लेखकों ने, जुंगमिन यून और उनके सहयोगियों ने, "डिटेक्टिव" गेम का एक नया, सुपर-टफ संस्करण बनाने का निर्णय लिया जिसे CRiT-QA कहा गया। उनका मुख्य निष्कर्ष यह है कि जब उन्होंने अपने सबसे बेहतरीन रोबोट्स को इस नए, पेचीदा गेम में डाला, तो उनका प्रदर्शन बुरी तरह गिर गया। यहाँ तक कि सबसे उन्नत मॉडल भी, जैसे GPT-4o और Gemini-2.5-Pro, जो आमतौर पर टॉप ग्रेड पाते हैं, अचानक संघर्ष करने लगे। वे "A+" छात्र से मुश्किल से पास होने वाले स्तर पर आ गए, जिससे यह साबित हुआ कि उनकी पिछली सफलता अक्सर रोशनी का एक भ्रम मात्र थी।
उन्होंने रोबोट्स को कैसे फँसाया
रोबोट्स को रंगे हाथों पकड़ने के लिए, शोधकर्ताओं ने दो चतुर जाल का उपयोग किया:
"क्या होगा अगर" वाला जाल (Counterfactuals): कल्पना कीजिए कि रोबोट की याददाश्त कहती है कि "आकाश नीला है।" लेकिन नए गेम में, शोधकर्ताओं ने कहानी को इस तरह से फिर से लिखा है कि इस विशिष्ट ब्रह्मांड में, "आकाश वास्तव में हरा है।" यदि रोबोट अपनी पुरानी याददाश्त पर भरोसा करता है, तो वह "नीला" कहेगा और असफल हो जाएगा। जीतने के लिए, उसे अपनी याददाश्त को त्यागना होगा और सख्ती से दिए गए नए, अजीब कहानी का पालन करना होगा। शोधकर्ताओं ने पाया कि जब उन्होंने वास्तविक तथ्यों को इन "क्या होगा अगर" वाले परिदृश्यों से बदल दिया, तो रोबोट भ्रमित हो गए। उदाहरण के लिए, Qwen2.5-7B नामक एक मॉडल का स्कोर सामान्य परीक्षणों पर 34.96 से गिरकर इन नकली तथ्यों के सामने केवल 24.77 रह गया।
"नकली सुराग" वाला जाल (Distractors): यह बर्फ में बहुत सारे नकली पदचिह्न छोड़ने जैसा है। शोधकर्ताओं ने अतिरिक्त पैराग्राफ जोड़े जो बिल्कुल सही सुरागों की तरह दिखते थे। उनमें सही प्रकार के शब्द (जैसे किसी व्यक्ति का नाम या स्थान) थे लेकिन वे गलत उत्तर की ओर ले जाते थे। यह एक ऐसे मानचित्र की तरह है जिसमें दस अलग-अलग रास्ते हैं जो सभी खजाने की ओर जाते हुए प्रतीत होते हैं, लेकिन केवल एक ही असली है। रोबोट, जो शॉर्टकट लेने के आदी हैं, शोर में खो गए। जब उन्होंने "क्या होगा अगर" वाली कहानियों में ये नकली सुराग जोड़े, तो स्कोर और भी गिर गया। Qwen2.5-7B का स्कोर गिरकर 19.30 पर आ गया।
जितने अधिक चरण, उतना कठिन
शोधकर्ताओं ने यह भी देखा: सुरागों की श्रृंखला जितनी लंबी होती गई, रोबोट का प्रदर्शन उतना ही खराब होता गया।
- 2-hop प्रश्न (हल करने के लिए दो चरण) ठीक थे।
- 3-hop प्रश्न (तीन चरण) कठिन हो गए।
- 4-hop प्रश्न (चार चरण) एक आपदा बन गए।
उदाहरण के लिए, ओपन-सोर्स मॉडल LLaMA-3-8B का 2-स्टेप प्रश्नों पर सटीकता स्कोर 28.91 था, लेकिन 4-स्टेप प्रश्नों पर यह गिरकर 10.18 रह गया। यह ऐसा है जैसे रोबोट एक सरल पहेली सुलझा सकता है, लेकिन एक बार जब पहेली में कुछ और हिस्से जुड़ जाते हैं, तो वह पूरी तरह से खेल खेलना ही भूल जाता है। शोधकर्ताओं ने इसे 2-hop, 3-hop और 4-hop प्रश्नों पर परीक्षण करके मापा, और परिणामों ने दिखाया कि जैसे-जैसे तर्क गहरा हुआ, प्रदर्शन में लगातार गिरावट आई।
इसका क्या अर्थ है (और क्या नहीं)
यह पेपर यह नहीं कहता कि रोबोट हमेशा के लिए "टूटे" हुए हैं। यह सुझाव देता है कि हम उनके प्रति बहुत उदार रहे हैं। हम उन्हें ऐसे परीक्षण दे रहे थे जहाँ वे अपनी याददाश्त या पैटर्न का अनुमान लगाकर धोखाधड़ी कर सकते थे। यह नया CRiT-QA डेटासेट एक सख्त शिक्षक की तरह है जो कहता है, "रटना नहीं, अनुमान लगाना नहीं। मुझे अपना काम, स्टेप-दर-स्टेप दिखाओ, और केवल उन्हीं सुरागों का उपयोग करो जो मैंने दिए हैं।"
लेखक इस बारे में बहुत आश्वस्त हैं: उन्होंने स्कोर मापे, प्रयोग चलाए और नंबरों को गिरते हुए देखा। वे केवल यह अनुमान नहीं लगा रहे हैं कि रोबले कमजोर हैं; उनके पास इसे साबित करने के लिए डेटा है। हालाँकि, वे यह भी स्वीकार करते हैं कि उनका नया परीक्षण एक विशिष्ट प्रकार के पहेली (MuSique डेटासेट) पर आधारित है, इसलिए हमें अभी तक यह नहीं पता कि क्या यह दुनिया के हर प्रकार के प्रश्न के साथ ऐसा ही होगा। उन्होंने यह भी नोट किया कि चूंकि उन्होंने नकली सुराग लिखने के लिए दूसरे रोबोट का उपयोग किया था, इसलिए इस बात की मामूली संभावना है कि रोबोट "रोबोट की लिखावट" को पहचान लें और उसका एक नया शॉर्टकट के रूप में उपयोग करें, जिसे उन्हें भविष्य में ठीक करने की आवश्यकता होगी।
निष्कर्ष
अभी, हमारे कई स्मार्ट AI मॉडल उन अभिनेताओं की तरह हैं जिन्होंने स्क्रिप्ट रट ली है लेकिन कथानक (plot) को नहीं समझते। जब स्क्रिप्ट थोड़ी बदल जाती है या मंच को नकली प्रॉप्स से भर दिया जाता है, तो वे जम जाते हैं। CRiT-QA वह नया मंच है जो उन्हें वास्तव में स्क्रिप्ट पढ़ने और सोचने के लिए मजबूर करता है, यह साबित करते हुए कि अपनी शक्ति के बावजूद, वे वास्तव में एक जासूस की तरह तर्क करने के लिए अभी भी एक लंबा रास्ता तय करने बाकी हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।