← नवीनतम पेपर
💬 NLP

MARCH: Evaluating the Intersection of Ambiguity Interpretation and Multi-hop Inference

यह शोधपत्र MARCH प्रस्तुत करता है, जो यह दर्शाता है कि अत्याधुनिक मॉडल मल्टी-हॉप इन्फरेंस (multi-hop inference) और लेयर्ड एम्बिग्युइटी (layered ambiguity) के प्रतिच्छेदन में संघर्ष करते हैं, और CLARION का प्रस्ताव करता है, जो एक टू-स्टेज एजेंटिक फ्रेमवर्क है जो एम्बिग्युइटी प्लानिंग को एविडेंस-ड्रिवन रीजनिंग (evidence-driven reasoning) से अलग करता है ताकि प्रदर्शन में उल्लेखनीय सुधार किया जा सके।

मूल लेखक: Jeonghyun Park, Ingeol Baek, Seunghyun Yoon, Haeun Jang, Aparna Garimella, Akriti Jain, Nedim Lipka, Hwanhee Lee

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jeonghyun Park, Ingeol Baek, Seunghyun Yoon, Haeun Jang, Aparna Garimella, Akriti Jain, Nedim Lipka, Hwanhee Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MARCH और CLARION पेपर का सरल, रोज़मर्रा की भाषा में अनुवाद दिया गया है, जिसमें उपमाओं (analogies) का उपयोग किया गया है।

बड़ी समस्या: "चुनो अपना ही रोमांच" (Choose Your Own Adventure) वाला जाल

कल्पना कीजिए कि आप मदद के लिए एक बहुत ही बुद्धिमान, लेकिन थोड़े अधीम (impatient) लाइब्रेरियन से पूछ रहे हैं। आप पूछते हैं:

"उस कंपनी से सबसे ज्यादा बिकने वाली पिकअप ट्रक कौन सी बनाती है जो 'Mustang' बनाती है?"

एक इंसान तुरंत रुककर सोचेगा, "ठहरिए, कौन सी Mustang? प्रसिद्ध फोर्ड कार, या फेंडर (Fender) की इलेक्ट्रिक गिटार?"

  • यदि यह कार है: तो उत्तर है Ford। उनकी सबसे ज्यादा बिकने वाली पिकअप F-150 है।
  • यदि यह गिटार है: तो उत्तर है Fender। उनका "पिकअप" गिटार के अंदर का एक चुंबकीय हिस्सा (magnetic part) है (ट्रक नहीं!)।

गलती: अधिकांश AI मॉडल उस अधीम लाइब्रेरियन की तरह होते हैं। वे "Mustang" सुनते ही तुरंत "कार" के बारे में सोचने लगते हैं और तुरंत फोर्ड ट्रकों की तलाश शुरू कर देते हैं। वे गिटार की संभावना को पूरी तरह भूल जाते हैं। जब तक उन्हें एहसास होता है कि वे गलत हो सकते हैं, तब तक वे गलत दिशा में काफी गहरा गड्ढा खोद चुके होते हैं। AI की दुनिया में, इसे असमय प्रतिबद्धता (premature commitment) कहा जाता है।

भाग 1: नया टेस्ट (MARCH)

शोधकर्ताओं ने एक नया टेस्ट बनाया जिसे MARCH (Multi-hop Ambiguity Reasoning CHain) कहा जाता है। इसे AI के दिमाग के लिए एक "तनाव परीक्षण" (Stress Test) समझें।

  • लक्ष्य: यह देखना कि क्या एक AI उस सवाल को संभाल सकता है जहाँ उत्तर दो या अधिक चरणों पर निर्भर करता है, और जहाँ पहला चरण एक ऐसा पेचीदा सवाल है जिसके कई अर्थ हो सकते हैं।
  • सेटअप: उन्होंने 2,209 पेचीदा सवालों का एक डेटाबेस बनाया। उन्होंने केवल AI को अनुमान लगाने के लिए नहीं कहा; उन्होंने इंसानों और अन्य AI के साथ जवाबों की जाँच की ताकि यह सुनिश्चित हो सके कि सवाल वास्तव में निष्पक्ष हैं और उत्तर सही हैं।
  • परिणाम: यहाँ तक कि सबसे स्मार्ट AI मॉडल (जैसे कि आज के चैटबॉट्स को चलाने वाले मॉडल) भी इस टेस्ट में बुरी तरह विफल रहे। वे पहले मिले अर्थ पर ही अटक जाते थे और दूसरे अर्थ को खोजने के लिए पीछे मुड़ने (backtrack करने) में सक्षम नहीं थे।

उपमा (Analogy):
कल्पना कीजिए कि आप एक भूलभुलैया (maze) में रास्ता खोज रहे हैं।

  • Standard AI: आप सड़क पर एक मोड़ देखते हैं। आप बायां रास्ता चुनते हैं क्योंकि वह लोकप्रिय दिखता है। आप 100 कदम चलते हैं, एक बंद रास्ते (dead end) पर पहुँचते हैं, और कहते हैं, "मैं इस भूलभुलैया को हल नहीं कर सकता।"
  • MARCH चुनौती: भूलभुलैया इस तरह बनाई गई है कि "लोकप्रिय" रास्ता एक जाल है। इसे हल करने के लिए, आपको यह समझना होगा कि शुरुआत में दो वैध रास्ते हैं, दोनों रास्तों पर एक साथ चलना होगा, और अंत में निष्कर्षों को मिलाना होगा।

भाग 2: नया समाधान (CLARION)

इसे ठीक करने के लिए, शोधकर्ताओं ने एक नया सिस्टम बनाया जिसे CLARION कहा जाता है।

AI को बस एक बार में "सोचने और उत्तर देने" देने के बजाय, CLARION काम को दो अलग-अलग भूमिकाओं में विभाजित करता है, जैसे कि एक प्रोजेक्ट मैनेजर और एक रिसर्चर

1. प्रोजेक्ट मैनेजर (द प्लानिंग एजेंट)

कोई भी तथ्य खोजने से पहले, प्रोजेक्ट मैनेजर रुकता है और पूछता है:

  • "ठहरिए, उपयोगकर्ता वास्तव में क्या पूछ रहा है?"
  • "क्या इसमें कोई छिपे हुए अर्थ हैं?"
  • "यदि मैं इसे कार मान लूँ, तो मैं क्या मिस कर रहा हूँ? यदि मैं इसे गिटार मान लूँ, तो मैं क्या मिस कर रहा हूँ?"

मैनेजर एक योजना लिखता है: "ठीक है, हमें 'कार' वाले रास्ते की जांच करनी चाहिए और 'गिटार' वाले रास्ते की भी अलग से जांच करनी चाहिए। अभी दोनों को आपस में न मिलाएं।"

2. रिसर्चर (द एक्टिंग एजेंट)

रिसर्चर उस योजना को लेता है और काम पर लग जाता है।

  • वे कार के बारे में तथ्य खोजने के लिए लाइब्रेरी (इंटरनेट) जाते हैं।
  • वे गिटार के बारे में तथ्य खोजने के लिए लाइब्रेरी जाते हैं।
  • वे इन दोनों तथ्यों के सेट को अलग-अलग बक्सों में रखते हैं।

अंत में, वे दोनों बक्सों को प्रोजेक्ट मैनेजर के पास लाते हैं, जो उन्हें एक पूर्ण उत्तर में मिला देता है: "यह इस पर निर्भर करता है! यदि आपका मतलब कार से है, तो यह F-150 है। यदि आपका मतलब गिटार से है, तो यह सिंगल-कॉइल पिकअप है।"

यह क्यों महत्वपूर्ण है

यह पेपर दिखाता है कि जब आप AI को कार्य करने से पहले रुकने और योजना बनाने के लिए मजबूर करते हैं, तो वह उन मूर्खतापूर्ण गलतियों को करना बंद कर देता है जहाँ वह आधे सच को अनदेखा कर देता है।

  • पुराना तरीका: "Mustang? ओह, Ford! यह रहा F-150।" (गलत, यदि आपका मतलब गिटार से था)।
  • CLARION का तरीका: "Mustang? आइए दोनों विकल्पों की जाँच करें। विकल्प A: Ford F-150। विकल्प B: Fender Pickup। यहाँ पूरी कहानी है।"

मुख्य सीख (The Takeaway)

यह शोध हमें सिखाता है कि बुद्धिमान होने का मतलब केवल तथ्यों को जानना नहीं है; बल्कि यह जानना भी है कि कब रुकना है और सोचना है।

ठीक वैसे ही जैसे एक अच्छा जासूस किसी का बहाना (alibi) जाने बिना पहले संदिग्ध को गिरफ्तार नहीं करता, एक अच्छा AI भी किसी सवाल का जवाब देने से पहले यह जाँच नहीं करता कि क्या इसके अन्य अर्थ भी हो सकते हैं। MARCH बेंचमार्क साबित करता है कि वर्तमान AI इसमें कमजोर हैं, लेकिन CLARION हमें यह ब्लूप्रिंट दिखाता है कि कैसे ऐसे AI बनाए जा सकते हैं जो वास्तव में सावधान, गहन और वास्तविक दुनिया की जटिलताओं के लिए तैयार हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →