← नवीनतम पेपर
🤖 machine learning

Separable Pathways for Causal Reasoning: How Architectural Scaffolding Enables Hypothesis-Space Restructuring in LLM Agents

यह शोध पत्र प्रदर्शित करता है कि LLM एजेंटों को संदर्भ ग्राफ़ (context graphs) और गतिशील व्यवहारों (dynamic behaviors) की एक संरचनात्मक वास्तुकला से सुसज्जित करना उन्हें कारण संबंधी खोज (causal discovery) के दौरान अपने परिकल्पना स्थानों (hypothesis spaces) को पुनर्गठित करने में सक्षम बनाता है, जहाँ संदर्भ ग्राफ़ मुख्य रूप से तर्क की सटीकता को संचालित करते हैं और गतिशील व्यवहार शासन परिवर्तनों (regime changes) का पता लगाकर पात्रता सुनिश्चित करते हैं।

मूल लेखक: John Alderete, Sebastian Benthal, Connie Xu, John Xing

प्रकाशित 2026-04-23
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: John Alderete, Sebastian Benthal, Connie Xu, John Xing

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: AI को वास्तविकता के बारे में "अपनी राय बदलने" के लिए सिखाना

कल्पना कीजिए कि आप एक रोबोट को नया बोर्ड गेम खेलना सिखा रहे हैं। आप उसे नियम बताते हैं: "यदि आप यहाँ एक लाल टुकड़ा रखते हैं, तो आप जीत जाते हैं।" रोबोट इसे पूरी तरह से सीख लेता है।

लेकिन फिर, खेल के बीच में ही, नियम चुपके से बदल जाते हैं। अब, आप तभी जीतते हैं जब आप वहाँ एक नीला टुकड़ा रखते हैं। लाल टुकड़ा अब काम नहीं करता।

समस्या: वर्तमान AI (जैसे आज के स्मार्ट चैटबॉट्स) एक ऐसे छात्र की तरह है जिसने पहले नियमपुस्तिका को इतनी अच्छी तरह से रट लिया है कि जब नियम बदलते हैं, तो वह पुराने नियमों के अनुसार खेलने की कोशिश करता रहता है। वह भ्रमित हो जाता है, वही गलती करता रहता है, और उसे लगता है कि समस्या उसके साथ है, न कि खेल के साथ। उसमें यह महसूस करने की क्षमता की कमी है कि, "रुको, पूरा खेल ही बदल गया है; मुझे एक नई नियमपुस्तिका की आवश्यकता है।"

समाधान: यह शोध पत्र AI एजेंटों को बनाने का एक नया तरीका पेश करता है जो बिल्कुल यही कर सकते हैं। वे केवल तथ्य नहीं सीखते; वे साक्ष्य के मांग करने पर अपनी पूरी समझ को पुनर्गठित (restructure) कर सकते हैं।


दो-भाग वाला "मस्तिष्क" अपग्रेड

शोधकर्ताओं ने AI के लिए एक विशेष "स्कैफोल्डिंग" (एक सहायक संरचना) बनाई, जो दो अलग-अलग भागों से बनी है। इसे एक जासूस के कार्यालय को अपग्रेड करने जैसा समझें।

1. कॉन्टेक्स्ट ग्राफ (Context Graph): "जांच मानचित्र"

  • यह क्या है: किसी समस्या को हल करने का एक पूर्व-निर्धारित नक्शा। यह AI को बताता है: "पहले, एकल सुराग देखें। फिर, सुरागों के जोड़ों को देखें। फिर, जो आपने देखा है उसके बारे में सोचें। अंत में, एक अनुमान लगाएं।"
  • उपमा: कल्पना कीजिए कि एक जासूस जो बिना किसी योजना के इधर-उधर नहीं घूमता। उसके पास एक सख्त चेकलिस्ट है: 1. खिड़की की जांच करें। 2. दरवाजे की जांच करें। 3. पैरों के निशान की जांच करें।
  • यह क्या करता है: यह AI को व्यवस्थित होने में मदद करता है। यह AI को जल्दबाजी में निष्कर्ष निकालने या स्पष्ट सुरागों को छोड़ने से रोकता है। यह AI को वर्तमान नियमों के भीतर एक बेहतर विचारक बनाता है।

2. डायनेमिक बिहेवियर्स (Dynamic Behaviors): "रियलिटी चेक" अलार्म

  • यह क्या है: एक शांत मॉनिटर जो AI के काम पर नज़र रखता है। यदि AI चेकलिस्ट का पूरी तरह से पालन करता है लेकिन परिणाम फिर भी समझ में नहीं आते (उदाहरण के लिए, "मैंने खिड़की की जांच की, लेकिन कमरा अभी भी अंधेरा है!"), तो यह अलार्म बज उठता है।
  • उपमा: कल्पना कीजिए कि जासूस अपनी चेकलिस्ट का पालन कर रहा है, लेकिन अचानक उसका नक्शा कहता है कि "उत्तर यहाँ है," लेकिन सूरज पश्चिम में उग रहा है। डायनेमिक बिहेवियर वह सहज ज्ञान (gut feeling) है जो कहता है, "एक मिनट रुकिए। नक्शा गलत है। दुनिया बदल गई है। मुझे इस नक्शे को फेंकने और एक नया नक्शा बनाने की जरूरत है।"
  • यह क्या करता है: यह घटक पहचानता है कि कब "खेल के नियम" बदल गए हैं। यह AI को रुकने, यह महसूस करने के लिए मजबूर करता है कि पुराना सिद्धांत टूट गया है, और अपनी सोच को उन नई संभावनाओं तक विस्तारित करने के लिए प्रेरित करता है जिन्हें उसने पहले नहीं सोचा था।

प्रयोग: "ब्लिकेट डिटेक्टर" (Blicket Detector) गेम

इसका परीक्षण करने के लिए, शोधकर्ताओं ने मनोविज्ञान के एक क्लासिक खेल का उपयोग किया जिसे ब्लिकेट डिटेक्टर कहा जाता है।

  • सेटअप: एक मशीन है। आपके पास ब्लॉक (A, B, C, D, E) हैं। कुछ ब्लॉक "जादुई" (ब्लिकेट्स) हैं जो मशीन को चालू कर देते हैं।
  • ट्विस्ट: शुरुआत में, मशीन तब चालू होती है जब आप ब्लॉक A और ब्लॉक B को एक साथ रखते हैं (एक "कंजंक्टिव" नियम)। AI इसे समझ लेता है।
  • जाल: अचानक, AI को बताए बिना, नियम बदल जाता है। अब, मशीन तब चालू होती है जब आप अकेले ब्लॉक C रखते हैं (एक "डिस्कंजक्टिव" नियम)।
  • परीक्षण: क्या AI यह समझ पाता है कि नियम बदल गया है, A और B का उपयोग करना बंद कर देता है, और यह पता लगा लेता है कि C नया जादुई ब्लॉक है?

परिणाम: क्यों दोनों भाग आवश्यक हैं

शोधकर्ताओं ने तीन प्रकार के AI का परीक्षण किया:

  1. बेस AI: केवल मूल चैटबॉट (कोई नक्शा नहीं, कोई अलार्म नहीं)।
  2. मैप AI: इसके पास "जांच मानचित्र" (कॉन्टेक्स्ट ग्राफ) है लेकिन अलार्म नहीं है।
  3. सुपर AI: इसके पास मैप और अलार्म दोनों हैं (कॉन्टेक्स्ट ग्राफ + डायनेमिक बिहेवियर्स)।

यहाँ उन्हें क्या मिला:

  • केवल मैप (कॉन्टेक्स्ट ग्राफ): यह AI पहेली को हल करने में बहुत अच्छा था यदि नियम समान रहते। लेकिन जब नियम बदले, तो यह फंस गया। यह अपने चेकलिस्ट का पूरी तरह से पालन करता रहा, भले ही वह चेकलिस्ट अब बेकार थी। यह एक ऐसे सैनिक की तरह था जो दीवार में टकराने के बावजूद पूरी तरह से मार्च करता रहा क्योंकि नक्शे ने कहा था "आगे बढ़ो।"
  • केवल अलार्म (डायनेमिक बिहेवियर्स): बिना मैप के, अलार्म बहुत उपयोगी नहीं था क्योंकि अलार्म बजने के बाद भी AI नए नियमों का पालन करने के लिए बहुत अव्यवस्थित था।
  • सुपर AI (दोनों): यह विजेता था।
    • अलार्म ने नियम परिवर्तन को पहचाना और कहा, "रुको! पुराने नियम टूट गए हैं!" (इसने AI को पुराने समाधान पर समय बर्बाद करने से रोका)।
    • मैप ने फिर AI को नए ब्लॉकों को व्यवस्थित रूप से टेस्ट करने और नया समाधान खोजने में मदद की।

"आहा!" क्षण (The "Aha!" Moment):
अध्ययन ने पाया कि ये दो भाग अलग-अलग काम करते हैं।

  • मैप AI को एक विशिष्ट दुनिया के भीतर तर्क करने में स्मार्ट बनाता है।
  • अलार्म AI को एक टूटी हुई दुनिया को छोड़ने और एक नई दुनिया में प्रवेश करने के लिए पर्याप्त स्मार्ट बनाता है।
  • आप केवल मैप को बड़ा नहीं कर सकते; आपको स्विच करने के लिए अलार्म की आवश्यकता होती है।

"छिपा हुआ जाल" (The Exactly-N Problem)

शोधकर्ताओं ने एक मजेदार जाल भी खोजा। कभी-कभी, AI पहले नियम में इतना अच्छा हो जाता है कि वह नियम बदलने से ठीक पहले पहेली को हल कर लेता है। वह जीतता तो है, लेकिन वह समझ के कारण नहीं, बल्कि किस्मत से जीतता है।

  • उन्होंने एक नया मीट्रिक बनाया जिसे "रीजनिंग-एलिजिबल एक्यूरेसी" (Reasoning-Eligible Accuracy) कहा जाता है। यह केवल उन बारों को गिनता है जब AI ने वास्तव में नियम परिवर्तन को देखा और उसे समझना पड़ा।
  • उन्होंने पाया कि "सुपर AI" ही एकमात्र ऐसा था जो पुराने व्यवहारों पर टिके रहने के जाल से लगातार बच पाया।

निचोड़ (The Bottom Line)

यह शोध पत्र साबित करता है कि AI को केवल बड़ा या स्मार्ट होने की आवश्यकता नहीं है; इसे बेहतर आर्किटेक्चर की आवश्यकता है।

ठीक वैसे ही जैसे एक बच्चा दुनिया के बारे में सिद्धांत बनाकर और फिर उन्हें तब तक तोड़कर सीखता है जब वे फिट नहीं बैठते, AI को एक ऐसी प्रणाली की आवश्यकता है जो इसे अनुमति दे सके:

  1. अपनी सोच को संरचित करने की (मैप)।
  2. यह महसूस करने की कि उसकी संरचना गलत है (अलार्म)।
  3. चलते-फिरते एक नई संरचना बनाने की।

इस "स्कैफोल्डिंग" के बिना, AI केवल पुराने पैटर्न दोहराने वाला एक बहुत तेज़ तोता है। इसके साथ, AI वास्तव में सीख सकता है, अनुकूलित हो सकता है और बदलती दुनिया में समस्याओं को हल कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →