← नवीनतम पेपर
💬 NLP

Deep Reasoning in General Purpose Agents via Structured Meta-Cognition

यह शोध पत्र 'डीप रीजनिंग' (Deep Reasoning) को प्रस्तुत करता है, जो 'DOLOLES' एजेंट में निहित एक मेटा-कॉग्निटिव ढांचा है, जो इन्फरेंस के समय गतिशील रूप से कार्य-विशिष्ट रीजनिंग स्कैफोल्ड्स का निर्माण करता है, जिससे यह विविध जटिल बेंचमार्क पर अत्याधुनिक विधियों से बेहतर प्रदर्शन करने और यहाँ तक कि छोटे और बड़े मॉडलों के बीच स्केलिंग अंतराल को पाटने में सक्षम होता है।

मूल लेखक: Dean Light, Michael Theologitis, Kshitish Ghate, Shuyue Stella Li, Benjamin Newman, Chirag Shah, Aylin Caliskan, Pang Wei Koh, Dan Suciu, Yulia Tsvetkov

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dean Light, Michael Theologitis, Kshitish Ghate, Shuyue Stella Li, Benjamin Newman, Chirag Shah, Aylin Caliskan, Pang Wei Koh, Dan Suciu, Yulia Tsvetkov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही जटिल पहेली को सुलझाने की कोशिश कर रहे हैं, जैसे कि यह पता लगाना कि सैन फ्रांसिस्को के किस वॉलीबॉल कोर्ट में सबसे अधिक टाई-ब्रेकर मैच खेले गए हैं।

पुराना तरीका (वर्तमान AI एजेंट्स):
वर्तमान AI एजेंट्स को एक अकेले, अत्यधिक काम करने वाले जासूस के रूप में सोचें जिसे एक कठोर नियम पुस्तिका दी गई है। नियम पुस्तिका कहती है: "पहले, एक प्रश्न पूछें। फिर, एक उत्तर खोजें। फिर, एक निष्कर्ष लिखें।"
यदि जासूस दूसरे चरण पर अटक जाता है, या यदि पहेली के लिए बीच में अपनी रणनीति बदलने की आवश्यकता होती है, तो वे अक्सर घबरा जाते हैं। वे एक बार में बहुत कुछ करने की कोशिश करते हैं, भ्रमित हो जाते हैं, मनगढ़ंत बातें बनाने लगते हैं (हैलुसिनेशन), या पूरी तरह से हार मान लेते हैं क्योंकि मानसिक भार एक व्यक्ति के लिए बहुत अधिक होता है।

नया तरीका (डीप रीजनिंग और DOLORES):
यह पेपर DOLORES नामक एक नई प्रणाली पेश करता है। एक अकेले जासूस के रूप में सब कुछ अकेले करने के बजाय, DOLORES एक बुद्धिमान प्रोजेक्ट मैनेजर की तरह कार्य करता है जो एक विशाल, डरावनी समस्या को छोटे, प्रबंधनीय टुकड़ों में तोड़ने का ज्ञान रखता है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:

1. "जस्ट-इन-टाइम" ब्लूप्रिंट (यथासमय खाका)

अधिकांश AI सिस्टमों के पास एक निश्चित योजना (स्कैफोल्ड) होती है जो समस्या देखने से पहले ही बना दी जाती है। यह एक फैक्ट्री असेंबली लाइन की तरह है जिसे केवल लाल कारें बनाने के लिए डिज़ाइन किया गया है। यदि आप वहां एक नीला ट्रक ले आते हैं, तो लाइन टूट जाती है।

DOLORES अलग है। यह डीप रीजनिंग (गहन तर्क) का उपयोग करता है, जो एक मास्टर आर्किटेक्ट की तरह है जो आपके पास अभी मौजूद विशिष्ट पहेली को देखता है और तुरंत एक कस्टम ब्लूप्रिंट बनाता है। यह किसी पूर्व-लिखित स्क्रिप्ट का पालन नहीं करता है; यह इस बात का पता लगाता है कि इस विशिष्ट समस्या को हल करने का सबसे अच्छा तरीका क्या है।

2. तीन महाशक्तियाँ

पेपर बताता है कि मनुष्य समस्याओं को हल करने में अच्छे होते हैं क्योंकि हम सोचने के विभिन्न तरीकों के बीच स्विच करते हैं। DOLORES इसे तीन अलग-अलग "उपकरणों" का उपयोग करके दोहराता है:

  • सहज विश्लेषक (एसोसिएटिव रीजनिंग): यह वह हिस्सा है जो अंतर्ज्ञान और पैटर्न पहचान का उपयोग करता है। उदाहरण के लिए, यह जानना कि "सिटी बाय द बे" का अर्थ "सैन फ्रांसिस्को" है, बिना किसी शब्दकोश की आवश्यकता के। DOLORES इसके लिए एक LLM (एक लार्ज लैंग्वेज मॉडल) का उपयोग करता है।
  • कैलकुलेटर (फॉर्मल रीजनिंग): यह वह हिस्सा है जो सख्त नियमों का पालन करता है। यदि आपके पास स्कोर की एक सूची है जैसे "3-2, 3-0, 2-3," तो कैलकुलेटर उन्हें सटीक रूप से गिनता है। DOLORES इसके लिए कंप्यूटर कोड (पायथन) का उपयोग करता है क्योंकि कंप्यूटर गणित और तर्क में उत्तम होते हैं।
  • प्रोजेक्ट मैनेजर (मेटा-रीजनिंग): यह बॉस है। यह पूरी तस्वीर को देखता है और कहता है, "ठीक है, पहले हमें शहर को खोजना होगा (सहज), फिर हमें कोर्ट की सूची बनानी होगी (सहज), फिर हमें स्कोर गिनने होंगे (कैलकुलेटर), और अंत में, हम विजेता चुनेंगे।"

3. "कॉग्निटिव लोड" (संज्ञानात्मक भार) को तोड़ना

वर्तमान AI की सबसे बड़ी समस्या यह है कि यह एक ही बार में एक बड़े "ब्रेन डंप" में तीनों चरणों को करने की कोशिश करता है। यह एक ही व्यक्ति से एक फोन नंबर याद रखने, लंबी भाग देने और एक कविता लिखने के लिए एक साथ कहने जैसा है। वे विफल हो जाएंगे।

DOLORES इसे डेलिगेशन (प्रतिनिधि नियुक्त करना) द्वारा हल करता है।

  • यह "सहज विश्लेषक" से शहर खोजने के लिए कहता है।
  • यह उस उत्तर को लेता है और उसे गणित करने के लिए एक "कैलकुलेटर" को सौंप देता है।
  • यह प्रवाह को बनाए रखने के लिए "प्रोजेक्ट मैनेजर" को प्रभारी रखता है।

काम को अलग-अलग थ्रेड्स में विभाजित करके, कोई भी एकल हिस्सा अभिभूत नहीं होता है। यह रोकता है कि AI "हैलुसिनेट" करे (मनगढ़ंत बातें बनाए) या जल्दी हार मान ले।

4. मानव "ट्रेस" (चिह्नों) से सीखना

DOLORES को ये ब्लूप्रिंट कैसे पता चलते हैं? यह मनुष्यों से सीखता है।
शोधकर्ताओं ने इस बात के उदाहरण लिए हैं कि एक मनुष्य समस्या को हल करने के लिए कैसे बातचीत करता है (जैसे, "पहले, मैं शहर का पता लगाऊंगा, फिर मैं कोर्ट की सूची बनाऊंगा...")। उन्होंने इन मानवीय विचारों को एक विशेष "भाषा" में अनुवादित किया जिसे AI समझ सकता है।
यह एक रोबोट को एक मानव शेफ को सब्जियां काटते हुए देखते हुए सिखाने जैसा है, फिर रोबोट को कहना, "वही करें जो आपने देखा, लेकिन इसे इन विशिष्ट चरणों में तोड़ दें।"

परिणाम

DOLORES का परीक्षण चार बहुत कठिन परीक्षणों (जैसे विशाल दस्तावेजों में जानकारी ढूंढना या बहु-चरणीय तर्क पहेलियों को हल करना) पर सर्वश्रेष्ठ वर्तमान AI विधियों के विरुद्ध किया गया।

  • परिणाम: DOLORES लगभग हर बार जीता, यहाँ तक कि एक छोटे, सस्ते कंप्यूटर मॉडल (8 बिलियन पैरामीटर्स) का उपयोग करने के बावजूद जिसने अन्य विधियों द्वारा उपयोग किए जाने वाले बहुत बड़े, अधिक महंगे मॉडलों (32 बिलियन पैरामीटर्स) को भी हरा दिया।
  • क्यों? क्योंकि छोटा मॉडल, जब DOLORES के स्मार्ट "प्रोजेक्ट मैनेजर" द्वारा निर्देशित होता है, तो उसे पूरी समस्या का भार अकेले उठाने की आवश्यकता नहीं होती। उसे केवल छोटे, आसान हिस्सों को ही उठाना होता है।

सारांश में:
पेपर का दावा है कि AI को एक मानव प्रोजेक्ट मैनेजर की तरह कार्य करना सिखाकर—बड़ी समस्याओं को छोटे, विशिष्ट कार्यों में तोड़कर और आवश्यकतानुसार "अंतर्ज्ञान" और "सख्त गणित" के बीच स्विच करके—हम AI को बहुत अधिक स्मार्ट, अधिक विश्वसनीय और गलतियाँ करने की कम संभावना वाला बना सकते हैं, भले ही वह AI उपलब्ध सबसे बड़े या सबसे शक्तिशाली मॉडल में से न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →