← नवीनतम पेपर
💬 NLP

SAGE-32B: Agentic Reasoning via Iterative Distillation

यह शोध पत्र SAGE-32B को प्रस्तुत करता है, जो Qwen2.5-32B पर आधारित एक 32-बिलियन-पैरामीटर वाला भाषा मॉडल है जो पुनरावृत्ति आसवन (iterative distillation) और एक प्रतिवर्ती तर्क (inverse reasoning) दृष्टिकोण के माध्यम से एजेंटिक तर्क और दीर्घकालिक योजना बनाने में विशेषज्ञता रखता है, जिससे यह समान आकार के मॉडलों की तुलना में मल्टी-टूल बेंचमार्क पर बेहतर प्रदर्शन प्राप्त करता है।

मूल लेखक: Basab Jha, Firoj Paudel, Ujjwal Puri, Ethan Henkel, Zhang Yuting, Mateusz Kowalczyk, Mei Huang, Choi Donghyuk, Wang Junhao

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Basab Jha, Firoj Paudel, Ujjwal Puri, Ethan Henkel, Zhang Yuting, Mateusz Kowalczyk, Mei Huang, Choi Donghyuk, Wang Junhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ SAGE-32B पर आधारित शोध पत्र का एक सरल और रचनात्मक स्पष्टीकरण दिया गया है, जिसे तकनीकी ज्ञान के बिना भी कोई भी समझ सकता है।

कल्पना कीजिए कि आपको उपकरणों, दस्तावेजों और समय-सीमाओं से भरे एक जटिल घर को संभालने के लिए एक व्यक्तिगत सहायक (Personal Assistant) रखने की आवश्यकता है।

1. समस्या: "बातूनी" सहायक बनाम "परिचालन" (Operational) सहायक

हाल तक, आर्टिफिशियल इंटेलिजेंस (जैसे कि वे चैटबॉट्स जिनका हम सभी उपयोग करते हैं) अच्छे बातचीत करने वालों की तरह थे। यदि आप उनसे पूछते, "मौसम के बारे में आपका क्या विचार है?", तो वे धाराप्रवाह और सुखद उत्तर देते। लेकिन यदि आप कहते: "जाकर फ्रिज चेक करो, अगर दूध खत्म है तो खरीद लो, फिर कूरियर को कॉल करके पैकेज भेजने के लिए कहो, और सुनिश्चित करो कि दरवाजा बंद है", तो वे अक्सर भटक जाते थे।

  • वे दूसरे कदम के बाद ही भ्रमित हो जाते थे।
  • वे चीजें बना लेते थे (जैसे, "मैंने दूध खरीद लिया" जबकि उन्होंने खरीदा ही नहीं था)।
  • यदि कुछ गलत हो जाता, तो उन्हें नहीं पता होता था कि गलती से कैसे उबरना है।

ये काम करने के लिए, विशाल मॉडल्स की आवश्यकता होती थी (जैसे कि वे जिनमें 100 बिलियन "न्यूरॉन्स" हों), लेकिन वे अत्यंत महंगे और धीमे थे, जैसे अखबार लेने के लिए रॉकेट का उपयोग करना।

2. समाधान: SAGE-32B, एक "साइट मैनेजर"

लेखकों ने SAGE-32B बनाया है। यह एक छोटा मॉडल है (32 बिलियन पैरामीटर्स), लेकिन इसे अलग तरह से प्रशिक्षित किया गया है। यह केवल बातें करने वाला नहीं है; यह एक साइट मैनेजर है।

  • यह सजावट के लिए बात नहीं करता: इसका लक्ष्य काम करना है।
  • यह विशिष्ट है: इसे विशेष रूप से टूल्स (APIs, डेटाबेस, कोड) का उपयोग करने और लंबी योजनाएं बनाने के लिए प्रशिक्षित किया गया है।

3. जादू के दो रहस्य

A. "मिरर" ट्रेनिंग (इटरेटिव डिस्टिलेशन - Iterative Distillation)

एक बच्चे को गाड़ी चलाना सिखाने की कल्पना करें।

  • पुरानी विधि: आप उन्हें स्टीयरिंग व्हील देते हैं और कहते हैं "चलाओ!" यदि वे गलती करते हैं, तो आप उन्हें डांटते हैं।
  • SAGE विधि (इटरेटिव डिस्टिलेशन): उन्होंने एक "मास्टर" (एक बहुत शक्तिशाली आर्टिफिशियल इंटेलिजेंस) का उपयोग किया जो अपने आप गाड़ी चलाता था। फिर, हर बार जब मास्टर कोई गलती करता, तो सिस्टम कहता: "हे, यहाँ देखो! तुमने कोड दर्ज करने में गलती की। तुम्हें इसे इस तरह से करना चाहिए था।"
    उन्होंने मॉडल को लाखों ऐसे "गलती और सुधार सिमुलेशन" (error and correction simulations) के माध्यम से प्रशिक्षित किया। परिणाम? SAGE न केवल काम करना जानता है, बल्कि वह यह भी जानता है कि कब वह गलती करने वाला है और गलती करने से पहले खुद को कैसे सुधारा जाए। यह एक ऐसे पायलट की तरह है जिसने लाखों तूफानी लैंडिंग सिमुलेशन किए हों।

B. "दूसरा विचार" (इनवर्स रीजनिंग - Inverse Reasoning)

यह सबसे अभिनव हिस्सा है।
आमतौर पर, एक AI रैखिक (linear) रूप से सोचता है: "मुझे A करना है, फिर B, फिर C"‌। यदि A गलत है, तो बाकी सब कुछ ढह जाता है।
SAGE के पास एक "क्रिटिकल ब्रेन" (जिसे मेटा-कॉग्निटिव हेड कहा जाता है) है जो एक "दूसरे विचार" या आंतरिक "डेविल्स एडवोकेट" की तरह काम करता है।

  • किसी कार्य को निष्पादित करने से पहले, SAGE खुद से पूछता है: "रुको, अगर मैं यह करता हूँ, तो 10 मिनट में क्या होगा? क्या यह तार्किक है?"
  • यह "इनवर्स रीजनिंग" तकनीक का उपयोग करता है: केवल आगे देखने के बजाय, यह अंतिम परिणाम की कल्पना करता है और जांचता है कि क्या वर्तमान योजना वास्तव में वहां तक ले जाती है। यदि योजना सफल नहीं होती, तो यह उसे छोड़ देता है और दूसरा प्रयास करता है।
  • रूपक (Metaphor): यह वैसा ही है जैसे जब आप एक महत्वपूर्ण ईमेल लिख रहे होते हैं। आप उसे तुरंत नहीं भेजते। आप उसे दोबारा पढ़ते हैं और खुद से पूछते हैं: "यदि प्राप्तकर्ता इसे पढ़ता है, तो क्या वह समझ पाएगा कि मैं क्या चाहता हूँ?" यदि उत्तर 'नहीं' है, तो आप उसे फिर से लिखते हैं। SAGE यह काम मिलीसेकंड में करता है।

4. परिणाम: तेज़, सस्ता, अधिक विश्वसनीय

शोध पत्र दिखाता है कि SAGE-32B:

  1. दिग्गजों को पछाड़ देता है: व्यावहारिक कार्यों में (जैसे जटिल गणितीय समस्याओं को हल करना या सॉफ्टवेयर टूल्स का उपयोग करना), यह बहुत बड़े और महंगे मॉडल्स (जैसे GPT-4 Turbo या Llama-70B) से बेहतर प्रदर्शन करता है।
  2. पैसे बचाता है: छोटा होने के कारण, इसे चलाना बहुत कम लागत वाला है।
  3. भटकता नहीं है: यदि किसी कार्य में 20 कदम आवश्यक हैं, तो SAGE बिना पागल हुए अंत तक पहुँच जाता है, जबकि अन्य मॉडल्स अक्सर 5वें कदम के बाद ही अटक जाते हैं।

5. सीमाएं (ईमानदारी से)

SAGE हर चीज़ के लिए परफेक्ट नहीं है।

  • यह कलाकार नहीं है: यदि आप इसे कोई मज़ेदार कविता लिखने या चैट करने के लिए कहते हैं, तो यह कठोर और उबाऊ होगा। इसे एक "श्रमिक" के रूप में प्रशिक्षित किया गया है, न कि एक "कवि" के रूप में।
  • यह अराजकता में खो जाता है: यदि आप इसे भ्रमित या अस्पष्ट निर्देश देते हैं, तो यह अटक सकता है। इसे स्पष्ट नियमों की आवश्यकता होती है, जैसे कारखाने में एक रोबोट को होती है।

सारांश में

SAGE-32B एक ऐसी स्पोर्ट्स कार से स्विच करने जैसा है जो बहुत तेज़ चलती है लेकिन चलाने में कठिन है (विशाल मॉडल्स), और एक मजबूत और विश्वसनीय ऑफ-रोड वाहन की ओर बढ़ने जैसा है। यह हर चीज़ में सबसे तेज़ नहीं है, लेकिन यदि आपको कठिन रास्तों (जटिल कार्य, टूल का उपयोग, त्रुटि सुधार) को पार करना है, तो यही वह वाहन है जो बिना खराब हुए और कम ईंधन खर्च किए गंतव्य तक पहुँचता है।

यह इस बात का प्रमाण है कि चीजों को अच्छी तरह से करने के लिए, आपको हमेशा "बड़ा" होने की आवश्यकता नहीं होती; आपको बस सोचने के तरीके में स्मार्ट होने की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →