← नवीनतम पेपर
🤖 AI

A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination

A-SR एक स्व-विकसित एजेंटिक फ्रेमवर्क है जो एकीकृत प्रस्ताव लूपों (unified proposal loops) को पदानुक्रमित, भूमिका-आधारित समन्वय (hierarchical, role-conditioned coordination) और अनुकूलन योग्य मेमोरी रूटिंग (adaptive memory routing) से बदलकर सिम्बोलिक रिग्रेशन को उन्नत करता है, जिससे सिंथेटिक और वास्तविक दुनिया के वैज्ञानिक खोज कार्यों पर मौजूदा LLM-निर्देशित विधियों की तुलना में महत्वपूर्ण सटीकता सुधार प्राप्त होता है।

मूल लेखक: Wenxiao Zhao, Dong Liu, Kaiyi Xu, Feng Liu, Zhen Zhao, Fei Ben, Shu Wang, Wenhao Li, Yingnian Wu, Fenghua Ling, Haobo Li, Lei Bai

प्रकाशित 2026-08-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenxiao Zhao, Dong Liu, Kaiyi Xu, Feng Liu, Zhen Zhao, Fei Ben, Shu Wang, Wenhao Li, Yingnian Wu, Fenghua Ling, Haobo Li, Lei Bai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे एक जासूस हैं, लेकिन आपके सुराग उंगलियों के निशान या अलबी (alibi) नहीं, बल्कि एक स्प्रेडशीट पर लिखे अंक हैं। आपका लक्ष्य उस छिपे हुए "नुस्खे" (recipe) को खोजना है—एक साफ, लिखित गणितीय समीकरण—जो बताता है कि वे अंक कैसे व्यवहार करते हैं। यह सिंबोलिक रिग्रेशन (Symbolic Regression) की दुनिया है। मानक कंप्यूटर प्रोग्रामों के विपरीत, जो केवल उत्तर देने के लिए संख्याओं को प्रोसेस करते हैं, सिंबोलिक रिग्रेशन वास्तव में प्रकृति के वास्तविक नियम को लिखने की कोशिश करता है, जैसे कि $F=ma$ या गुरुत्वाकर्षण का सूत्र, इस तरह कि इसे इंसान समझ सकें। यह एक ऐसे 'ब्लैक बॉक्स' और एक मौसम विज्ञानी के बीच का अंतर है जो केवल मौसम की भविष्यवाणी करता है और वह जो यह समझा सके कि तूफान क्यों आ रहा है।

लंबे समय से, वैज्ञानिक इन नुस्खों की खोज के लिए कंप्यूटरों का उपयोग करते आए हैं, लेकिन यह प्रक्रिया काफी अनाड़ी है। यह एक टूटी हुई घड़ी को बदलने वाले गियरों को बेतरतीब ढंग से बदलकर ठीक करने की कोशिश करने जैसा है और उम्मीद करने जैसा है कि वह चलने लगेगी। यदि घड़ी काम नहीं करती है, तो कंप्यूटर बस एक "खराब स्कोर" प्राप्त करता है और फिर से प्रयास करता है, अक्सर वही गलतियाँ बार-बार करता है। हाल ही में, वैज्ञानिकों ने इन समीकरणों को लिखने में मदद करने के लिए लार्ज लैंग्वेज मॉडल्स (LLMs)—उन सुपर-स्मार्ट AI चैटबॉट्स की तरह जिन्हें आप जानते होंगे—का उपयोग करना शुरू किया है। ये AI शब्दों (या गणितीय प्रतीकों) का अनुमान लगाने में माहिर हैं, लेकिन वे अभी भी अटक सकते हैं, ऐसे समीकरण लिख सकते हैं जिनका कोई अर्थ नहीं है, या जटिल डेटा के मामले में भ्रमित हो सकते हैं। बड़ा सवाल यह है: हम इन AI जासूसों को बेतरतीब ढंग से अनुमान लगाना बंद करके विशेषज्ञों की एक वास्तविक टीम की तरह काम करना कैसे सिखाएं?

यहाँ A-SR आता है, एक नई विधि जो गणितीय सूत्रों की खोज को एक एकल प्रदर्शन के बजाय, एक सुव्यवस्थित टीम के प्रयास के रूप में देखती है। इस पेपर के पीछे के शोधकर्ता, वेनक्सियाओ झाओ (Wenxiao Zhao) और उनके सहयोगियों ने महसूस किया कि पुराना तरीका बहुत कठोर था। अतीत में, एक AI केवल एक समीकरण प्रस्तावित करता था, एक स्कोर प्राप्त करता था, और फिर से प्रयास करता था। यदि समीकरण टूटा हुआ था, तो AI इसे अधिक संख्याएँ जोड़कर ठीक करने की कोशिश कर सकता था, या यदि यह बहुत सरल था, तो यह इसे अधिक जटिल बनाने की कोशिश कर सकता था, बिना वास्तव में यह समझे कि यह क्यों विफल हुआ।

A-SR, AI को एक "मैनेजर" और विशेषज्ञों की एक टीम देकर खेल बदल देता है। एक न्यूज़रूम की कल्पना करें जहाँ मुख्य संपादक (कोऑर्डिनेटर) केवल एक रिपोर्टर को कहानी लिखने के लिए नहीं कहता। इसके बजाय, संपादक दिन की घटनाओं को देखता है और तय करता है कि किस विशेषज्ञ की आवश्यकता है। यदि कहानी त्रुटियों से भरी है, तो संपादक तथ्यों की जाँच करने के लिए रिव्यूअर (Reviewer) को बुलाता है। यदि कहानी उबाऊ है और उसे एक नए दृष्टिकोण की आवश्यकता है, तो जेनरेटर (Generator) को नए विचार मंथन करने के लिए बुलाया जाता है। यदि कहानी बहुत लंबी और भ्रमित करने वाली है, तो फालतू बातों को काटने के लिए सिम्प्लीफायर (Simplifier) को लाया जाता है। और यदि कहानी में पहेली का कोई महत्वपूर्ण हिस्सा गायब है, तो एनालिस्ट (Analyst) लापता कड़ी खोजने के लिए अभिलेखागारों की खुदाई करता है।

A-SR को जो चीज़ खास बनाती है वह यह है कि यह टीम केवल एक निश्चित कार्यक्रम का पालन नहीं करती है। "संपादक" स्वयं विकसित (self-evolving) होने वाला है। यह वास्तविक समय में देखता है कि खोज कैसे चल रही है। यदि टीम गलतियाँ करने के लूप में फंस जाती है, तो संपादक रणनीति बदल देता है, शायद टीम को नए विचारों की खोज करने के बजाय टूटे हुए विचारों को ठीक करने पर ध्यान केंद्रित करने के लिए कहता है। यह एक "मेमोरी" भी रखता है कि क्या काम किया और क्या नहीं, और उस जानकारी को सही विशेषज्ञ तक पहुँचाता है। उदाहरण के लिए, यदि टीम किसी विशिष्ट प्रकार की गणितीय त्रुटि के कारण बार-बार विफल हो रही है, तो उस विफलता को रिव्यूअर को भेजा जाता है, जो फिर टीम को अगली बार इससे बचने के तरीके सिखाता है।

पेपर दिखाता है कि यह दृष्टिकोण अविश्वसनीय रूप से अच्छा काम करता है। विभिन्न वैज्ञानिक पहेलियों पर परीक्षण किए जाने पर—रसायन कैसे प्रतिक्रिया करते हैं या सामग्रियां दबाव में कैसे खिंचती हैं—A-SR ने पिछले तरीकों की तुलना में बहुत अधिक बार सही गणितीय "नुस्खे" खोजे। एक परीक्षण सेट में, Llama3.1-8B मॉडल का उपयोग करते हुए, सफलता दर लगभग 25.79% से बढ़कर 48.30% हो गई। यह उन समस्याओं की संख्या को लगभग दोगुना करने जैसा है जिन्हें AI सही ढंग से हल कर सका। और भी प्रभावशाली बात यह है कि जब उन्होंने इन टीम प्रयासों से सीखे गए सबक एक छोटे, ओपन-सोर्स AI मॉडल (Qwen3-4B) को सिखाए, तो उस छोटे मॉडल की सफलता दर भी काफी बढ़ गई, जो 24.58% से बढ़कर 38.29% हो गई।

शोधकर्ताओं ने वास्तविक दुनिया के डेटा, जैसे बैक्टीरिया के विकास और यांत्रिक प्रणालियों के कंपन पर भी A-SR का परीक्षण किया। इन कठिन, शोर वाले वास्तविक जीवन के परिदृश्यों में, A-SR ने 8 में से 7 मामलों में सर्वश्रेष्ठ गणितीय विवरण खोजने में सफलता प्राप्त की, जो अन्य शीर्ष तरीकों को भी पीछे छोड़ गया। मुख्य निष्कर्ष यह नहीं है कि AI गणित में बेहतर हो गया है; बल्कि यह है कि AI ने अपनी गलतियों के बारे में सोचना सीख लिया है। लाखों रैंडम संयोजनों को अंधाधुंध आज़माने के बजाय, इसने अपनी विफलताओं का निदान करना, आवश्यकतानुसार भूमिकाएँ बदलना और एक ही गलती को दोहराने से बचने के लिए अपनी मेमोरी का उपयोग करना सीख लिया है। यह एक अराजक एकल खोज से एक स्मार्ट, समन्वित टीम के एजेंटों में बदलाव है, जिनमें से प्रत्येक वही करता है जिसमें वह सबसे अच्छा है, एक ऐसे मैनेजर द्वारा निर्देशित होता है जो जानता है कि कब नए विचारों के लिए जोर देना है और कब रुकना है और जो टूटा हुआ है उसे ठीक करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →