← नवीनतम पेपर
🤖 machine learning

InsightSR: Refining Symbolic Regression Search Spaces via Parallel Semantic and Structural LLM Guidance

InsightSR एक नवीन सिम्बोलिक रिग्रेशन फ्रेमवर्क है जो बड़े भाषा मॉडल (Large Language Models) का लाभ उठाकर सिमेंटिक और स्ट्रक्चरल मार्गदर्शन के माध्यम से सर्च स्पेस को पुनरावर्ती रूप से परिष्कृत करके PySR जेनेटिक प्रोग्रामिंग इंजन को उन्नत करता है, जो गहरे एक्सप्रेशन ट्री निर्माण को सिमेंटिक रूप से सूचित फीचर्स पर उथले पेड़ों के संयोजन में बदलकर अत्याधुनिक सटीकता और सामान्यीकरण प्राप्त करता है।

मूल लेखक: Yating Ling, Wenjing Cun, Zhitang Chen

प्रकाशित 2026-08-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yating Ling, Wenjing Cun, Zhitang Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

विज्ञान हमेशा से एक सरल, शक्तिशाली विचार पर निर्भर रहा है: कि प्राकृतिक दुनिया के जटिल व्यवहार को संक्षिप्त गणितीय नियमों द्वारा वर्णित किया जा सकता है। जब एक भौतिक विज्ञानी गिरते हुए सेब या ग्रहों की कक्षा को देखता है, तो वह केवल गति को नहीं देख रहा होता; वह उस छिपे हुए समीकरण की तलाश कर रहा होता है जो इसे नियंत्रित करता है। इस अंतर्निहित सूत्र की खोज को 'सिंबोलिक रिग्रेशन' (symbolic regression) कहा जाता है। मानक कंप्यूटर मॉडल के विपरीत, जो डेटा को फिट करने के लिए लाखों आंतरिक नॉब्स को समायोजित करके पैटर्न सीखते हैं, सिंबोलिक रिग्रेशन स्वयं वास्तविक समीकरण लिखने का प्रयास करता है, जिसमें जोड़, गुणा और त्रिकोणमितीय फलनों जैसे परिचित गणितीय घटकों का उपयोग किया जाता है। लक्ष्य एक ऐसा नियम खोजना है जो न केवल सटीक हो, बल्कि इतना सरल भी हो कि एक मनुष्य उसे पढ़ और समझ सके। हालाँकि, इन नियमों को खोजना अविश्वसनीय रूप से कठिन है। गणितीय संयोजनों की संख्या इतनी तेजी से बढ़ती है कि यह संभावनाओं का एक विशाल, अराजक महासागर बन जाता है। अधिकांश कंप्यूटर खोजें इस महासागर में खो जाती हैं, ऐसे सूत्र बनाती हैं जो डेटा को पूरी तरह से फिट तो करते हैं लेकिन जिनका कोई भौतिक अर्थ नहीं होता, या वे वास्तविक नियम खोजने में विफल हो जाती हैं क्योंकि खोज क्षेत्र बहुत बड़ा होता है।

शोधकर्ताओं की एक टीम ने इस अराजकता से निपटने के लिए एक नया दृष्टिकोण विकसित किया है, जो विकासवादी एल्गोरिदम (evolutionary algorithms) की कच्ची खोज शक्ति को बड़े भाषा मॉडल (large language models) की तर्क क्षमता के साथ जोड़ता है। उनका सिस्टम, जिसका नाम 'इनसाइट एसआर' (InsightSR) है, कंप्यूटर से सीधे अंतिम उत्तर का अनुमान लगाने के लिए नहीं कहता है। इसके बजाय, यह भाषा मॉडल का उपयोग खोज को ही नया आकार देने के लिए एक मार्गदर्शक के रूप में करता है। कल्पना कीजिए कि खोजकर्ताओं की एक टीम एक घने, अनछुए जंगल के माध्यम से एक विशिष्ट पथ खोजने की कोशिश कर रही है। पुराने तरीके में, खोजकर्ता बेतरतीब ढंग से भटकते रहेंगे, इस उम्मीद में कि वे सही रास्ते से टकरा जाएंगे। इस नई पद्धति में, भाषा मॉडल एक अनुभवी मार्गदर्शक की तरह कार्य करता है जिसे सामान्य इलाके का ज्ञान है। वह उनके लिए रास्ता नहीं चलता, बल्कि वह उन्हें बताता है कि कौन सी दिशाएं भौतिक रूप से असंभव हैं और यात्रा के लिए कौन से उपकरण उपयोगी हो सकते हैं।

यह प्रणाली मार्गदर्शन को दो पूरक धाराओं में विभाजित करके कार्य करती है। पहली धारा समीकरण के "कंकाल" (skeleton) पर ध्यान केंद्रित करती है। भाषा मॉडल डेटा की भौतिक इकाइयों को देखता है—जैसे कि क्या कोई चर समय, दूरी या द्रव्यमान का प्रतिनिधित्व करता है—और उन बुनियादी संरचनाओं का प्रस्ताव देता है जो आयामी रूप से सुसंगत (dimensionally consistent) होनी चाहिए। इसका अर्थ है कि यह किसी भी ऐसे गणितीय संयोजन को खारिज कर देता है जो भौतिकी के नियमों का उल्लंघन करेगा, जैसे कि समय के माप को दूरी के साथ जोड़ना। इन भौतिक रूप से संभावित शुरुआती बिंदुओं के साथ खोज को शुरू करके, यह प्रणाली असंभव सूत्रों के अरबों चक्करों में समय बर्बाद करने से बचती है। दूसरी धारा स्वयं सामग्रियों (ingredients) पर ध्यान केंद्रित करती है। भाषा मॉडल डेटा को बदलने के नए तरीके सुझाता है, जैसे कि किसी चर का वर्ग करना या उसका साइन (sine) लेना, जो उसने पिछले प्रयासों में देखे गए पैटर्न के आधार पर किया हो। ये नए फीचर्स (features) उपलब्ध सामग्रियों के पूल में जोड़ दिए जाते हैं। समय के साथ, सामग्रियों का पूल समृद्ध होता जाता है, जिससे सिस्टम कच्चे डेटा के गहरे, उलझे हुए पेड़ों के निर्माण के बजाय सरल, उथले संयोजनों का उपयोग करके जटिल संबंधों का निर्माण करने में सक्षम होता है।

यह प्रक्रिया एक बार का अनुमान नहीं बल्कि परिशोधन का एक निरंतर चक्र है। इसके बाद कंप्यूटर संभावित समीकरणों का एक सेट उत्पन्न करता है, और भाषा मॉडल उनका मूल्यांकन करता है। यह न केवल यह जाँचता है कि वे संख्याओं के साथ कितनी अच्छी तरह फिट होते हैं, बल्कि यह भी देखता है कि नए फीचर्स कितने उपयोगी थे और क्या संरचना का कोई अर्थ है। यह फीडबैक एक गतिशील ज्ञान आधार (knowledge base) में संग्रहीत किया जाता है जो खोज के अगले दौर को सूचित करता है। यह प्रणाली अपनी सफलताओं और विफलताओं से सीखती है, और धीरे-धीरे खोज को सबसे आशाजनक समाधानों की ओर सीमित करती है। यह एक स्व-सुधारात्मक चक्र बनाता है जहाँ प्रत्येक पुनरावृत्ति के साथ खोज अधिक केंद्रित और कुशल होती जाती है।

शोधकर्ताओं ने इस पद्धति का परीक्षण तीन अलग-अलग चुनौतियों पर किया। सबसे पहले, उन्होंने शास्त्रीय यांत्रिकी से लेकर क्वांटम सिद्धांत तक, 100 प्रसिद्ध भौतिक समीकरणों के एक बेंचमार्क का उपयोग किया। इस परीक्षण में, सिस्टम ने 95% बार सटीक मूल सूत्र को सफलतापूर्वक पुनः प्राप्त किया, जो पिछले तरीकों की तुलना में एक महत्वपूर्ण सुधार है। इसने रसायन विज्ञान, जीव विज्ञान और पदार्थ विज्ञान से जुड़ी जटिल रूपांतरण वाली कार्यों पर 80% से अधिक की सटीकता प्राप्त करते हुए, वैज्ञानिक समस्याओं के एक व्यापक सेट पर भी असाधारण प्रदर्शन किया। अंत में, टीम ने वास्तविक दुनिया के डेटा, जैसे कि एक ऑसिलेटर के कंपन और बैक्टीरिया के विकास पैटर्न पर इस प्रणाली का परीक्षण किया। इन परिदृश्यों में, सिस्टम ने न केवल सटीक सूत्र खोजे, बल्कि उस डेटा पर भी अपना प्रदर्शन बनाए रखा जिसे उसने पहले कभी नहीं देखा था, जो एक मजबूत सामान्यीकरण (generalize) क्षमता को प्रदर्शित करता है।

परिणाम बताते हैं कि एक पारंपरिक खोज इंजन के चारों ओर एक मार्गदर्शक परत के रूप में भाषा मॉडल को स्थापित करके, विशाल खोज स्थान और भौतिक निरंतरता की दोहरी चुनौतियों को पार करना संभव है। यह सिस्टम विकासवादी खोज को प्रतिस्थापित नहीं करता है; यह इसे परिष्कृत करता है, जिससे एक अंधेरी, यादृच्छिक खोज एक उद्देश्यपूर्ण, निर्देशित खोज में बदल जाती है। कच्चे चरों के गहरे, जटिल पेड़ों के निर्माण के बजाय, समृद्ध, पूर्व-समृद्ध फीचर्स के सरल संयोजनों को जोड़ने पर भार स्थानांतरित करके, यह पद्धति वैज्ञानिक नियमों की खोज को अधिक कुशल और विश्वसनीय बनाती है। यह दृष्टिकोण स्वचालित वैज्ञानिक खोज के लिए एक व्यावहारिक मार्ग प्रदान करता है, जो यह दर्शाता है कि मानव-समान तर्क और मशीन-आधारित खोज का संयोजन हमारे संसार को नियंत्रित करने वाले छिपे हुए गणितीय नियमों को प्रकट कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →