← नवीनतम पेपर
🤖 AI

SMCEvolve: Principled Scientific Discovery via Sequential Monte Carlo Evolution

SMCEvolve एक सिद्धांत-आधारित ढांचा पेश करता है जो LLM-संचालित वैज्ञानिक खोज के लिए प्रोग्राम खोज को सीक्वेंशियल मोंटे कार्लो सैंपलिंग के रूप में पुनर्गठित करता है, जो विविध बेंचमार्क पर कम LLM कॉल्स के साथ अत्याधुनिक प्रणालियों से बेहतर प्रदर्शन करते हुए सैद्धांतिक अभिसरण गारंटी और परिमित-नमूना जटिलता सीमाएं प्रदान करता है।

मूल लेखक: Jiachen Jiang, Huminhao Zhu, Zhihui Zhu

प्रकाशित 2026-05-18
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiachen Jiang, Huminhao Zhu, Zhihui Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "अनुमान और जाँच" को एक "निर्देशित अभियान" में बदलना

कल्पना कीजिए कि आप अरबों कुकबुक्स (cookbooks) वाली एक विशाल लाइब्रेरी में केक की सबसे बेहतरीन रेसिपी खोजने की कोशिश कर रहे हैं। वर्तमान AI विधियाँ (जैसे AlphaEvolve या ShinkaEvolve) एक अराजक 'बुक क्लब' की तरह काम करती हैं:

  1. वे कुछ रैंडम रेसिपी चुनती हैं।
  2. वे एक AI शेफ से उन्हें थोड़ा बदलने के लिए कहती हैं।
  3. वे परिणामों को चखते हैं।
  4. यदि केक का स्वाद बेहतर है, तो वे उसे रखती हैं; यदि नहीं, तो वे उसे फेंक देती हैं।
  5. वे राउंड की एक निश्चित संख्या (जैसे, "चलिए 100 राउंड करते हैं और देखते हैं क्या होता है") के लिए अंधे होकर यह प्रक्रिया दोहराती हैं।

समस्या क्या है? यह दृष्टिकोण अंधेरे में भटकने जैसा है। टीम को यह नहीं पता कि उन्होंने कुछ खास रेसिपी को बदलने के लिए क्यों चुना, उन्हें यह नहीं पता कि कब रुकना है, और वे यह गारंटी नहीं दे सकते कि उन्हें सबसे अच्छा केक मिल गया है—वे बस उम्मीद करते हैं कि उनकी किस्मत अच्छी होगी।

SMCEVOLVE खेल बदल देता है। भटकने के बजाय, यह खोज को एक सटीक मानचित्र द्वारा निर्देशित एक वैज्ञानिक अभियान (scientific expedition) की तरह मानता है। यह "रैंडम विचारों" से "परफेक्ट समाधानों" तक की एक संरचित यात्रा को बदलने के लिए सीक्वेंशियल मोंटे कार्लो (Sequential Monte Carlo - SMC) नामक एक गणितीय ढांचे का उपयोग करता है।


SMCEVOLVE के तीन जादुई उपकरण

पेपर तीन विशिष्ट तंत्रों (mechanisms) का परिचय देता है जो इस अभियान को सफल बनाते हैं। इन्हें उन उपकरणों के रूप में सोचें जिनका उपयोग एक गाइड खोजकर्ताओं के एक समूह (AI प्रोग्रामों की "जनसंख्या") को खजाने (सबसे अच्छे प्रोग्राम) की ओर ले जाने के लिए करता है।

1. एडेप्टिव पैरेंट रीसैंपलिंग (Adaptive Parent Resampling): "स्मार्ट भीड़"

  • पुराना तरीका: पारंपरिक तरीकों में, AI एक निश्चित नियम के आधार पर सुधार के लिए रेसिपी चुनता है (जैसे, "हमेशा शीर्ष 3 चुनें")। यह बहुत कठोर है।
  • SMCEVOLVE का तरीका: खोजकर्ताओं के एक भीड़ की कल्पना करें। यात्रा की शुरुआत में, इलाका धुंधला होता है, इसलिए गाइड सबको अलग-अलग घाटियों को खोजने के लिए स्वतंत्र रूप से घूमने देता है (Exploration/अन्वेषण)। जैसे-जैसे वे खजाने के करीब पहुँचते हैं, गाइड भीड़ को अधिक आक्रामक रूप से उच्चतम चोटियों की ओर इशारा करना शुरू कर देता है (Exploitation/दोहन)।
  • यह कैसे काम करता है: सिस्टम हर प्रोग्राम के लिए एक "स्कोर" की गणना करता है। शुरुआत में, यह विचारों की विविधता बनाए रखने के लिए सभी के साथ समान व्यवहार करता है। बाद में, यह उच्च स्कोर वाले प्रोग्रामों को बहुत अधिक महत्व देता है, जिससे यह सुनिश्चित होता है कि समूह अपनी ऊर्जा वहीं लगाए जहाँ इनाम सबसे अधिक हो। यह बदलाव स्वचालित रूप से होता है, किसी निश्चित नियम द्वारा नहीं।

2. मिक्सचर ऑफ म्यूटेशन विद एक्सेप्टेंस (Mixture of Mutation with Acceptance): "परीक्षण और त्रुटि फ़िल्टर"

  • पुराना तरीका: AI शेफ रेसिपी में एक बदलाव करता है और तुरंत उसे पकाने लगता है। यदि स्वाद खराब है, तो वह खत्म हो जाता है। यह जोखिम भरा और बर्बादी भरा है।
  • SMCEVOLVE का तरीका: पकाने से पहले, शेफ रेसिपी बदलने के लिए चार अलग-अलग रणनीतियों को आजमाता है:
    1. लोकल ट्वीक्स (Local Tweaks): बस नमक का एक चुटकी हिस्सा बदलना (Diff)।
    2. टोटल रीराइट (Total Rewrite): शुरुआत से पूरी तरह से एक नया व्यंजन बनाना (Rewrite)।
    3. सोलो एफर्ट (Solo Effort): अकेले ही रेसिपी बदलना।
    4. टीम एफर्ट (Team Effort): अन्य सफल रेसिपी से विचार उधार लेना (Inspiration)।
  • फ़िल्टर: सिस्टम केवल पहले विचार को स्वीकार नहीं करता है। यह एक "मेट्रोपोलिस-हैस्टिंग्स" फ़िल्टर (एक स्मार्ट गेटकीपर के लिए फैंसी गणितीय शब्द) का उपयोग करता है। यह पूछता है: "क्या यह नया विचार पुराने से बेहतर है?"
    • यदि हाँ, तो यह इसे स्वीकार करता है।
    • यदि नहीं, तो यह अभी भी इसे स्वीकार कर सकता है (ताकि स्थानीय जाल में न फंसे), लेकिन कम संभावना के साथ।
  • सीखना: सिस्टम यह भी सीखता है कि अभी के लिए कौन सी चार रणनीतियाँ सबसे अच्छा काम करती हैं। यदि "टीम एफर्ट" आज बेहतरीन केक बना रहा है, तो AI उस रणनीति का अधिक उपयोग करता है।

3. ऑटोमैटिक कन्वर्जेंस कंट्रोल (Automatic Convergence Control): "स्मार्ट स्टॉप साइन"

  • पुराला तरीका: टीम तब तक चलती रहती है जब तक कि टाइमर समाप्त न हो जाए। वे बहुत जल्दी रुक सकते हैं (खजाना मिस कर देना) या उसे मिलने के बाद भी घंटों तक चल सकते हैं (समय बर्बाद करना)।
  • SMCEVOLVE का तरीका: गाइड एक "डाइवर्सिटी मीटर" (विविधता मीटर) लेकर चलता है।
    • यदि समूह अभी भी मानचित्र पर फैला हुआ है, तो गाइड जानता है कि वे अभी तक समाप्त नहीं हुए हैं और चलता रहता है।
    • यदि समूह सबसे अच्छी जगह के आसपास कसकर क्लस्टर (एकत्रित) हो गया है, तो गाइड जानता है कि खजाना मिल गया है और तुरंत रुक जाता है।
  • परिणाम: सिस्टम डेटा के आधार पर तय करता है कि ठीक कब रुकना है, जिससे कंप्यूटिंग पावर की भारी बचत होती है।

"यह क्यों काम करता है" का उदाहरण: तापमान डायल

पेपर एक अवधारणा का उपयोग करता है जिसे "एनीलिंग" (Annealing) (धातु को ठंडा करने की तरह) कहा जाता है। एक डायल की कल्पना करें जो खोज के "तापमान" को नियंत्रित करता है:

  • उच्च तापमान (शुरुआत में): AI "गर्म" और अराजक है। यह जंगली, रैंडम विचार आज़माता है। इसे स्कोर की ज्यादा परवाह नहीं है; यह बस यह देखना चाहता है कि क्या संभव है।
  • कम तापमान (अंत में): AI "ठंडा" और केंद्रित है। यह केवल उन बदलावों को स्वीकार करता है जो सख्ती से स्कोर में सुधार करते हैं। यह बहुत चूजी (picky) हो जाता है।

SMCEVOLVE इस डायल को गर्म से ठंडा होने की दिशा में धीरे-धीरे घुमाता है। "एडेप्टिव रीसैंपलिंग" और "ऑटोमैटिक स्टॉप साइन" वे तंत्र हैं जो यह सुनिश्चित करते हैं कि डायल सही गति से घूमे—न बहुत तेज़ (वरना आप अच्छी चीज़ मिस कर देंगे) और न बहुत धीमा (वरना आप समय बर्बाद करेंगे)।

परिणाम: बेहतर केक, कम आटा

लेखकों ने इस नई विधि का परीक्षण चार कठिन चुनौतियों पर किया:

  1. गणित की समस्याएँ: जटिल ज्यामिति पहेलियों को हल करना (जैसे आयत में वृत्त भरना)।
  2. एल्गोरिदम दक्षता: कंप्यूटर कोड को तेज़ी से चलाना।
  3. सिम्बोलिक रिग्रेशन (Symbolic Regression): डेटा के पीछे छिपे गणितीय सूत्रों को खोजना।
  4. AI रिसर्च: उन कोड को स्वचालित रूप से सुधारना जो अन्य AI को प्रशिक्षित करते हैं।

परिणाम:
लगभग हर मामले में, SMCEVOLVE ने पिछले अत्याधुनिक (state-of-the-art) तरीकों की तुलना में बेहतर समाधान खोजे। इससे भी अधिक प्रभावशाली बात यह है कि इसने यह सब कम कंप्यूटर कॉल्स (केक के कम "स्वाद") का उपयोग करके किया। क्योंकि इसे पता है कि कब रुकना है और अपनी ऊर्जा कहाँ केंद्रित करनी है, यह संसाधनों को बर्बाद नहीं करता है।

सारांश

SMCEVOLVE कोड लिखने के लिए AI का उपयोग करने का एक नया तरीका है। अंधे होकर अनुमान लगाने और सबसे अच्छे की उम्मीद करने के बजाय, यह खोज को निर्देशित करने के लिए एक कठोर गणितीय मानचित्र का उपयोग करता है। यह अन्वेषण (exploration) (नई चीजें आज़माना) और दोहन (exploitation) (जो काम करता है उस पर ध्यान केंद्रित करना) के बीच संतुलन बनाता है, वास्तविक समय में सर्वश्रेष्ठ रणनीतियों को सीखता है, और जानता है कि कब छोड़ना है। यह एक टॉर्च के साथ जंगल में भटकने और जीपीएस और कंपास के साथ हाइकिंग करने के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →