Learning to Unscramble: Simplifying Symbolic Expressions via Self-Supervised Oracle Trajectories
यह शोध पत्र एक स्व-पर्यवेक्षित (self-supervised), ट्रांसफार्मर-आधारित दृष्टिकोण प्रस्तुत करता है जो उच्च-ऊर्जा भौतिकी कार्यों में लगभग पूर्ण प्रतीकात्मक सरलीकरण प्राप्त करने के लिए गणितीय अभिव्यक्तियों को स्क्रैम्बल और अनस्क्रैम्बल करके ओरेकल प्रक्षेपवक्र (oracle trajectories) उत्पन्न करता है, जो पूर्व के सुदृढीकरण शिक्षण (reinforcement learning) और प्रतिगमन (regression) विधियों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास लेगो ब्रिक्स (Lego bricks) का एक विशाल, बिखरा हुआ ढेर है। उस ढेर में कहीं, एक छोटा सा, एकदम सटीक, अकेला लेगो ब्रिक छिपा हुआ है। आपका लक्ष्य उस एक सटीक ब्रिक को ढूंढना और सारा कचरा हटा देना है।
यह मूल रूप से गणित और भौतिकी (physics) में सिंबोलिक सिंपलिफिकेशन (symbolic simplification) है। वैज्ञानिक अक्सर एक विशाल, जटिल समीकरण (बिखरा हुआ ढेर) के साथ शुरुआत करते हैं जो कणों (particles) के बीच होने वाली अंतःक्रियाओं का वर्णन करता है। वे जानते हैं कि गहराई में, यह समीकरण एक छोटे, सुंदर और सटीक सूत्र (एकल सटीक ब्रिक) में बदल जाना चाहिए। लेकिन इस बिखराव के बीच से रास्ता खोजना अविश्वसनीय रूप से कठिन है क्योंकि इसे पुनर्व्यवस्थित करने के अरबों तरीके हैं, और उनमें से अधिकांश या तो गलत दिशा में ले जाते हैं या और भी बड़ा बिखराव पैदा कर देते हैं।
यह शोधपत्र पेश करता है कि कैसे कंप्यूटर इन गणितीय उलझनों को सुलझाना सीख सकते हैं। यहाँ उनके चतुर दृष्टिकोण का विवरण दिया गया है:
1. समस्या: "अनस्क्रैम्बल" (Unscramble) पहेली
एक रूबिक क्यूब (Rubik's Cube) के बारे में सोचें। यदि आप इसे बेतरतीब ढंग से घुमाते हैं, तो यह बिखर जाता है। यदि आप इसे हल करना चाहते हैं, तो आपको वापस सुव्यवस्थित अवस्था में आने के लिए विशिष्ट चालों के क्रम को जानना होगा।
- पुराना तरीका: पिछले AI तरीकों ने अनुमान लगाकर सीखने की कोशिश की। वे एक बिखरे हुए समीकरण को देखते थे और सीधे उत्तर का अनुमान लगाने की कोशिश करते थे (जैसे कि अंतिम चित्र को देखकर रूबिक क्यूब को हल करने की कोशिश करना और उम्मीद करना कि सही रंग पेंट हो जाएंगे)। या, उन्होंने "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) का उपयोग किया, जहाँ AI लाखों रैंडम चालें चलता है, और केवल तभी "पुरस्कार" पाता है जब वह जीत जाता है, जिससे यह प्रक्रिया धीमी हो जाती है और AI अक्सर अटक जाता है।
- नया तरीका: लेखक, डेविड शि (David Shih) ने महसूस किया कि जबकि पहेली को हल करना कठिन है, पहेली बनाना आसान है।
2. गुप्त मंत्र: "स्कैम्बल एंड रिवर्स" (Scramble and Reverse)
AI को शून्य से पहेली हल करना सिखाने के बजाय, लेखकों ने इसे उस पहेली को अनस्क्रैम्बल (unscramble) करना सिखाया जिसे उन्होंने स्वयं बनाया था।
यहाँ वह स्टेप-बाय-स्टेप जादू है:
- सरल शुरुआत करें: एक सुंदर, सरल समीकरण (लक्ष्य) लें।
- इसे स्कैम्बल करें: इसे बिखरा हुआ और जटिल बनाने के लिए यादृच्छिक रूप से गणितीय नियमों को लागू करें। (कल्पना करें कि आप एक व्यवस्थित वाक्य लेते हैं और शब्दों को बदलने, पर्यायवाची शब्द जोड़ने और व्याकरण को पुनर्व्यवस्थित करने के लिए उसे बेतरतीब ढंग से बदलते हैं जब तक कि वह एक उलझे हुए ढेर में न बदल जाए)।
- चरणों को रिकॉर्ड करें: जैसे-जैसे आप इसे स्कैम्बल करते हैं, ठीक वही लिखें जो आपने किया।
- टेप को उल्टा चलाएं: अब, उस बिखरे हुए समीकरण को लें और रिकॉर्डिंग को उल्टा चलाएं। अब आपके पास एक परफेक्ट "ओरेकल ट्रैजेक्टरी" (Oracle Trajectory) है—एक चरण-दर-चरण मार्गदर्शिका जो दिखाती है कि बिखराव से सरल उत्तर तक वापस कैसे जाना है।
AI को लाखों ऐसे "रिवर्स टेप्स" पर प्रशिक्षित किया जाता है। यह सीखता है: "जब मैं इस विशेष प्रकार का बिखराव देखता हूँ, तो अगला सबसे अच्छा कदम X करना है।" क्योंकि AI एक बार में पूरा उत्तर अनुमान लगाने के बजाय, एक समय में एक कदम के माध्यम से सरलीकरण की प्रक्रिया को सीखता है, इसलिए यह इसमें अविश्वसनीय रूप से कुशल हो जाता है।
3. "स्मार्ट" AI आर्किटेक्चर
AI एक विशेष प्रकार के न्यूरल नेटवर्क का उपयोग करता है जिसे ट्रांसफॉर्मर (Transformer) कहा जाता है (वही तकनीक जो ChatGPT जैसे टूल्स के पीछे है)।
- परम्यूटेशन इक्विवेरिएंस (Permutation Equivariance): गणित में, पदों का क्रम मायने नहीं रखता ( और समान हैं)। AI को यह समझने के लिए डिज़ाइन किया गया है। यह समीकरण को मोतियों की एक रेखा के बजाय मोतियों की एक थैली की तरह मानता है। इसे फर्क नहीं पड़ता कि आपने क्रम बदला है या नहीं; यह फिर भी जानता है कि क्या करना है।
- "सॉफ्ट" लॉस (Soft Loss): कभी-कभी, केवल एक ही "सही" चाल नहीं होती। हो सकता है कि तीन अलग-अलग चालें हों जो सभी एक ही सरलीकृत परिणाम की ओर ले जाती हों। AI को सिखाया जाता है कि वह किसी भी वैध चाल को सफलता के रूप में स्वीकार करे, न कि एक अलग वैध पथ चुनने के लिए दंडित किया जाए।
4. परिणाम: विशेषज्ञों को पछाड़ना
लेखकों ने दो बहुत कठिन भौतिकी समस्याओं पर इसका परीक्षण किया:
- डिलोगारिदम (Dilogarithms): जटिल फलन (functions) जो क्वांटम भौतिकी गणनाओं में दिखाई देते हैं।
- स्कैटरिंग एम्प्लीट्यूड (Scattering Amplitudes): वे समीकरण जो बताते हैं कि कण आपस में कैसे टकराते हैं और बिखरते हैं।
स्कोरबोर्ड:
- पिछला सर्वश्रेष्ठ AI: लगभग 92% से 96% समस्याओं को सही हल कर पाया।
- यह नया AI: 99.9% समस्याओं को सही हल कर पाया।
इसने न केवल आसान समस्याओं को सही हल किया; बल्कि इसने उन सबसे कठिन और बिखरे हुए संस्करणों को भी हल किया जिन्होंने पुराने मॉडलों को भ्रमित कर दिया था।
5. "सुपर-साइज़" चुनौती
यह साबित करने के लिए कि यह वास्तव में शक्तिशाली है, उन्होंने एक वास्तविक दुनिया की भौतिकी समस्या को सरल बनाने का प्रयास किया जो इतनी बड़ी थी कि AI इसे एक बार में संभाल नहीं सकता था (एक समीकरण जिसमें 200 से अधिक पद थे, जबकि AI को केवल 25 पदों पर प्रशिक्षित किया गया था)।
उन्होंने "डिवाइड एंड कॉन्कर" (Divide and Conquer) रणनीति का उपयोग किया:
- कॉन्ट्रास्टिव ग्रुपिंग (Contrastive Grouping): उन्होंने उस विशाल 200-पद वाले बिखराव को छोटे, प्रबंधनीय हिस्सों में तोड़ दिया (जैसे कपड़ों के एक बड़े ढेर को छोटी टोकरियों में छाँटना)।
- बीम सर्च (Beam Search): उन्होंने AI को एक साथ कई संभावित पथों का पता लगाने दिया, सबसे अच्छे पथों को बनाए रखा और बेकार के रास्तों को हटा दिया।
परिणाम: उन्होंने 100% सफलता दर प्राप्त की, जिसने विशाल, अनियंत्रित फेनमैन डायग्राम गणनाओं को प्रसिद्ध, सुंदर "पार्क-टेलर" (Parke-Taylor) फॉर्मूला में बदल दिया।
यह क्यों महत्वपूर्ण है
यह शोधपत्र दिखाता है कि हमें AI को शून्य से गणितज्ञ बनने के लिए नहीं सिखाने की आवश्यकता है। इसके बजाय, यदि हम इसे यह पहचानना सिखाते हैं कि चीजें कैसे बिखरती हैं, तो यह उन्हें पूरी तरह से साफ करना सीख सकता है।
यह एक बच्चे को उसका कमरा साफ करना सिखाने जैसा है—उसे केवल एक साफ कमरे को दिखाने के बजाय, बल्कि उसे यह दिखाने के माध्यम से कि एक बार में एक मोजा, फिर एक शर्ट, फिर एक खिलौना कैसे उठाना है। अंततः, वह सफाई करने की आदत सीख जाता है, और वह उस कमरे को भी साफ कर सकता है जिसे उसने पहले कभी नहीं देखा।
यह दृष्टिकोण भौतिकविदों द्वारा कणों की अंतःक्रियाओं की गणना करने के तरीके में क्रांति ला सकता है, जिससे गणित को फिर से प्रबंधनीय बनाकर ब्रह्मांड की नई खोजों की राह प्रशस्त हो सकती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।