← नवीनतम पेपर
🤖 machine learning

Gradient-Based Program Synthesis with Neurally Interpreted Languages

यह शोध पत्र न्यूरल लैंग्वेज इंटरप्रेटर (NLI) को प्रस्तुत करता है, जो एक ग्रेडिएंट-आधारित प्रोग्राम सिंथेसिस फ्रेमवर्क है जो स्वायत्त रूप से एक डिस्क्रीट, सिम्बॉलिक-जैसे प्रोग्रामिंग लैंग्वेज को सीखता है और एंड-टू-एंड ट्रेनिंग तथा कुशल टेस्ट-टाइम अडैप्टेशन प्राप्त करने के लिए गमबेल-सॉफ्टमैक्स रिलैक्सेशन के साथ डिफरेंशिएबल एक्जीक्यूशन का उपयोग करता है, जिससे यह सिम्बॉलिक विधियों के कंपोजिशनल जनरलाइजेशन और न्यूरल नेटवर्क्स की स्केलेबिलिटी के बीच के अंतर को पाटता है।

मूल लेखक: Matthew V. Macfarlane, Clément Bonnet, Herke van Hoof, Levi H. S. Lelis

प्रकाशित 2026-04-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matthew V. Macfarlane, Clément Bonnet, Herke van Hoof, Levi H. S. Lelis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को पहेली सुलझाना सिखाने की कोशिश कर रहे हैं। आप उसे कुछ उदाहरण दिखाते हैं: "जब मैं तुम्हें यह इनपुट दूँ, तो मैं यह आउटपुट चाहता हूँ।" रोबोट का लक्ष्य उस छिपे हुए नियम (the "program") को समझना है जो इनपुट को आउटपुट में बदलता है, और फिर उस नियम को नए, अनदेखे पहेलियों पर लागू करना है।

यह पेपर एक नए प्रकार के रोबोट मस्तिष्क जिसे न्यूरल लैंग्वेज इंटरप्रेटर (NLI) कहा जाता है, का परिचय देता है। यह AI की एक लंबे समय से चली आ रही समस्या को हल करता है: कठोर तर्क (जैसे कि एक इंसान द्वारा लिखा गया कोड) और लचीली सीख (जैसे कि एक न्यूरल नेटवर्क द्वारा पैटर्न का अनुमान लगाना) के बीच का खींचतान।

यहाँ NLI कैसे काम करता है, इसका विवरण सरल उपमाओं (analogies) का उपयोग करके दिया गया है।

1. समस्या: "कठोर" बनाम "लचीला" द्वंद्व

  • पुराना तरीका (प्रतीकात्मक/तर्क - Symbolic/Logic): कल्पना कीजिए कि एक रोबोट केवल एक बहुत ही विशिष्ट भाषा बोलता है, जैसे "बाएँ मुड़ें," "5 जोड़ें," या "क्रमबद्ध करें (Sort)।" यह नियमों का पालन करने में बहुत अच्छा है और यह नए समस्याओं को हल करने के लिए उन्हें जोड़ सकता है (जैसे, "बाएँ मुड़ें" + "5 जोड़ें" = "बाएँ मुड़ें और 5 जोड़ें")। लेकिन, यदि आप चाहते हैं कि वह एक नया करतब सीखे, तो किसी इंसान को उस नए करतब के लिए एक नया शब्द मैन्युअल रूप से लिखना होगा। यह एक ऐसे शब्दकोश की तरह है जहाँ रोबोट द्वारा उपयोग करने से पहले आपको हर नए शब्द को हाथ से लिखना पड़ता है।
  • नया तरीका (न्यूरल/ब्लैक बॉक्स - Neural/Black Box): कल्पना कीजिए कि एक रोबोट शुद्ध अनुमान और परीक्षण (guess-and-check) के माध्यम से सीखता है। यह बहुत लचीला है और तेजी से सीखता है, लेकिन यह एक "ब्लैक बॉक्स" की तरह है। यह उन विशिष्ट पहेलियों को याद कर लेता है जो इसने देखी थीं। यदि आप इसे थोड़ी अलग पहेली देते हैं (जैसे, संख्याओं की एक लंबी सूची), तो यह अक्सर विफल हो जाता है क्योंकि यह नियम की संरचना को नहीं समझता, यह केवल उत्तर को याद रखता है।

लक्ष्य: एक ऐसा रोबोट बनाना जो शून्य से अपनी खुद की भाषा सीख सके (न्यूरल तरीके की तरह) लेकिन जटिल पहेलियों को हल करने के लिए उन शब्दों को जोड़ सके (तार्किक तरीके की तरह)।

2. समाधान: NLI (एक "स्वयं-शिक्षण शेफ")

लेखकों ने एक सिस्टम बनाया है जिसे NLI कहा जाता है, जो एक ऐसे शेफ की तरह काम करता है जो चलते-फिरते अपने स्वयं के सामग्रियां (ingredients) और रेसिपी का आविष्कार करता है।

चरण क: शब्दावली सीखना (द इंडक्टर - The Inductor)

सामग्रियों (जैसे "नमक," "मिर्च," "काटना") की सूची दिए जाने के बजाय, NLI उदाहरणों को देखता है और अपने स्वयं के मौलिक ऑपरेशन्स (primitive operations) की खोज करता है।

  • उपमा: कल्पना कीजिए कि आप एक शेफ को सैंडविच, सलाद और स्मूदी बनाना सिखाते हैं। केवल रेसिपी याद करने के बजाय, शेफ को एहसास होता है, "ओह, मुझे एक 'स्लाइस' टूल, एक 'मिक्स' टूल और एक 'ब्लेंड' टूल की आवश्यकता है।"
  • NLI इन "टूल्स" (primitives) की एक छोटी शब्दावली स्वतः ही बनाता है। वह सीखता है कि "शिफ्ट लेफ्ट" एक टूल है, और "डबल शिफ्ट" केवल दो "शिफ्ट लेफ्ट" टूल्स को एक साथ रखने से बना है।

चरण ख: लचीला निष्पादक (द इंटरप्रेटर - The Interpreter)

एक बार जब शेफ के पास टूल्स आ जाते हैं, तो उन्हें उपयोग करने की आवश्यकता होती है। अधिकांश AI मॉडल एक कन्वेयर बेल्ट की तरह होते हैं: उनके पास चरणों की एक निश्चित संख्या होती है (जैसे, "चरण 1, चरण 2, चरण 3")। यदि रेसिपी के लिए 4 चरणों की आवश्यकता है, तो बेल्ट टूट जाती है।

  • NLI की ट्रिक: NLI एक रिकरेंट (लूपिंग) इंटरप्रेटर का उपयोग करता है। यह एक ऐसे शेफ की तरह है जो रेसिपी की आवश्यकता के अनुसार जितना आवश्यक हो, तब तक काट सकता है, मिला सकता है और ब्लेंड कर सकता है। चरणों की कोई निश्चित सीमा नहीं है। यह इसे उन पहेलियों को हल करने की अनुमति देता है जो इसके अभ्यास की गई पहेलियों से बहुत बड़ी या अधिक जटिल हैं।

चरण ग: "ग्रेडिएंट सर्च" (द टेस्ट टेस्ट - The Taste Test)

यही असली गुप्त सामग्री है। आमतौर पर, जब एक रोबोट एक प्रोग्राम का अनुमान लगाता है, तो वह एक बार का अनुमान होता है। यदि वह गलत है, तो वह गलत है।

  • उपमा: कल्पना कीजिए कि एक शेफ एक रेसिपी का अनुमान लगाता है, उसे पकाता है, और चखता है। यदि यह बहुत नमकीन है, तो वे इसे केवल फेंक नहीं देते; वे रेसिपी को थोड़ा सा समायोजित करने और फिर से प्रयास करने के लिए उस स्वाद का उपयोग करते हैं।
  • क्योंकि NLI "डिफरेंशिएबल" गणित (एक फैंसी तरीका जिसका अर्थ है कि पूरी प्रक्रिया सुचारू और समायोजणीय है) के साथ बनाया गया है, रोबोट अपने प्रारंभिक अनुमान को ले सकता है और उसे गणित (ग्रेडिएंट डिसेंट) का उपयोग करके परिष्कृत कर सकता है जब तक कि आउटपुट एकदम सही न हो जाए। यह रेडियो सिग्नल को क्रिस्टल क्लियर होने तक ट्यून करने जैसा है, न कि केवल स्टेशन का अनुमान लगाने जैसा।

3. यह एक बड़ी बात क्यों है

पेपर में NLI का परीक्षण उन कार्यों पर किया गया जहाँ अन्य AI मॉडल बुरी तरह विफल रहे।

  • "शिफ्ट" टेस्ट: उन्होंने रोबोट को संख्याओं की एक सूची को 1, 2 या 3 स्थानों तक बाईं ओर खिसकाने (shift) के लिए सिखाया। फिर, उन्होंने इसे 8 स्थानों तक खिसकाने के लिए कहा (कुछ ऐसा जो उसने कभी नहीं देखा था)।
    • पुराना AI: "मुझे नहीं पता कि 8 क्या है! मैं केवल 1, 2 और 3 जानता हूँ।" (विफल)
    • NLI: "आह, 8 बस चार 'शिफ्ट बाय 2' या आठ 'शिफ्ट बाय 1' है।" यह नए प्रश्न को हल करने के लिए सीखे गए टूल्स को जोड़ता है। (सफल)

4. निष्कर्ष (The Takeaway)

न्यूरल लैंग्वेज इंटरप्रेटर कठोर कोड और लचीली सीख के बीच के अंतर को पाटता है।

  • यह अपनी खुद की भाषा सीखता है (बिना किसी इंसान के शब्दकोश लिखने की आवश्यकता के)।
  • यह सरल, पुन: प्रयोज्य टूल्स को जोड़कर जटिल समाधान बनाता है (कंपोजिशनल जनरलाइजेशन)।
  • यह समस्या को हल करते समय अपने अनुमानों को परिष्कृत करता है (टेस्ट-टाइम अडैप्टेशन)।

संक्षेप में, NLI एक ऐसा AI है जो केवल उत्तरों को याद नहीं करता; यह यह सीखता है कि उन नियमों का आविष्कार कैसे किया जाए जिनकी आवश्यकता उन समस्याओं को हल करने के लिए होती है जिन्हें उसने पहले कभी नहीं देखा है, ठीक वैसे ही जैसे एक इंसान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →