Neuro-symbolic Syntactic Parsing: Shaping a Neural Network with the CYK Algorithm
यह शोध पत्र CYKNN प्रस्तुत करता है, जो एक नवीन आवर्ती तंत्रिका नेटवर्क (recurrent neural network) आर्किटेक्चर है जो सीधे अपने प्रशिक्षित मैट्रिक्स-वेक्टर ऑपरेशन्स में कॉक-यंगर-कासमी (CYK) पार्सिंग एल्गोरिदम को समाहित करता है, और सिंटैक्टिक पार्सिंग कार्यों पर बड़े इन-कॉन्टेक्स्ट लर्निंग मॉडल्स और फाइन-ट्यून्ड छोटे LLMs दोनों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: रोबोट को नियम पुस्तिका सिखाना बनाम उसे अनुमान लगाने देना
कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट है (एक लार्ज लैंग्वेज मॉडल, या LLM)। आप चाहते हैं कि वह एक विशिष्ट पहेली हल करे: वाक्य का पार्सिंग (parsing a sentence) करना। इसका अर्थ है यह समझना कि एक वाक्य के शब्द व्याकरणिक रूप से एक-दूसरे से कैसे जुड़ते हैं, जैसे कि एक पेड़ बनाना जहाँ तना मुख्य वाक्य होता है और शाखाएँ वाक्यांश (phrases) होती हैं।
दशकों से, हमारे पास इस पहेली के लिए एक सटीक, चरण-दर-चरण निर्देश पुस्तिका रही है जिसे CYK एल्गोरिदम कहा जाता है। यह एक सख्त रेसिपी की तरह है जो गारंटी देती है कि यदि आप इसका पालन करते हैं, तो आपको हर बार सही उत्तर मिलेगा।
हालाँकि, आधुनिक AI मॉडल आमतौर पर लाखों उदाहरणों को पढ़कर और पैटर्न का अनुमान लगाकर इस रेसिपी को सीखने की कोशिश करते हैं। वे एक ऐसे छात्र की तरह हैं जो किसी गणितीय सूत्र को सीखने के लिए लाखों हल किए गए सवालों को घूर रहा है, इस उम्मीद में कि वह बिना वास्तविक सूत्र सीखे ही उसे "समझ" जाएगा।
यह पेपर एक अलग सवाल पूछता है: यदि हम पहले से ही एक सटीक रेसिपी (CYK एल्गोरिदम) जानते हैं, तो हम उस रेसिपी को सीधे रोबोट के मस्तिष्क में क्यों नहीं डाल देते?
अनुमान लगाने देने के बजाय, लेखकों ने एक नए प्रकार का रोबोट बनाया है (CYKNN) जिसमें CYK एल्गोरिदम को उसके ढांचे (structure) में ही हार्ड-वायर्ड (hard-wired) कर दिया गया है। उन्होंने रोबोट को केवल डेटा नहीं दिया; उन्होंने उसे एल्गोरिदम का तर्क (logic) दिया, जिसे गणित में अनुवादित किया गया है ताकि रोबोट उसे समझ सके।
उपमा: टेट्रिस ब्रेन (The Tetris Brain)
इस हार्ड-वायर्ड लॉजिक को काम करने के योग्य बनाने के लिए, लेखकों ने होलोग्राफिक रिड्यूस्ड रिप्रेजेंटेशन (HRRs) का उपयोग करते हुए एक चतुर तकनीक का प्रयोग किया। इसे जानकारी को व्यवस्थित करने का एक विशेष तरीका मानिए।
कल्पना कीजिए कि रोबोट की स्मृति टेट्रिस (Tetris) के एक विशाल खेल की तरह है।
- ब्लॉक्स (Blocks): प्रत्येक शब्द और प्रत्येक व्याकरणिक नियम एक विशिष्ट आकार वाला टेट्रिस ब्लॉक है।
- इनवर्स (The Inverse): प्रत्येक ब्लॉक के लिए, एक "नेगेटिव" ब्लॉक होता है जो मूल ब्लॉक के अंतराल में पूरी तरह से फिट बैठता है।
- जादू (The Magic): जब आप एक ब्लॉक को उसके सटीक इनवर्स के ऊपर रखते हैं, तो वे एक-दूसरे को रद्द कर देते हैं और गायब हो जाते हैं, जिससे एक साफ जगह बचती है (जैसे टेट्रis में एक लाइन को साफ़ करना)।
लेखकों ने रोबोट को इस तरह डिज़ाइन किया है कि जब वह एक वाक्य को प्रोसेस करता है, तो वह इन ब्लॉक्स को एक के ऊपर एक रखता है। यदि वाक्य व्याकरण के नियमों का पालन करता है, तो "गलत" ब्लॉक्स एक-दूसरे को रद्द कर देते हैं, और "सही" ब्लॉक्स (सही व्याकरणिक संरचना) खड़े रह जाते हैं। यदि वाक्य गलत है, तो ब्लॉक्स फिट नहीं होते हैं, और संरचना ढह जाती है।
यह रोबोट को एक ही बड़े, समग्र गणितीय "स्वैप" (sweep) में जटिल, चरण-दर-चरण CYK एल्गोरिदम को निष्पादित करने की अनुमति देता है, बजाय इसके कि वह एक-एक करके शब्दों की जाँच करे।
प्रयोग: छोटा रोबोट बनाम विशाल दिग्गज
शोधकर्ताओं ने अपने नए "हार्ड-वायर्ड" रोबोट (CYKNN) का दुनिया के कुछ सबसे बड़े और प्रसिद्ध AI मॉडलों (जैसे Qwen, Gemma, और gpt-oss) के विरुद्ध परीक्षण किया।
- दिग्गज (The Giants): इन मॉडलों के अरबों पैरामीटर्स हैं (सोचिए कि उनके पास किताबों का एक विशाल पुस्तकालय है)। उनसे इस पहेली को या तो कुछ उदाहरणों को पढ़कर (In-Context Learning) या एक विशिष्ट पाठ्यपुस्तक का अध्ययन करके (Fine-Tuning) हल करने के लिए कहा गया था।
- छोटा रोबोट: CYKNN बहुत छोटा और सरल है। इसके पास कोई विशाल पुस्तकालय नहीं है; इसके पास बस इस एक पहेली के लिए विशिष्ट "टेट्रिस लॉजिक" उसकी हड्डियों में ही बुना हुआ है।
परिणाम:
छोटे, हार्ड-वायर्ड रोबोट ने दिग्गजों को हरा दिया।
- यहाँ तक कि 20-बिलियन पैरामीटर वाले विशाल मॉडलों को भी पहेली को सही ढंग से हल करने में संघर्ष करना पड़ा, वे अक्सर गलत अनुमान लगाते थे या छोटे वाक्यों में भ्रमित हो जाते थे।
- CYKNN, जिसके डिज़ाइन में एल्गोरिदम सीधे समाहित है, ने उच्च सटीकता के साथ पहेली को हल किया।
यह क्यों महत्वपूर्ण है (पेपर के अनुसार)
पेपर का तर्क है कि विशाल AI मॉडलों से केवल डेटा पढ़कर जटिल एल्गोरिदम को "खोजने" के लिए कहना वैसा ही है जैसे किसी इंसान से केवल गिरते हुए सेबों को देखकर भौतिकी के नियमों को फिर से खोजने के लिए कहना। यह संभव है, लेकिन अक्षम और अविश्वसनीय है।
इसके बजाय, लेखक दिखाते हैं कि यदि हमें पता है कि एक एल्गोरिदम मौजूद है (जैसे कि CYK पार्सर), तो हम न्यूरल नेटवर्क को आकार (shape) दे सकते हैं ताकि वह उस एल्गोरिदम से मेल खा सके। नेटवर्क के गणित में खेल के "नियमों" को सीधे इंजेक्ट करके, हमें एक ऐसा सिस्टम मिलता है जो:
- विशिष्ट तार्किक कार्यों के लिए अधिक सटीक है।
- भारी डेटा के साथ समाधान खोजने की कोशिश करने की तुलना में अधिक कुशल है।
- अधिक विश्वसनीय है क्योंकि यह केवल अनुमान नहीं लगा रहा है; यह एक अंतर्निहित तर्क का पालन कर रहा है।
सारांश
यह पेपर प्रदर्शित करता है कि हमें हमेशा AI के तार्किक रूप से सोचने के लिए "सीखने" का इंतज़ार करने की आवश्यकता नहीं है। हम मशीन के आर्किटेक्चर में सीधे तर्क को बना सकते हैं। एक क्लासिक कंप्यूटर साइंस एल्गोरिदम (CYK) को "टेट्रिस जैसे" गणितीय खेल में अनुवादित करके, उन्होंने एक छोटा, विशिष्ट AI बनाया जिसने एक विशिष्ट तार्किक कार्य पर विशाल, सामान्य-उद्देश्य वाले दिग्गजों को पछाड़ दिया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।