Bongards at the Boundary of Perception and Reasoning: Programs or Language?
यह शोध पत्र एक न्यूरोसिम्बोलिक दृष्टिकोण प्रस्तुत करता है जो बोनगार्ड समस्याओं (Bongard problems) को हल करने के लिए पैरामीटराइज्ड प्रोग्राम उत्पन्न करने हेतु लार्ज लैंग्वेज मॉडल्स को पैरामीटर फिटिंग के लिए बायेसियन ऑप्टिमाइजेशन के साथ जोड़ता है, जिससे दृश्य धारणा और अमूर्त तर्क के बीच के अंतर को पाटा जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "बोंगार्ड्स एट द बाउंड्री ऑफ परसेप्शन एंड रीजनिंग" (Bongards at the Boundary of Perception and Reasoning) पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ स्पष्टीकरण दिया गया है।
बड़ी तस्वीर: "विजुअल रिडल" (दृश्य पहेली) की चुनौती
कल्पना कीजिए कि आपको 12 रेखाचित्रों (drawings) का एक सेट दिया गया है। उनमें से छह "अच्छे" (पॉजिटिव) हैं, और छह "बुरे" (नेगेटिव) हैं। आपका काम उस गुप्त नियम को समझना है जो अच्छे और बुरे चित्रों को अलग करता है।
इसे बोंगार्ड प्रॉब्लम (Bongard Problem) कहा जाता है। ये केवल साधारण "अलग चीज़ पहचानो" वाली पहेलियाँ नहीं हैं। इनके नियम अविश्वसनीय रूप से जटिल हो सकते हैं।
- उदाहरण: शायद "अच्छे" चित्रों में सभी आकृतियों की एक "गर्दन" (neck) है जो क्षैतिज (horizontal) है, जबकि "बुरे" चित्रों में गर्दन लंबवत (vertical) है। या शायद "अच्छे" चित्र "टेढ़े-मेढ़े" (squiggly) हैं, जबकि "बुरे" चित्र "चिकने" (smooth) हैं।
यह पेपर एक बड़ा सवाल पूछता है: क्या आर्टिफिशियल इंटेलिजेंस (AI) इन पहेलियों को इंसानों की तरह हल कर सकता है? इंसान एक बिल्कुल नई स्थिति को देखने, मौके पर ही एक नया कॉन्सेप्ट (जैसे "क्षैतिज गर्दन") गढ़ने और उसे लागू करने में माहिर होते हैं। वर्तमान AI उन चीजों को पहचानने में माहिर है जिन्हें उसने पहले देखा है (जैसे "यह एक बिल्ली है"), लेकिन जब उसे शुरुआत से एक नया कॉन्सेप्ट बनाना पड़ता है, तो वह अक्सर संघर्ष करता है।
समस्या: AI या तो बहुत कठोर है या बहुत अस्पष्ट
शोधकर्ताओं ने पाया कि AI के सोचने के दो मुख्य तरीके हैं, और दोनों में कमियां हैं:
"चैटबॉट" दृष्टिकोण (प्राकृतिक भाषा - Natural Language):
- यह कैसे काम करता है: AI चित्रों को देखता है और नियम को शब्दों में समझाने की कोशिश करता है, जैसे कोई जासूस रिपोर्ट लिख रहा हो।
- कमी: यह बड़े विचारों के लिए अच्छा है लेकिन सटीकता (precision) में बुरा है। यह कह सकता है, "अच्छी आकृतियाँ कुछ हद तक नुकीली हैं," लेकिन यह एक "थोड़ी नुकीली" आकृति और एक "बहुत नुकीली" आकृति के बीच अंतर नहीं बता सकता। यह एक ऐसे शेफ की तरह है जो जानता है कि रेसिपी कहती है "एक चुटकी नमक डालें" लेकिन उसे ठीक से पता नहीं है कि वह कितनी मात्रा है।
"प्रोग्रामर" दृष्टिकोण (कोड - Code):
- यह कैसे काम करता है: AI चित्रों की जाँच करने के लिए एक कंप्यूटर प्रोग्राम लिखता है। यह सटीक दूरियों, कोणों और गणनाओं को माप सकता है।
- कमी: यह सटीकता में बेहतरीन है लेकिन रचनात्मकता में बुरा है। यदि नियम "आकृति एक उदास चेहरे जैसी दिखती है" है, तो एक कंप्यूटर प्रोग्राम गणितीय रूप से "उदासी" को परिभाषित करने के लिए संघर्ष करता है। यह एक ऐसे रोबोट की तरह है जो कमरे को मिलीमीटर तक माप सकता है लेकिन "सुकूनदायक" (cozy) होने के विचार को नहीं समझ सकता।
समाधान: "अनुवादक" टीम (The Translator Team)
लेखकों ने एक नया सिस्टम बनाया है जो एक दो विशेषज्ञों की टीम की तरह काम करता है। वे इसे "न्यूरोसिम्बोलिक" (neurosymbolic) दृष्टिकोण कहते हैं (न्यूरल नेटवर्क/AI को सिम्बोलिक लॉजिक/प्रोग्राम के साथ जोड़ना)।
यहाँ बताया गया है कि उनकी टीम कैसे काम करती है, चरण-दर-चरण:
चरण 1: आइडिया जनरेटर (द "चैटबॉट")
सबसे पहले, वे एक शक्तिशाली AI (विज़न-लैंग्वेज मॉडल) से पूछते हैं कि वह पहेली को देखे और साधारण अंग्रेजी में कुछ संभावित नियम सुझाए।
- उपमा: एक रचनात्मक लेखक के मंथन सत्र की कल्पना करें जो सुझाव देता है, "शायद नियम आकृति की 'गर्दन' के बारे में है!"
चरण 2: अनुवादक (द "प्रोग्रामर")
इसके बाद, सिस्टम उन अंग्रेजी अनुमानों को लेता है और उन्हें कंप्यूटर कोड में बदलने की कोशिश करता है।
- ट्विस्ट: AI केवल कोड नहीं लिखता; वह कठिन नंबरों के लिए "खाली स्थान" (blanks) छोड़ देता है। उदाहरण के लिए, यदि नियम है "ऐसी आकृतियाँ जिनकी गर्दन X से लंबी है," तो AI कोड लिखता है लेकिन X को एक रहस्यमय वेरिएबल के रूप में छोड़ देता है।
- उपमा: लेखक कहता है, "गर्दन [खाली स्थान] से लंबी होनी चाहिए।" प्रोग्रामर मशीन को गर्दन मापने के लिए सेटअप करता है लेकिन सटीक नंबर के लिए इंतजार करता है।
चरण 3: ट्यूनर (बेयसियन ऑप्टिमाइज़ेशन - Bayesian Optimization)
यह असली जादू है। सिस्टम उन खाली स्थानों के लिए सही नंबर खोजने के लिए एक "परीक्षण और त्रुटि" (trial and error) प्रक्रिया चलाता है। यह अलग-अलग नंबरों (जैसे 5 पिक्सेल, 10 पिक्सेल, 15 पिक्सेल) का परीक्षण करता है ताकि यह देख सके कि कौन सा नंबर "अच्छे" चित्रों को "बुरे" चित्रों से पूरी तरह अलग करता है।
- उपमा: कल्पना कीजिए कि आप रेडियो ट्यून कर रहे हैं। आप जानते हैं कि स्टेशन 90 और 100 के बीच कहीं है, लेकिन आप सटीक फ्रीक्वेंसी नहीं जानते। आप डायल को धीरे-धीरे घुमाते हैं जब तक कि शोर खत्म न हो जाए और संगीत एकदम साफ न हो जाए। सिस्टम इस सटीक "कटऑफ" पॉइंट को खोजने के लिए गणितीय रूप से यही करता है।
चरण 4: जज (द वेरिफायर)
अंत में, सिस्टम जाँच करता है: "क्या यह कोड वास्तव में सभी ट्रेनिंग चित्रों पर काम करता है?"
- यदि कोड पूरी तरह से काम करता है, तो सिस्टम नियम को स्वीकार कर लेता है।
- यदि कोड विफल हो जाता है, तो सिस्टम वापस "चैटबॉट" के पास जाता है, कहता है, "यह विचार काम नहीं किया, फिर से कोशिश करो," और यह चक्र दोहराया जाता है।
उन्होंने क्या पाया?
शोधकर्ताओं ने इस "टीम दृष्टिकोण" का परीक्षण उपलब्ध सर्वोत्तम AI मॉडलों (जैसे GPT-4o और Claude 3.7) और यहाँ तक कि औसत मानव प्रदर्शन के विरुद्ध भी किया।
- टीम की जीत: चैटबॉट की रचनात्मकता को प्रोग्रामर की सटीकता के साथ जोड़कर, उनके सिस्टम ने 100 में से 51 बोंगार्ड समस्याओं को हल किया।
- इंसानों को पछाड़ना: पिछले अध्ययनों में औसत मानव ने लगभग 47 समस्याएं हल की थीं। उनके AI टीम ने 51 हल कीं, जो इस विशिष्ट परीक्षण पर औसत मानव प्रदर्शन से आगे निकलने वाला पहला मामला है।
- अलग-अलग ताकतें:
- जब समस्या ज्यामिति और गणित (जैसे "क्या ये रेखाएं समानांतर हैं?") के बारे में थी, तो टीम का "प्रोग्रामर" हिस्सा हीरो था।
- जब समस्या अमूर्त अवधारणाओं (जैसे "क्या यह आकृति 'खुली' है या 'बंद'?") के बारे में थी, तो "चैटबॉट" हिस्सा हीरो था।
- जब उन्होंने केवल चैटबॉट या केवल प्रोग्रामर का उपयोग किया, तो वे खराब प्रदर्शन करते थे। उन्हें दोनों की आवश्यकता थी।
"याद रखने" (Memorization) की जाँच
शोधकर्ता चिंतित थे कि AI इंटरनेट से उत्तर याद करके "चीटिंग" कर सकता है (क्योंकि ये पहेलियाँ पुरानी और लोकप्रिय हैं)। इसका परीक्षण करने के लिए, उन्होंने नियमों को उलट दिया: उन्होंने AI को बताया कि "बुरे" चित्र वास्तव में "अच्छे" चित्र थे। AI अभी भी अच्छा प्रदर्शन करता रहा, जिससे यह सिद्ध हुआ कि वह केवल याद किए हुए उत्तर नहीं दे रहा था; वह वास्तव में तर्क (logic) को समझ रहा था।
निष्कर्ष (The Bottom Line)
यह पेपर दिखाता है कि कठिन विजुअल पहेलियों को हल करने के लिए, AI को केवल इंसान की तरह "सोचने" या कंप्यूटर की तरह "गणना" करने की कोशिश नहीं करनी चाहिए। उसे दोनों करना होगा। एक रचनात्मक AI को विचार सुझाने देने और एक सटीक कंप्यूटर को सटीक गणित के साथ उन्हें सत्यापित करने देने से, हम ऐसे सिस्टम बना सकते हैं जो नए विजुअल कॉन्सेप्ट्स को लगभग इंसानों के बराबर, और कभी-कभी उनसे भी बेहतर सीख सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।