Pixelis: Reasoning in Pixels, from Seeing to Acting
पिक्सेलिस (Pixelis) एक पिक्सेल-स्पेस एजेंट है जो विजन-लैंग्वेज सिस्टम को प्रत्यक्ष इमेज ऑपरेशन्स निष्पादित करने और तीन-चरणीय प्रशिक्षण प्रक्रिया—सुपरवाइज्ड फाइन-ट्यूनिंग, क्यूरियोसिटी-कोहेरेंस रिवॉर्ड ऑप्टिमाइजेशन, और लेबल-फ्री टेस्ट-टाइम अडैप्टेशन—के माध्यम से सीखने के द्वारा स्थिर अवलोकन से सक्रिय तर्क की ओर ले जाता है, जिसके परिणामस्वरूप कई बेंचमार्क पर बेहतर प्रदर्शन और भौतिक रूप से आधारित मल्टीमॉडल इंटेलिजेंस प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लेकिन थोड़ा आलसी रोबोट सहायक है। अभी, अधिकांश AI सहायक टूर गाइड की तरह हैं: वे कमरे की एक तस्वीर देखते हैं और कहते हैं, "ओह, बिस्तर पर एक कुत्ता है और सोफे पर एक बिल्ली है।" वे जो देखते हैं उसका वर्णन करते हैं, लेकिन वे यह जांचने के लिए वास्तव में कुछ भी नहीं करते कि वे सही हैं या नहीं, और यदि कमरा बदल जाता है तो वे अपनी गलतियों से सीख नहीं सकते।
Pixelis एक नए प्रकार का AI है जो एक आवर्धक लेंस (magnifying glass) और टूलकिट वाले जासूस की तरह काम करता है। केवल अनुमान लगाने के बजाय, यह पहेली को सुलझाने के लिए छवि के साथ डिजिटल रूप से (physically) इंटरैक्ट करता है।
यहाँ बताया गया है कि Pixelis कैसे काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:
1. प्रशिक्षण चरण: "टूलबॉक्स" सीखना (SFT)
कल्पना कीजिए कि आप एक बच्चे को कैमरा चलाना सिखा रहे हैं। आप उसे सिर्फ यह नहीं बताते कि "फोटो खींचो।" आप उसे दिखाते हैं कि ज़ूम कैसे करना है, फोटो को क्रॉप कैसे करना है, आवर्धक लेंस का उपयोग कैसे करना है, और एक साइन को कैसे पढ़ना है।
- Pixelis क्या करता है: यह क्रियाओं का एक विशिष्ट "व्याकरण" सीखता है। यह सीखता है कि यदि इसे एक धुंधला कुत्ता दिखता है, तो इसे ज़ूम इन (Zoom In) करना चाहिए। यदि इसे जानवरों का एक समूह दिखता है, तो इसे गिनने के लिए सेगमेंट (Segment) (उन्हें अलग करना) करना चाहिए। यदि यह टेक्स्ट देखता है, तो इसे पढ़ना (Read) चाहिए।
- उपमा: यह एक शेफ को केवल यह बताने जैसा है कि "मुझे भूख लगी है," बल्कि उसे चाकू उठाना, सब्जियां काटना और खाना बनाना सिखाने जैसा है।
2. अभ्यास चरण: कार्य करने से पहले सोचना सीखना (CC-RFT)
अब जब रोबोट के पास उपकरण हैं, तो उसे यह सीखने की आवश्यकता है कि उनका उपयोग कब करना है। यदि वह बस इधर-उधर कूदता रहता है (यहाँ ज़ूम करना, वहाँ क्रॉप करना), तो वह भ्रमित हो जाएगा।
- जिज्ञासा (Curiosity): रोबट को नई चीजों की खोज करने के लिए पुरस्कृत किया जाता है। "अरे, मुझे आश्चर्य है कि उस कंबल के नीचे क्या है?"
- सुसंगतता (Coherence): रोबोट को तार्किक होने के लिए भी सिखाया जाता है। यदि इसने अभी-अभी कुत्ते के कान पर ज़ूम किया है, तो अगला कदम कुत्ते के चेहरे को देखना होना चाहिए, न कि अचानक टोस्टर की तस्वीर पर कूद जाना। यह सीखता है कि अपने कदमों को एक अराजक रेखाचित्र के बजाय, एक अच्छी तरह से लिखी गई कहानी की तरह आपस में जोड़े रखना है।
- उपमा: इसे एक शतरंज खिलाड़ी के रूप में सोचें। वे केवल मोहरों को बेतरतीब ढंग से नहीं चलाते। वे एक चाल चलते हैं, प्रतिद्वंद्वी की संभावित प्रतिक्रिया के बारे में सोचते हैं, और फिर अगली चाल चलते हैं जो योजना के अनुकूल हो। Pixelis छवि में "तार्किक चालें" चलना सीखता है।
3. वास्तविक दुनिया का चरण: चलते-चलते सीखना (Pixel TTRL)
यही जादुई हिस्सा है। आमतौर पर, एक बार जब एक AI प्रशिक्षित हो जाता है, तो वह वैसा ही रहता है। यदि आप इसे किसी नए प्रकार के कुत्ते को दिखाते हैं जिसे इसने पहले कभी नहीं देखा है, तो यह विफल हो सकता है। हालाँकि, Pixelis काम करते समय सीख सकता है।
- "वोटिंग" प्रणाली: जब Pixelis के सामने कोई कठिन प्रश्न आता है, तो वह केवल एक उत्तर नहीं देता। यह समस्या को अपने दिमाग में कई बार चलाता है (जैसे कि सिमुलेशन चलाना)। यह इसे हल करने के विभिन्न "रास्तों" या कहानियों के कई संस्करण उत्पन्न करता है।
- सुरक्षा जाल (Safety Net): इसके बाद यह उन सभी रास्तों को देखता है और पूछता है, "वे आपस में किस बात पर सहमत हैं?" यदि तीन रास्ते कहते हैं "यह एक बिल्ली है" और एक कहता है "यह एक कुत्ता है," तो यह बहुमत का अनुसरण करता है।
- "ड्रिफ्ट" गार्ड: यह सुनिश्चित करने के लिए कि यह पागल न हो जाए और वह जो कुछ भी सीखा है उसे भूल न जाए, इसके पास एक सुरक्षा पट्टा (जिसे "KL कॉरिडोर" कहा जाता है) है। यह सुनिश्चित करता है कि जबकि यह नए करतब सीख रहा है, यह एक सहायक सहायक होने के मार्ग से बहुत दूर न भटक जाए।
- उपमा: कल्पना कीजिए कि जासूसों का एक समूह अपराध सुलझा रहा है। एक जासूस के अनुमान लगाने के बजाय, वे सभी अलग-अलग जांच करते हैं। फिर वे कॉन्फ्रेंस रूम में मिलते हैं। यदि तीन जासूसों ने एक ही सुराग पाया है, तो वे उस सुराग पर भरोसा करते हैं। यदि एक जासूस को कुछ अजीब मिला, तो वे उसे अनदेखा कर देते हैं। Pixelis इसे तुरंत करता है, बिना किसी मानव शिक्षक के यह कहे कि "अच्छा काम किया," अपने मस्तिष्क को वास्तविक समय में परिष्कृत करता है।
यह क्यों मायने रखता है?
आज के अधिकांश AI एक निष्क्रिय पर्यवेक्षक की तरह हैं जो केवल दुनिया का वर्णन करते हैं। Pixelis एक सक्रिय भागीदार है।
- पुराना AI: "मुझे लगता है कि मेज पर एक किताब है।" (यह गलत हो सकता है, लेकिन यह इसकी जांच नहीं करेगा)।
- Pixelis: "मुझे लगता है कि एक किताब है। मुझे कवर की जांच करने के लिए ज़ूम इन (Zoom In) करने दें। मुझे शीर्षक पढ़ने (Read) दें। ठीक है, पुष्टि हो गई, यह एक कुकबुक है।"
AI को उपकरणों के साथ पिक्सेल को "छूने" के लिए मजबूर करके, यह बहुत अधिक सटीक हो जाता है, यह समझा सकता है कि उसे उत्तर कैसे मिला (अपना काम दिखाना), और बिना बिगड़े नई स्थितियों के अनुकूल हो सकता है। यह AI को एक स्थिर विश्वकोश से एक गतिशील, समस्या-समाधान साथी में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।