Multi-Perspective Transformers in ARC-AGI-2 Challenge
यह शोध पत्र ARC-AGI-2 विजुअल पहेलियों को हल करने के लिए टेस्ट-टाइम-ट्रेनिंग और प्रोडक्ट्स ऑफ एक्सपर्ट्स जैसी टेस्ट-टाइम फाइन-ट्यूनिंग तकनीकों से उन्नत एक TinyLM-आधारित दृष्टिकोण प्रस्तुत करता है, जिसने मूल्यांकन सेट पर 21.7% सटीकता प्राप्त की है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपको कुछ दृश्य पहेलियाँ (visual puzzles) दी गई हैं। प्रत्येक पहेली में आपको रंगीन ग्रिडों की कुछ "पहले" और "बाद की" तस्वीरें दिखाई जाती हैं, और आपका काम उस नियम का अनुमान लगाना है जो "पहले" को "बाद में" में बदल देता है। फिर, आपको उस नियम को एक नई, अनदेखी तस्वीर पर लागू करना होता है। यह ARC-AGI-2 चुनौती है, जो यह देखने के लिए डिज़ाइन किया गया परीक्षण है कि क्या एक कंप्यूटर इंसान की तरह सोच सकता है: बहुत कम उदाहरणों से सीखना और तुरंत नई स्थितियों के अनुकूल होना।
यहाँ टीम (केलेब, सीन, वेइवेन, फरिहा, वेदांत और सिनयू) ने इस चुनौती के प्रति अपना दृष्टिकोण समझाया है, जिसे सरल भाषा में समझाया गया है।
टीम की रणनीति: "कई आँखों" वाला दृष्टिकोण (The "Many Eyes" Approach)
पहेली को केवल एक बार देखने के बजाय, टीम ने एक ऐसा सिस्टम बनाया जो पहेली को कई अलग-अलग कोणों से देखता है। इसे एक रहस्य को सुलझाने की तरह समझें जहाँ पाँच अलग-अलग लोगों से एक ही अपराध स्थल का वर्णन करने के लिए कहा जाता है, लेकिन प्रत्येक व्यक्ति एक अलग खिड़की से देख रहा है, या उसके सामने एक दर्पण पकड़े हुए है।
- अनुवादक (टोकनाइज़ेशन - Tokenization): सबसे पहले, कंप्यूटर रंगीन ग्रिड को एक सरल टेक्स्ट स्ट्रिंग में अनुवादित करता है, जैसे कि एक रेसिपी। यह कहता है जैसे "यहाँ से शुरू करें, चौड़ाई 5 है, ऊँचाई 5 है, रंग लाल है।"
- रूप बदलने वाले (डेटा ऑग्मेंटेशन - Data Augmentation): सिस्टम उस पहेली को लेता है और उसके दर्जनों "व्यू" (दृश्य) बनाता है। यह ग्रिड को घुमाता है, इसे पैनकेक की तरह पलट देता है, रंगों को बदल देता है (जैसे सभी लाल को नीला कर देना), और ट्रांसपोज़ करता है। लक्ष्य पहेली का एक ऐसा संस्करण ढूंढना है जहाँ छिपा हुआ नियम कंप्यूटर के लिए स्पष्ट हो जाए।
- छोटा दिमाग (टिनी एलएम - TinyLM): उन्होंने TinyLM नामक एक बहुत ही छोटा, कुशल AI मॉडल उपयोग किया। इसे एक स्मार्ट लेकिन संक्षिप्त छात्र के रूप में सोचें जिसने दुनिया की हर संभव पẪली को याद नहीं किया है, लेकिन वह पैटर्न को जल्दी पहचानने में बहुत अच्छा है।
- विशेषज्ञों का उत्पाद (पीओई - Product of Experts/PoE): यह उनका वोटिंग सिस्टम है। मॉडल उन पहेली के सभी अलग-अलग "व्यू" को देखता है। यदि मॉडल उन सभी विभिन्न "व्यू" (घुमाए गए, पलटे गए, रंग-बदले गए) में अपने उत्तर के प्रति आश्वस्त है, तो उस उत्तर को उच्च स्कोर मिलता है। यह एक जूरी की तरह है जहाँ फैसला तभी स्वीकार किया जाता है जब हर एक जूरी सदस्य सहमत हो।
- त्वरित अध्ययन (टेस्ट-टाइम ट्रेनिंग - Test-Time Training): किसी विशिष्ट पहेली को हल करने से पहले, मॉडल को उस विशिष्ट पहेली में दिए गए कुछ उदाहरणों का उपयोग करके एक छोटा, तीव्र "क्रैश कोर्स" दिया जाता है। यह एक शेफ की तरह है जो विशेष रूप से व्यंजन परोसने से ठीक पहले सॉस को चखता है और विशिष्ट व्यंजन से मेल खाने के लिए उसमें थोड़ा नमक डालता है, बजाय इसके कि वह केवल एक सामान्य रेसिपी पर निर्भर रहे।
परिणाम: दो सेटों की कहानी
टीम ने अपने सिस्टम का परीक्षण पहेलियों के दो समूहों पर किया:
- अभ्यास सेट (प्रशिक्षण - Training): ये वे पहेलियाँ हैं जिन्हें मॉडल ने अपने "क्रैश कोर्स" के दौरान देखा था।
- अंतिम परीक्षा (मूल्यांकन - Evaluation): ये बिल्कुल नई पहेलियाँ हैं जिन्हें मॉडल ने पहले कभी नहीं देखा था।
स्कोरकार्ड:
- अभ्यास सेट पर: मॉडल एक सुपरस्टार था, जो 96.1% सही था। उसने उन नियमों में महारत हासिल की जो उसे दिखाए गए थे।
- अंतिम परीक्षा पर: स्कोर गिरकर 21.7% हो गया।
क्या गलत हुआ? ("ओवरफिटिंग" की समस्या)
पेपर बताता है कि "क्विक स्टडी" (टेस्ट-टाइम ट्रेनिंग) पद्धति ने वास्तव में अंतिम परीक्षा में चीज़ों को बदतर बना दिया।
कल्पना कीजिए कि आप होमवर्क के विशिष्ट नंबरों को याद करके गणित की परीक्षा की तैयारी कर रहे हैं। जब परीक्षा आती है, तो नंबर अलग होते हैं, लेकिन तर्क (logic) वही होता है। क्योंकि मॉडल ने होमवर्क के विशिष्ट नंबरों पर बहुत अधिक अध्ययन किया, इसलिए वह भ्रमित हो गया जब टेस्ट के नंबर बदल गए। यह "ओवरफिट" हो गया—इसने अभ्यास के उदाहरणों को बहुत अधिक बारीकी से याद कर लिया और नए उदाहरणों के अनुकूल नहीं हो सका।
इसी तरह, "मेनी आइज़" (PoE) रणनीति उम्मीद के मुताबिक काम नहीं कर पाई क्योंकि मॉडल को मुख्य रूप से पहेलियों को एक विशिष्ट क्रम (पंक्ति-दर-पंक्ति) में पढ़ने के लिए प्रशिक्षित किया गया था। जब सिस्टम ने पहेलियों को अलग-अलग कोणों (जैसे कॉलम-दर-कॉलम) से देखने की कोशिश की, तो मॉडल उस नए परिप्रेक्ष्य को नहीं समझ पाया, जिससे उसके अतिरिक्त व्यू बेकार हो गए।
मुख्य निष्कर्ष
टीम ने एक चतुर सिस्टम बनाया है जो दृश्य पहेलियों को हल करने के लिए कई दृष्टिकोणों और तीव्र सीखने का उपयोग करता है। इसने यह साबित किया कि यह उन पहेलियों के नियमों को लगभग पूरी तरह से सीख सकता है जिनका इसने अभ्यास किया था। हालाँकि, यह उन पूरी तरह से नई, अनदेखी पहेलियों पर उन नियमों को लागू करने में संघर्ष करता है।
पेपर निष्कर्ष निकालता है कि जबकि उनके "क्विक स्टडी" और "मेनी आइज़" के तरीके दिलचस्प हैं, मॉडल को बड़ा होने, अधिक विविध उदाहरणों पर प्रशिक्षित होने और केवल अभ्यास के उदाहरणों को याद करने के बजाय पहेलियों के तर्क को सीखने की आवश्यकता है। उन्होंने अभी तक चुनौती के सबसे कठिन हिस्से को हल नहीं किया है, लेकिन उन्होंने यह समझने के लिए एक ठोस आधार बनाया है कि छोटे AI मॉडल कैसे तर्क करने की कोशिश कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।