← नवीनतम पेपर
🤖 machine learning

LanteRn: Latent Visual Structured Reasoning

LanteRn एक नवीन ढांचा (framework) है जो लार्ज मल्टीमॉडल मॉडल्स की दृश्य तर्क क्षमताओं को संवर्धित करता है, जिससे वे भाषा को संक्षिप्त, निरंतर लेटेंट विजुअल रिप्रेजेंटेशन के साथ इंटरलीव कर पाते हैं, और इस प्रकार केवल टेक्स्ट-आधारित विवरणों की सीमाओं और प्रत्यक्ष पिक्सेल-स्पेस रीजनिंग की अक्षमताओं से बच पाते हैं।

मूल लेखक: André G. Viveiros, Nuno Gonçalves, Matthias Lindemann, André Martins

प्रकाशित 2026-03-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: André G. Viveiros, Nuno Gonçalves, Matthias Lindemann, André Martins

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ LanteRn पेपर का स्पष्टीकरण दिया गया है, जिसे सरल, रोज़मर्रा की भाषा में कुछ रचनात्मक उपमाओं के साथ अनुवादित किया गया है।

🏮 बड़ा विचार: "चित्रों में सोचना" बनाम "चित्रों के बारे में बात करना"

कल्पना कीजिए कि आप एक जटिल मानचित्र (map) देख रहे हैं और फोन पर अपने मित्र को रास्ता समझाने की कोशिश कर रहे हैं।

  • वर्तमान AI (द "टॉकर" - बोलने वाला): आज के अधिकांश बड़े AI मॉडल उन लोगों की तरह हैं जिन्हें मानचित्र को पूरी तरह से शब्दों में वर्णित करना पड़ता है। वे चित्र देखते हैं, उसे एक लंबे, विस्तृत भाषण में अनुवाद करते हैं ("बाईं ओर एक लाल घर है, फिर एक नीली कार है, फिर एक पेड़ है..."), और फिर केवल उस भाषण का उपयोग करके समस्या को हल करने की कोशिश करते हैं। यह धीमा, बोझिल है और इसमें अक्सर महत्वपूर्ण विवरण खो जाते हैं (जैसे कि पेड़ के सापेक्ष कार वास्तव में कहाँ है)।
  • LanteRn (द "थिंकर" - सोचने वाला): LanteRn फ्रेमवर्क AI को कुछ अलग करने के लिए प्रशिक्षित करता है। हर विचार को शब्दों में बदलने के बजाय, यह AI को "मौन चित्र विचार" (silent picture thoughts) रखने की अनुमति देता है। यह रुक सकता है, मानचित्र की एक मानसिक छवि को अपनी "मानसिक दृष्टि" में रख सकता है, उस छवि में स्थानिक संबंधों (spatial relationships) के बारे में तर्क कर सकता है, और फिर उत्तर बोल सकता है।

पेपर इन मौन विचारों को "लेटेंट विजुअल रिप्रेजेंटेशन" (Latent Visual Representations) कहता है। इन्हें संपीड़ित (compressed), हाई-डेफिनिशन मानसिक स्नैपशॉट के रूप में समझें जिन्हें AI सोचने की प्रक्रिया के दौरान अपने पास रखता है।


🛠 यह कैसे काम करता है: दो-चरणीय प्रशिक्षण (Two-Stage Training)

शोधकर्ताओं ने केवल इस सुविधा को चालू नहीं किया; उन्हें AI को इसे उपयोग करना सिखाना पड़ा। उन्होंने इसे दो चरणों में किया, जैसे किसी एथलीट को प्रशिक्षित किया जाता है।

चरण 1: "कॉपीकैट" चरण (सुपरवाइज्ड फाइन-ट्यूनिंग)

  • लक्ष्य: AI को ये मानसिक स्नैपशॉट बनाना सिखाना।
  • उपमा: कल्पना कीजिए कि एक छात्र चित्र बनाना सीख रहा है। शिक्षक उसे एक बिल्ली की फोटो दिखाता है और कहता, "बिल्ली के कान को देखो। अब, अपनी आँखें बंद करो और अपने मन में उस कान की एक सटीक मानसिक छवि बनाए रखो।"
  • उन्होंने यह कैसे किया: शोधकर्ताओं ने एक "शिक्षक" AI (विज़न एनकोडर) का उपयोग किया ताकि छात्र AI को दिखा सकें कि चित्र के विशिष्ट हिस्सों के लिए वह मानसिक छवि कैसी दिखनी चाहिए। छात्र AI ने इन आंतरिक "थॉट वेक्टर्स" (thought vectors) को उत्पन्न करना सीखा जो शिक्षक के विजुअल डेटा से मेल खाते हैं।
  • परिणाम: AI ने आंतरिक रूप से विजुअल जानकारी को "देखना" और "रखना" सीख लिया, लेकिन यह अभी केवल वही कॉपी कर रहा था जो उसे बताया गया था। यह चित्र को याद रखने में अच्छा था, लेकिन शायद अभी भी उस स्मृति का उपयोग कठिन पहेलियों को हल करने के लिए करने में बहुत अच्छा नहीं था।

चरण 2: "कोच" चरण (रीइन्फोर्समेंट लर्निंग)

  • लक्ष्य: AI को उन मानसिक स्नैपशॉट्स का उपयोग करके वास्तव में खेल जीतने के लिए प्रशिक्षित करना।
  • उपमा: अब, छात्र एक प्रतियोगिता में है। कोच (रिवॉर्ड सिस्टम) को इस बात की परवाह नहीं है कि मानसिक छवि फोटो की सटीक प्रति है या नहीं। कोच को केवल यह परवाह है: "क्या आपने सही उत्तर दिया?"
  • उन्होंने यह कैसे किया: AI को एक समस्या दी जाती है। यदि वह सही उत्तर खोजने के लिए अपने "मौन चित्र विचारों" का उपयोग करता है, तो उसे एक "गोल्ड स्टार" (रिवॉर्ड) मिलता है। यदि वह केवल शब्दों में घूमता रहता है और गलत उत्तर देता है, तो उसे कोई स्टार नहीं मिलता।
  • परिणाम: AI सीख जाता है कि ये मौन विचार शक्तिशाली उपकरण हैं। यह उन्हें रणनीतिक रूप से उपयोग करना शुरू कर देता है। वह तय कर सकता है, "मुझे पूरे आकाश का वर्णन शब्दों में करने की आवश्यकता नहीं है; मैं पक्षी को खोजने में मदद के लिए बादल के आकार का एक मानसिक नोट रखूँगा।" यह तर्क (reasoning) को बहुत अधिक कुशल और सटीक बनाता है।

🧪 परिणाम: यह क्यों मायने रखता है

शोधकर्ताओं ने LanteRn का परीक्षण तीन कठिन विजुअल पहेलियों (बेंचमार्क जैसे VisCoT, V ⋆, और Blink) पर किया। इन परीक्षणों के लिए AI को सूक्ष्म विवरणों को समझने की आवश्यकता होती है, जैसे कि "कौन सी वस्तु दूसरे के पीछे है?" या "साइकिल ठीक कहाँ खड़ी है?"

  • पुराना तरीका: AI संघर्ष करता था क्योंकि 3D स्पेस को 2D टेक्स्ट में अनुवादित करना एक 3D मूर्ति को केवल एक सपाट स्केच का उपयोग करके वर्णित करने जैसा है। वह अक्सर भटक जाता था।
  • LanteRn का तरीका: सोचने के दौरान अपने मन (लेटेंट स्पेस) में "3D मूर्ति" को रखने से, AI ने इन पहेलियों को बहुत बेहतर तरीके से हल किया।
    • यह ऑब्जेक्ट लोकलाइजेशन (चीजें ठीक कहाँ हैं, यह ढूंढना) में बेहतर हुआ।
    • यह रिलेटिव पोजीशन (क्या आगे है और क्या पीछे है, यह समझना) में बेहतर हुआ।

💡 मुख्य निष्कर्ष (The Takeaway)

LanteRn एक बड़ी उपलब्धि है क्योंकि यह AI को सोचने से पहले अपनी दृष्टि को शब्दों में "अनुवाद" करने के लिए मजबूर करना बंद कर देता है। इसके बजाय, यह AI को चित्रों में सोचने की अनुमति देता है और केवल तभी बोलता है जब उसके पास अंतिम उत्तर होता है।

  • पहले: चित्र देखें \rightarrow टेक्स्ट में अनुवाद करें \rightarrow टेक्स्ट में सोचें \rightarrow उत्तर दें।
  • LanteRn: चित्र देखें \rightarrow चित्रों में सोचें \rightarrow टेक्स्ट में अनुवाद करें \rightarrow उत्तर दें।

यह AI को स्मार्ट, तेज़ और भौतिक दुनिया को समझने वाले कार्यों के लिए बहुत बेहतर बनाता है, और वह भी बिना किसी विशाल, महंगे कंप्यूटर की आवश्यकता के। यह ऐसा है जैसे AI को "मानसिक चश्मे" देना जो उसे बोलने से पहले ही समाधान को स्पष्ट रूप से देखने में मदद करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →