← नवीनतम पेपर
🤖 AI

Communication-Inspired Tokenization for Structured Image Representations

यह शोध पत्र COMiT को प्रस्तुत करता है, जो एक संचार-प्रेरित टोकेनाइजेशन फ्रेमवर्क है जो संरचित, ऑब्जेक्ट-सेंट्रिक इमेज रिप्रेजेंटेशन बनाने के लिए एक रिकरेंट ट्रांसफार्मर के माध्यम से डिस्क्रीट विजुअल टोकेन्स को पुनरावृत्ति से परिष्कृत करता है, जो मौजूदा पुनर्निर्माण-केंद्रित विधियों की तुलना में कंपोजिशनल जनरलाइजेशन और रिलेशनल रीजनिंग को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Aram Davtyan, Yusuf Sahin, Yasaman Haghighi, Sebastian Stapf, Pablo Acuaviva, Alexandre Alahi, Paolo Favaro

प्रकाशित 2026-02-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aram Davtyan, Yusuf Sahin, Yasaman Haghighi, Sebastian Stapf, Pablo Acuaviva, Alexandre Alahi, Paolo Favaro

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही धीमी, अविश्वसनीय रेडियो कनेक्टिविटी के माध्यम से अपने एक दोस्त को एक जटिल पेंटिंग का वर्णन करने की कोशिश कर रहे हैं। आपके पास भेजने के लिए "शब्दों" (टोकन) की एक सीमित संख्या है, और आपको यह सुनिश्चित करना होगा कि आपका दोस्त आपके विवरण के आधार पर पूरी तस्वीर को अपने मन में पुनर्गठित कर सके।

अधिकांश वर्तमान AI सिस्टम यह करने की कोशिश करते हैं कि वे पूरी पेंटिंग की एक विशाल, धुंधली तस्वीर ले लें, उसे एक छोटी सी फ़ाइल में सिकोड़ दें, और उम्मीद करें कि दोस्त विवरण का अनुमान लगा लेगा। यह सरल चीजों के लिए ठीक काम करता है, लेकिन यह अक्सर बड़ी तस्वीर को मिस कर देता है: क्या वस्तुएं हैं और वे एक-दूसरे से कैसे संबंधित हैं। AI घास की बनावट (texture) को बेहतर तरीके से याद कर लेता है बजाय इस तथ्य के कि वहां एक कुत्ता दौड़ रहा है।

COMiT (Communication-inspired Tokenization) AI को छवियों के बारे में "बात" करने का सिखाने का एक नया तरीका है, जो इस बात से प्रेरित है कि मनुष्य वास्तव में एक-दूसरे को दृश्य कैसे समझाते हैं।

यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है:

1. पुराना तरीका: "अंधा फोटोग्राफर" (The "Blind Photographer")

पारंपरिक AI टोकनाइज़र एक ऐसे फोटोग्राफर की तरह कार्य करते हैं जो एक तस्वीर लेता है, तुरंत उसे एक छोटे से थंबनेल में सिकोड़ देता है, और वह थंबनेल भेज देता है।

  • समस्या: फ़ाइल को छोटा बनाने के लिए, AI को विवरणों को फेंकना पड़ता है। यह अक्सर फोटो के "दाने" (बनावट) को रखता है लेकिन "कहानी" (वस्तुओं) को खो देता है। यह अपने दोस्त को जंगल की एक ऐसी फोटो भेजने जैसा है जहाँ वे पत्तियों को तो स्पष्ट देख सकते हैं लेकिन यह नहीं बता सकते कि पेड़ के पीछे कोई भालू छिपा है या नहीं।

2. COMiT का तरीका: "गाइडेड टूर गाइड" (The "Guided Tour Guide")

COMiT खेल बदल देता है। एक स्थिर थंबनेल भेजने के बजाय, यह एक टूर गाइड की तरह कार्य करता है जो दृश्य का लाइव, चरण-दर-चरण विवरण देता है।

  • प्रक्रिया: कल्पना कीजिए कि AI एक छोटे से विंडो (एक "क्रॉप") के माध्यम से छवि को देख रहा है।
    1. यह बाईं ओर देखता है और कहता है, "ठीक है, मुझे एक लाल गेंद दिख रही है।"
    2. यह विंडो को दाईं ओर ले जाता है और कहता है, "अब मुझे एक नीला कुत्ता दिख रहा है।"
    3. यह अपने मानसिक नोट को अपडेट करता है: "लाल गेंद, नीला कुत्ता।"
    4. यह फिर से आगे बढ़ता है, एक पेड़ देखता है, और अपने नोट को अपडेट करता है: "लाल गेंद, नीला कुत्ता, हरा पेड़।"

यही "Attentive Sequential" (सचेत क्रमिक) हिस्सा है। AI एक बार में पूरी छवि को निगलने की कोशिश नहीं करता। यह टुकड़े-टुकड़े में विवरण बनाता है, ठीक वैसे ही जैसे एक मानव वक्ता करता है।

3. "वक्ता और श्रोता" एक ही व्यक्ति हैं (The "Speaker and Listener" are the Same Person)

अधिकांश AI सिस्टम में, "बोलने" (छवि को एनकोड करने) के लिए एक मस्तिष्क होता है और "सुनने" (छवि को पुनर्गठित करने) के लिए एक अलग मस्तिष्क होता है।

COMiT अद्वितीय है क्योंकि यह दोनों करने के लिए एक ही मस्तिष्क का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप एक परीक्षा के लिए किसी दृश्य को याद करने की कोशिश कर रहे हैं। आप उसे देखते हैं, खुद को उसका वर्णन करते हैं, और फिर स्मृति से उसे फिर से बनाने की कोशिश करते हैं। फिर आप अपने ड्राइंग की जाँच करते हैं, देखते हैं कि आपने क्या मिस किया, दृश्य को फिर से देखते हैं, और अपनी स्मृति को परिष्कृत करते हैं।
  • COMiT यह लूप करता है। यह संदेश बनाने वाले "वक्ता" के रूप में कार्य करता है, और फिर तुरंत उस संदेश से चित्र को फिर से बनाने की कोशिश करने वाले "श्रोता" के रूप में कार्य करता है। क्योंकि दोनों काम एक ही मस्तिष्क कर रहा है, यह सीखता है कि जानकारी को ठीक से कैसे व्यवस्थित किया जाए ताकि इसे याद रखना आसान हो और इसे फिर से बनाना भी आसान हो।

4. पुनर्गठन का "खेल" (The "Game" of Reconstruction)

प्रशिक्षण प्रक्रिया "टेलीफोन" के खेल की तरह है लेकिन एक ट्विस्ट के साथ।

  • AI को एक शोर युक्त (noisy), धुंधली छवि दी जाती है।
  • इसे टूर गाइड चरणों से बने संदेश का उपयोग करके छवि को "साफ" करना होता है।
  • यदि संदेश अव्यवस्थित था (जैसे, "लाल चीज़, नीली चीज़, हरी चीज़" बिना यह जाने कि वे क्या हैं), तो AI चित्र सही ढंग से बनाने में विफल रहता है।
  • यदि संदेश संरचित है (जैसे, "बाईं ओर लाल गेंद, दाईं ओर नीला कुत्ता"), तो AI एक सटीक चित्र बना सकता है।
  • यदि बनाया गया चित्र मूल से मेल नहीं खाता है, तो AI को दंडित किया जाता है (पॉइंट्स कम होते हैं)। लाखों प्रयासों के बाद, यह अपने "शब्दों" को इस तरह व्यवस्थित करना सीख जाता है कि वे पूरी तरह से समझ में आ सकें।

5. यह क्यों महत्वपूर्ण है: "ऑब्जेक्ट-सेंट्रिक" सोच (Why This Matters: "Object-Centric" Thinking)

COMiT की सबसे बड़ी जीत यह है कि यह स्वाभाविक रूप से चीजों को पिक्सेल के बजाय वस्तुओं (objects) के आधार पर समूहबद्ध करना सीखता है।

  • पुराना AI: "यहाँ फर (fur) के 100 पिक्सेल हैं।"
  • COMiT: "यहाँ 'कुत्ता' के लिए एक टोकन है और 'गेंद' के लिए एक टोकन है।"

क्योंकि AI चरण-दर-चरण संदेश बनाता है, वह सीखता है कि "कुत्ता" एक विशिष्ट इकाई है जिसे इधर-उधर ले जाया जा सकता है या अन्य चीजों से जोड़ा जा सकता है। यह AI को तर्क करने (reasoning) में बहुत बेहतर बनाता है। यदि आप पूछते हैं, "क्या कुत्ता गेंद का पीछा कर रहा है?", तो एक पारंपरिक AI भ्रमित हो सकता है क्योंकि वह केवल फर और लाल रंग का एक धुंधलापन देखता है। COMiT जानता है कि कुत्ता और गेंद कहाँ हैं, इसलिए वह प्रश्न का सही उत्तर दे सकता है।

सारांश (Summary)

COMiT को एक छवि के बारे में केवल एक संपीड़ित (compressed) फोटो लेने के बजाय उसके बारे में एक कहानी लिखने के लिए सिखाने के रूप में समझें।

  • यह छवि को टुकड़ों में देखता है।
  • यह वस्तुओं की एक मानसिक सूची बनाता है।
  • यह चित्र को फिर से बनाने के लिए उस सूची का उपयोग करता है।
  • क्योंकि यह इस "कहानी सुनाने" के लूप का अभ्यास करता है, यह अंततः दुनिया की बहुत अधिक स्मार्ट, अधिक संगठित समझ विकसित करता है, जो इसे वस्तुओं के बीच संबंधों को समझने या नई दृश्यों के अनुकूल होने जैसे जटिल कार्यों के लिए बेहतर बनाता है।

संक्षेप में: पुराना AI छवि को सिकोड़ने की कोशिश करता है। COMiT छवि के अंदर की कहानी को समझने की कोशिश करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →