← नवीनतम पेपर
🤖 AI

Mull-Tokens: Modality-Agnostic Latent Thinking

यह शोध पत्र Mull-Tokens को प्रस्तुत करता है, जो एक मोडैलिटी-अज्ञेय (modality-agnostic) लेटेंट टोकन फ्रेमवर्क है जो मल्टीमॉडल मॉडल्स को टेक्स्ट और इमेज मोडैलिटीज के बीच मुक्त-रूप (free-form) मध्यवर्ती तर्क करने में सक्षम बनाता है, जिससे भंगुर टूल कॉल्स या महंगी इमेज जनरेशन पर निर्भर किए बिना जटिल स्थानिक और पहेली-समाधान कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

प्रकाशित 2026-05-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी समस्या: एक आयामी सोच (Thinking in One Dimension)

कल्पना कीजिए कि आप एक जटिल 3D पहेली हल करने की कोशिश कर रहे हैं, जैसे कि रूबिक क्यूब या जिग्सॉ पहेली। यदि आप इसे केवल शब्दों के माध्यम से हल करने का प्रयास करते हैं, तो आप कह सकते हैं, "लाल टुकड़े को बाईं ओर ले जाएं, फिर नीले वाले को घुमाएं।" लेकिन शब्द इसके लिए धीमे और अनाड़ी होते हैं; वे आसानी से स्थान (space), गहराई या वस्तुओं के आपस में फिट होने के तरीके का वर्णन नहीं कर सकते।

वर्तमान AI मॉडल बात करने (टेक्स्ट) में बहुत अच्छे हैं और देखने (इमेज) में भी बहुत अच्छे हैं, लेकिन जब वे स्थान, समय या वस्तुओं के हिलने-डुलने के बारे में तर्क (reasoning) करने की कोशिश करते हैं, तो वे अक्सर लड़खड़ा जाते हैं।

  • पुराना तरीका (केवल टेक्स्ट): AI पहेली को शब्दों के साथ समझाने की कोशिश करता है। वह विवरणों में खो जाता है और गलतियाँ करता है।
  • "बहुत अधिक" वाला तरीका (इमेज + टेक्स्ट): कुछ शोधकर्ताओं ने AI को अपने विचारों को "चित्रित" करने के लिए प्रेरित करने की कोशिश की। लेकिन यह एक शेफ से खाना बनाने के बीच में रुकने, रेसिपी लिखने, डिश का चित्र बनाने और फिर से रेसिपी लिखने के बाद अंत में खाना परोसने के लिए कहने जैसा है। यह महंगा है, धीमा है, और AI अक्सर इस बात को लेकर भ्रमित हो जाता है कि कौन सा चित्र किस वाक्य से मेल खाता है।

समाधान: "मल्ट-टोकन" (जादुई रफ नोटबुक/Scratchpad)

लेखकों ने एक सरल और स्मार्ट टूल प्रस्तावित किया है जिसे Mult-Tokens कहा जाता है।

AI के मस्तिष्क को एक रसोईघर के रूप में सोचें।

  • टेक्स्ट टोकन (Text tokens) शेफ के मौखिक निर्देशों की तरह हैं।
  • इमेज टोकन (Image tokens) शेफ द्वारा एक नोटपैड पर चित्र बनाने की तरह हैं।
  • मल्ट-टोकन्स (Mult-Tokens) एक जादुई, अदृश्य रफ नोटबुक (scratchpad) की तरह हैं।

जब AI किसी कठिन समस्या (जैसे स्थानिक पहेली) का सामना करता है, तो वह शब्दों का लंबा पैराग्राफ चिल्लाने या पूरा चित्र बनाने के बजाय, रुकता है और इस अदृश्य रफ नोटबुक पर लिखता है।

यह जादुई क्यों है?

  1. यह मोडैलिटी-एग्नोस्टिक (Modality-Agnostic) है: यह उस फैंसी शब्द का अर्थ है जिसका मतलब है "इसे फर्क नहीं पड़ता कि विचार किस रूप में है।" यह रफ नोटबुक घूमते हुए क्यूब की मानसिक छवि या किसी मार्ग का प्रतीकात्मक मानचित्र रख सकती है। इसे शब्द होने की आवश्यकता नहीं है, और न ही इसे पूर्ण चित्र होने की आवश्यकता है। यह केवल शुद्ध "सोचने वाला डेटा" (thinking data) है।
  2. यह संक्षिप्त (Compact) है: एक विशिष्ट टेक्स्ट-आधारित स्पष्टीकरण में 200 शब्द लग सकते हैं। एक पूर्ण चित्र में सैकड़ों पिक्सेल लग सकते हैं। मल्ट-टोकन दृष्टिकोण केवल 20 से 40 टोकन का उपयोग करके इस समस्या को हल करता है। यह एक गणित की समस्या समझाने के लिए 10 पन्नों का निबंध लिखने बनाम एक नैपकिन पर मुख्य सूत्र (formula) लिखने के अंतर जैसा है।

उन्होंने इसे कैसे प्रशिक्षित किया: तीन-चरणीय जिम रूटीन

शोधकर्ताओं ने केवल AI को रफ नोटबुक नहीं दी; उन्हें यह भी सिखाना था कि इसका उपयोग कैसे किया जाए। उन्होंने तीन-चरणीय प्रशिक्षण प्रक्रिया का उपयोग किया:

  1. वॉर्म-अप (सोचने की भाषा सीखना):
    सबसे पहले, उन्होंने AI को पहेलियाँ सुलझाने के उदाहरण दिखाए। कभी समाधान में एक चित्र शामिल था, तो कभी एक वाक्य। उन्होंने मल्ट-टोकन्स को इन चरणों की नकल करना सिखाया।
  • उपमा: यह एक छात्र की तरह है जो शिक्षक को गणित की समस्या हल करते हुए देख रहा है, कभी शिक्षक को नंबर लिखते हुए देखता है, तो कभी ग्राफ बनाते हुए। छात्र सीखता है कि "रफ नोटबुक" दोनों चीज़ें रख सकती है।
  1. मुक्त-रूप अभ्यास (छोड़ देना):
    इसके बाद, उन्होंने AI को यह दिखाना बंद कर दिया कि समस्या को कैसे हल करना है। उन्होंने केवल अंतिम उत्तर दिखाया। AI को कहा गया: "यह रही पहेली। अपनी रफ नोटबुक का उपयोग करके इसे हल करें, लेकिन मैं आपको यह नहीं बताऊंगा कि इस पर क्या लिखना है। बस सही उत्तर दें।"
  • उपमा: शिक्षक संकेत देना बंद कर देता है और केवल कहता है, "इसे हल करो।" छात्र अपनी रफ नोटबुक का उपयोग उस तरह से करना सीखता है जो उसके लिए सबसे अच्छा काम करे, न कि केवल शिक्षक की नकल करता है।
  1. सुदृढ़ीकरण (अच्छी सोच को पुरस्कृत करना):
    अंत में, उन्होंने GRPO (रीइन्फोर्समेंट लर्निंग) नामक तकनीक का उपयोग किया। यदि AI ने सही उत्तर पाने के लिए अपनी रफ नोटबुक का उपयोग किया, तो उसे "गोल्ड स्टार" मिला। यदि उसने बिना सोचे समझे अनुमान लगाया, तो उसे कुछ नहीं मिला। इसने AI को केवल अनुमान लगाने के बजाय वास्तव में तर्क करने के लिए रफ नोटबुक का उपयोग करने के लिए प्रोत्साहित किया।

परिणाम: तेज़ और स्मार्ट

पेपर ने पहेलियों, 3D स्थानिक तर्क और वीडियो विश्लेषण से संबंधित चार कठिन बेंचमार्क पर इस नई पद्धति का परीक्षण किया।

  • जीत: मल्ट-टोकन्स वाले AI ने मौजूदा सर्वोत्तम तरीकों की तुलना में औसतन 3% बेहतर प्रदर्शन किया। सबसे कठिन पहेली परीक्षणों पर, इसमें 16% का सुधार हुआ।
  • गति: क्योंकि यह केवल ~20 "सोचने वाले टोकन" का उपयोग करता है न कि सैकड़ों शब्दों या चित्रों का, इसलिए इसे चलाना बहुत तेज़ और सस्ता है।
  • लचीलापन: AI ने यह तय करना सीख लिया कि रफ नोटबुक का उपयोग कब करना है। आसान सवालों के लिए, इसने रफ नोटबुक को छोड़ दिया। कठिन स्थानिक पहेलियों के लिए, इसने इसका भारी उपयोग किया।

निष्कर्ष

यह पेपर तर्क देता है कि हमें गहराई से सोचने के लिए AI को "बोलने" या "चित्र बनाने" के लिए मजबूर करने की आवश्यकता नहीं है। इसके बजाय, हम इसे एक मोडैलिटी-एग्नोस्टिक लेटेंट स्पेस (modality-agnostic latent space) दे सकते हैं—एक निजी, आंतरिक "सोचने का कमरा" जहाँ यह पूर्ण वाक्यों या चित्रों के बोझ के बिना छवियों और अवधारणाओं को स्वतंत्र रूप से मिला सकता है।

यह एक इंसान को एक मौन, आंतरिक संवाद देने जैसा है जो किसी 3D वस्तु को वर्णित किए बिना उसका मानसिक चित्रण कर सकता है। परिणाम एक ऐसा AI है जो स्थानिक पहेलियों में बेहतर, तेज़ और अधिक कुशल है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →