← नवीनतम पेपर
💻 computer science

Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model

यह शोध पत्र SCOLAR को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो एक हल्के डिट्रांसफॉर्मर (detransformer) का उपयोग करके मौजूदा लेटेंट विजुअल रीजनिंग विधियों को सीमित करने वाले "इन्फॉर्मेशन गेन कोलैप्स" (Information Gain Collapse) पर विजय प्राप्त करता है, जिससे स्वतंत्र और स्व-सुसंगत विजुअल टोकन उत्पन्न होते हैं, और इस प्रकार काफी लंबी रीजनिंग श्रृंखलाओं को सक्षम करते हुए वास्तविक दुनिया के बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करते हैं।

मूल लेखक: Chenfeng Wang, Wei He, Xuhan Zhu, Chunpeng Zhou, Qizhen Li, Song Yan, Yufei Zheng, Chengjun Yu, Fan Lu, Wei Zhai, Yang Cao, Pengfei Yu, Zheng-Jun Zha

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenfeng Wang, Wei He, Xuhan Zhu, Chunpeng Zhou, Qizhen Li, Song Yan, Yufei Zheng, Chengjun Yu, Fan Lu, Wei Zhai, Yang Cao, Pengfei Yu, Zheng-Jun Zha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि किसी ज्यामितीय आकृति (geometric shape) से जुड़ी कोई गणित की समस्या। आपके पास उस आकृति की एक तस्वीर है, और आपको उत्तर खोजने के लिए उसके बारे में "सोचना" होगा।

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, एक लोकप्रिय विचार है जिसे "चेन ऑफ थॉट" (Chain of Thought) कहा जाता है। यह AI को उत्तर देने से पहले अपने सोचने के चरणों को लिखने के लिए एक नोटपैड देने जैसा है। टेक्स्ट-आधारित AI के लिए, अधिक चरण लिखना आमतौर पर बेहतर उत्तरों की ओर ले जाता है। यह कुछ ऐसा है जैसे कहना, "मैं जितना अधिक इसके बारे में सोचता हूँ, मैं उतना ही स्मार्ट होता जाता हूँ।"

शोधकर्ताओं ने इस विचार को विज़न-लैंग्वेज मॉडल्स (Vision-Language Models - वे AI जो छवियों को देख सकते हैं) पर लागू करने की कोशिश की। वे चाहते थे कि AI छवि के बारे में "लेटेंट थॉट्स" (latent thoughts)—यानी अदृश्य, आंतरिक नोट्स—लिखे, इससे पहले कि वह उत्तर दे। उन्होंने माना कि यदि AI इन अदृश्य नोट्स की एक लंबी सूची लिखेगा, तो वह दृश्य पहेलियों को सुलझाने में अधिक स्मार्ट हो जाएगा।

चौंकाने वाली समस्या: "विस्परिंग चेन" (Whispering Chain) प्रभाव
शोधकर्ताओं ने कुछ अजीब और विरोधाभासी खोजा। जब इन AI मॉडल्स ने एक छवि के बारे में अदृश्य नोट्स की लंबी सूचियाँ लिखने की कोशिश की, तो वे वास्तव में कम बुद्धिमान हो गए।

"टेलीफोन" (या "विस्पर डाउन द लेन") के खेल की कल्पना करें:

  • पुराना तरीका: AI नोट #1 लिखता है। फिर वह नोट #2 लिखने के लिए नोट #1 को पढ़ता है। फिर वह नोट #3 लिखने के लिए नोट #2 को पढ़ता है।
  • परिणाम: जब तक AI नोट #50 तक पहुँचता है, छवि के मूल विवरण विकृत और भुला दिए जाते हैं। यह टेलीफोन गेम के उस हिस्से जैसा है जहाँ पहला व्यक्ति फुसफुसाता है "बिल्ली नीली है," और 50वें व्यक्ति तक पहुँचते-पहुँचते वे कह रहे होते हैं "बिल्ली एक ब्लूबेरी है।" जानकारी ढह जाती है। श्रृंखला जितनी लंबी होती है, AI उतना ही भूलता जाता है कि वह वास्तव में क्या देख रहा है।

इस पेपर में इसे "इन्फॉर्मेशन गेन कोलैप्स" (Information Gain Collapse) कहा गया है। AI नई चीजें सीखना बंद कर देता है और बस बार-बार एक ही भ्रमित, धुंधले विचारों को दोहराने लगता है।

समाधान: SCOLAR (एक "स्नैपशॉट" दृष्टिकोण)
शोधकर्ताओं ने, चेनफेंग वांग और उनकी टीम के नेतृत्व में, इस समस्या को ठीक करने के लिए SCOLAR नामक एक नया सिस्टम बनाया।

AI को एक लंबी श्रृंखला में अपने आप से नोट्स फुसफुसाने के बजाय, SCOLAR एक विशेष टूल का उपयोग करता है जिसे "डिट्रांसफॉर्मर" (detransformer) कहा जाता है। इस टूल को एक सुपर-फास्ट कैमरे वाले फोटोग्राफर के रूप में समझें।

  1. पुराना तरीका (ऑटोरिग्रेसिव - Autoregressive): AI छवि को देखता है, एक नोट लिखता है, उस नोट को देखता है, दूसरा नोट लिखता है, उस नोट को देखता है... और धीरे-धीरे तस्वीर खो देता है।
  2. SCOLAR का तरीका (सिंगल-शॉट - Single-Shot): AI छवि और प्रश्न को देखता है। वह रुकता है। फिर, "डिट्रांसफॉर्मर" तुरंत छवि के उच्च-गुणवत्ता वाले मानसिक स्नैपशॉट्स का एक पूरा सेट एक साथ खींच लेता है।

सरल शब्दों में यह कैसे काम करता है:

  • स्वतंत्रता (Independence): SCOLAR द्वारा बनाया गया प्रत्येक "थॉट टोकन" (नोट) सीधे मूल, स्पष्ट छवि से जुड़ा होता है। वे पिछले नोट के अस्तित्व पर निर्भर नहीं होते। नोट #100 भी नोट #1 की तरह ही मूल फोटो से उतना ही स्पष्ट और जुड़ा हुआ है।
  • क्षय का अभाव (No Decay): क्योंकि वे सभी एक ही "शॉट" में पूर्ण संदर्भ से उत्पन्न होते हैं, इसलिए जानकारी फीकी नहीं पड़ती। AI के पास 1,000 नोट्स की श्रृंखला हो सकती है, और हर एक नोट अभी भी दृश्य पहेली का एक स्पष्ट हिस्सा बनाए रखता है।

प्रशिक्षण: AI को "विजुअली सोचना" सिखाना
इसे काम करने के योग्य बनाने के लिए, टीम ने AI को तीन चरणों में सिखाया:

  1. देखना सीखना: उन्होंने डिट्रांसफॉर्मर को यह सिखाया कि AI के आंतरिक विचारों को वापस स्पष्ट दृश्य विशेषताओं (visual features) में कैसे बदला जाए (जैसे कि एक अनुवादक जो चित्रों की भाषा बोलना सीख रहा हो)।
  2. रुकना सीखना: उन्होंने AI को यह पहचानने के लिए प्रशिक्षित किया कि उसे इन अतिरिक्त विजुअल नोट्स की आवश्यकता कब है। वह सीखता है कि "मुझे इस त्रिकोण को करीब से देखने की जरूरत है" कहना है और स्नैपशॉट टूल को ट्रिगर करना है।
  3. सुदृढीकरण (Reinforcement): उन्होंने एक रिवॉर्ड सिस्टम (वीडियो गेम स्कोर की तरह) का उपयोग किया ताकि AI को केवल तभी इन विजुअल नोट्स का उपयोग करने के लिए प्रोत्साहित किया जा सके जब वे वास्तव में समस्या को हल करने में मदद करते हैं, और उन्हें तब अनदेखा करने के लिए कहा जा सके जब उनकी आवश्यकता न हो।

परिणाम
पेपर का दावा है कि SCLOAR एक बड़ी सफलता है:

  • स्केलेबिलिटी (Scalability): जबकि अन्य तरीके लगभग 10 नोट्स के बाद विफल हो जाते हैं, SCOLAR 30 गुना अधिक (1,000 नोट्स तक) संभाल सकता है और वास्तव में श्रृंखला जितनी लंबी होती है, यह उतना ही बेहतर होता जाता है।
  • प्रदर्शन (Performance): इसने वास्तविक दुनिया के तर्क परीक्षणों (जैसे जटिल आरेख या वास्तविक दुनिया के दृश्यों को समझना) पर अन्य ओपन-सोर्स मॉडल्स को बड़े अंतर से हराया।
  • दिग्गजों को मात देना: एक विशिष्ट टेस्ट (V*Bench) पर, SCOLAR (एक 7-बिलियन पैरामीटर वाला मॉडल) ने 83.77% स्कोर किया, जिसने प्रसिद्ध क्लोज्ड-सोर्स मॉडल GPT-4o (जिसने 67.50% स्कोर किया) को भी पीछे छोड़ दिया।

संक्षेप में
यह पेपर तर्क देता है कि AI को छवियों के बारे में "सोचने" के लिए एक लंबी फुसफुसाहट की कतार में हाथ से हाथ (baton) पास करने की कोशिश करना काम नहीं करता क्योंकि संदेश खो जाता है। इसके बजाय, SCOLAR AI को उसके अपने विचारों के ताज़ा, उच्च-गुणवत्ता वाले फोटोग्राफों का एक ढेर देता है। यह AI को बिना मूल तस्वीर से नज़र हटाए, जितनी गहराई से और जितनी देर चाहे, सोचने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →