← नवीनतम पेपर
💬 NLP

The Vision Wormhole: Latent-Space Communication in Heterogeneous Multi-Agent Systems

यह शोध पत्र "विज़न वर्महोल" (Vision Wormhole) प्रस्तुत करता है, जो एक यूनिवर्सल विज़ुअल कोडेक का उपयोग करके रीजनिंग ट्रेसेस (reasoning traces) को एक साझा निरंतर स्थान (shared continuous space) में मैप करने के माध्यम से विषम मल्टी-एजेंट सिस्टम के बीच कुशल लेटेंट-स्टेट संचार को सक्षम बनाता है, जिससे अलाइनमेंट जटिलता कम होती है और गति एवं सटीकता दोनों में सुधार होता है।

मूल लेखक: Xiaoze Liu, Ruowang Zhang, Weichen Yu, Siheng Xiong, Liu He, Feijie Wu, Hoin Jung, Matt Fredrikson, Xiaoqian Wang, Jing Gao

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoze Liu, Ruowang Zhang, Weichen Yu, Siheng Xiong, Liu He, Feijie Wu, Hoin Jung, Matt Fredrikson, Xiaoqian Wang, Jing Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र "द विज़न वर्महोल" (The Vision Wormhole) की व्याख्या दी गई है।

समस्या: "टेलीफोन गेम" की बाधा (The "Telephone Game" Bottleneck)

कल्पना कीजिए कि आपके पास एक कठिन समस्या को हल करने के लिए काम कर रही अत्यधिक बुद्धिमान विशेषज्ञों (AI एजेंटों) की एक टीम है। एक विशेषज्ञ गणितज्ञ है, दूसरा कोडर है, और तीसरा तर्कशास्त्री (logician) है। उन्हें पहेली सुलझाने के लिए आपस में जानकारी साझा करने की आवश्यकता है।

वर्तमान में, ये विशेषज्ञ पत्र लिखकर संवाद करते हैं।

  • बाधा (The Bottleneck): पत्र लिखने में समय लगता है। उसे पढ़ने में भी समय लगता है। और जब आप एक जटिल विचार को शब्दों में संक्षिप्त करते हैं, तो आप उसकी सूक्ष्मता (nuance) खो देते हैं (जैसे किसी अंधे व्यक्ति को रंग का वर्णन करने की कोशिश करना)।
  • विषमता की समस्या (The Heterogeneity Issue): यदि गणितज्ञ फ्रांसीसी में लिखता है और कोडर केवल अंग्रेजी पढ़ता है, तो आपको एक अनुवादक की आवश्यकता होती है। यदि आपके पास 10 अलग-अलग विशेषज्ञ हैं जो 10 अलग-अलग "भाषाएं" (अलग-अलग AI मॉडल) बोलते हैं, तो आपको 90 अलग-अलग अनुवादकों की आवश्यकता होगी। यह महंगा, धीमा और अव्यवस्थित है।

समाधान: "विज़न वर्महोल" (The Vision Wormhole)

शोधकर्ताओं ने महसूस किया कि इनमें से कई AI विशेषज्ञ वास्तव में विज़न-लैंग्वेज मॉडल्स (VLMs) हैं। इसका अर्थ है कि वे केवल टेक्स्ट नहीं पढ़ते; वे छवियों (images) को भी "देख" सकते हैं।

विशेषज्ञों को पत्र (टेक्स्ट) लिखने के बजाय, शोधकर्ताओं ने एक "विज़न वर्महोल" बनाया है। यह विशेषज्ञों को शब्दों की आवश्यकता के बिना सीधे एक-दूसरे की आँखों में मानसिक स्नैपशॉट (mental snapshots) भेजने की अनुमति देता है।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

1. "मानसिक स्नैपशॉट" (लेडेंट रोलआउट - Latent Rollout)

जब गणितज्ञ AI किसी समस्या के बारे में सोच रहा होता है, तो उसके पास केवल एक अंतिम उत्तर नहीं होता। उसके पास विचारों और गणनाओं का एक प्रवाह (stream) होता है। विज़न वर्महोल इस विचार के प्रवाह को एक "लेडेंट रोलआउट" के रूप में कैप्चर करता है।

  • उपमा: यह कहने के लिए कि "मुझे लगता है कि उत्तर 5 है," एक सारांश पत्र लिखने के बजाय, गणितज्ञ अपने पूरे रफ-वर्क (scratchpad) की एक हाई-रिज़ॉल्यूशन फोटो लेता है, जिसमें गणना का हर चरण दिखाई देता है।

2. सार्वभौमिक अनुवादक (द कोडक - The Codec)

गणितज्ञ का "रफ-वर्क फोटो" उनके विशिष्ट आंतरिक प्रारूप (format) में होता है। कोडर AI इसे सीधे नहीं पढ़ सकता क्योंकि वे अलग-अलग आंतरिक प्रणालियों का उपयोग करते हैं।

  • शोधकर्ताओं ने एक हल्का कोडक (Codec) (कंप्रेसर/डीकंप्रेसर) बनाया है।
  • यह कोडक गणितज्ञ के रफ-वर्क को एक मानकीकृत दृश्य पैकेट (standardized visual packet) में बदल देता है।
  • उपमा: यह हाथ से लिखे नोट को एक मानक QR कोड में बदलने जैसा है। QR कोड में सारी जानकारी होती है, लेकिन यह एक ऐसे सार्वभौमिक प्रारूप में होती है जिसे कोई भी स्कैनर पढ़ सकता है।

3. हब-एंड-स्पोक सिस्टम (अनुवादक की समस्या का समाधान)

याद है 10 विशेषज्ञों के लिए 90 अनुवादकों की आवश्यकता वाली समस्या? विज़न वर्महोल हब-एंड-स्पोक (Hub-and-Spoke) डिज़ाइन के साथ इसे हल करता है।

  • हर विशेषज्ञ को दूसरे विशेषज्ञ से बात करने के लिए सीखने के बजाय, वे सभी एक केंद्रीय हब (Central Hub) से बात करना सीखते हैं।
  • गणितज्ञ अपना QR कोड हब को भेजता है। हब उसे उस प्रारूप में अनुवादित करता है जिसे कोडर समझ सके।
  • उपमा: कल्पना कीजिए कि एक कमरे में हर कोई अलग भाषा बोलता है। हर किसी को 9 अन्य भाषाएँ सीखने के बजाय, वे सभी बस अपने फोन पर एक यूनिवर्सल ट्रांसलेटर ऐप का उपयोग करना सीख जाते हैं। आपको प्रत्येक जोड़ी के लिए अपडेट करने के बजाय, प्रत्येक नए व्यक्ति के लिए केवल एक बार ऐप को अपडेट करने की आवश्यकता होती है। यह जटिलता को O(N2)O(N^2) (क्वाड्रेटिक) से घटाकर O(N)O(N) (लीनियर) कर देता है।

4. विज़न का इंजेक्शन (Injecting the Vision)

कोडर AI को मानकीकृत विज़ुअल पैकेट प्राप्त होता है। टेक्स्ट पढ़ने के बजाय, पैकेट को कोडर के विज़ुअल इनपुट लेयर में सीधे इंजेक्ट किया जाता है।

  • उपमा: यह ऐसा है जैसे कोडर अचानक अपने मन की आँखों में गणितज्ञ के रफ-वर्क को प्रकट होते हुए देखता है। उन्हें शब्दों को डिकोड करने की आवश्यकता नहीं होती; वे बस जानकारी को दृश्य रूप में महसूस करते हैं।

यह बेहतर क्यों है?

  1. यह तेज़ है: विचारों को शब्दों में बदलने और फिर से उन्हें पढ़ने की प्रक्रिया को छोड़ देने से बहुत समय बचता है। शोध पत्र दिखाता है कि यह समस्याओं को हल करने में लगने वाले कुल समय को कम करता है।
  2. यह अधिक सटीक है: चूंकि आप टेक्स्ट में अनुवाद के दौरान जानकारी खो नहीं रहे हैं, इसलिए एजेंट अक्सर बेहतर उत्तर देते हैं, विशेष रूप से कोडिंग या जटिल गणित जैसे कार्यों में।
  3. यह स्केलेबल है: टीम में एक नया प्रकार का AI जोड़ना आसान है। आप बस उस नए AI को हब से बात करने के लिए एक छोटा "कोडक" प्रशिक्षित करते हैं। आपको प्रत्येक एजेंट के साथ कनेक्शन को फिर से प्रशिक्षित करने की आवश्यकता नहीं है।
  4. "ऑफ-मैनिफ़ोल्ड" त्रुटियों का अभाव: शुद्ध टेक्स्ट AI मॉडल भ्रमित हो जाते हैं यदि आप उन्हें रैंडम नंबर (कंटीन्यूअस डेटा) फीड करते हैं। लेकिन विज़न-लैंग्वेज मॉडल्स छवियों (जो नंबरों का ग्रिड होती हैं) को देखने के लिए प्रशिक्षित होते हैं। इसलिए, इस "विज़ुअल पैकेट" को फीड करना उनके लिए स्वाभाविक लगता है, जिससे सिस्टम क्रैश होने या मतिभ्रम (hallucination) से बच जाता है।

परिणाम

शोधकर्ताओं ने विभिन्न कार्यों (गणित, तर्क, कोडिंग) पर विभिन्न AI मॉडल (Qwen, Gemma, SmolVLM, LFM) का उपयोग करके परीक्षण किया।

  • गति: पारंपरिक टेक्स्ट-आधारित विधि की तुलना में विज़न वर्महोल लगातार तेज़ था।
  • सटीकता: कई मामलों में, विशेष रूप से कोडिंग और गणित में, सटीकता में सुधार हुआ।
  • दक्षता: उन्होंने साबित किया कि आपको इसे प्रशिक्षित करने के लिए भारी मात्रा में डेटा की आवश्यकता नहीं है। बहुत कम उदाहरणों (कमजोर पर्यवेक्षण/weak supervision) के साथ भी, सिस्टम ने अच्छा काम किया।

सारांश में

विज़न वर्महोल एक चतुर तकनीक है। यह AI मॉडल्स की "आंखों" का उपयोग करके विचारों को साझा करने के लिए एक गुप्त, उच्च-गति सुरंग बनाने के लिए उन्हें पुन: उपयोग करता है। आंतरिक तर्क को एक दृश्य प्रारूप में बदलकर, यह विभिन्न AI मॉडलों को तुरंत और सटीक रूप से सहयोग करने की अनुमति देता है, बिना टेक्स्ट लिखने और पढ़ने की धीमी और सूचना खोने वाली प्रक्रिया के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →