← नवीनतम पेपर
🤖 AI

Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence

यह शोध पत्र EAGLE का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त मल्टी-एजेंट फ्रेमवर्क है जो केवल उत्तरों की सहमति के बजाय संरेखित दृश्य साक्ष्यों को प्राथमिकता देकर विजन-लैंग्वेज मॉडल (Vision-Language Model) की सर्वसम्मति को बढ़ाता है, जिससे विविध VQA बेंचमार्क पर बेहतर और व्याख्या योग्य प्रदर्शन प्राप्त होता है।

मूल लेखक: Yuhan Wang, Shuochen Chang, Yalin Feng, Dongsheng Ma, Yuanzi Li, Zhengren Wang, Yinglong Yang, Yufei Chen, Yikang Wang, Shaoxu Sun, Wentao Zhang

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhan Wang, Shuochen Chang, Yalin Feng, Dongsheng Ma, Yuanzi Li, Zhengren Wang, Yinglong Yang, Yufei Chen, Yikang Wang, Shaoxu Sun, Wentao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कठिन पहेली सुलझाने की कोशिश कर रहे हैं, लेकिन अकेले करने के बजाय, आप मदद के लिए तीन अलग-अलग विशेषज्ञों से पूछते हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, ये "विशेषज्ञ" विज़न-लैंग्वेज मॉडल्स (VLMs) कहलाते हैं। वे सुपर-स्मार्ट रोबोटों की तरह हैं जो एक तस्वीर देख सकते हैं और उसके बारे में सवालों के जवाब दे सकते हैं।

हालाँकि, ये रोबोट कभी-कभी गलतियाँ कर सकते हैं। वे "हैलुसिनेट" (hallucinate) कर सकते हैं—यानी, वे आत्मविश्वास के साथ कुछ ऐसा सच बता सकते हैं जो केवल एक अनुमान या याददाश्त पर आधारित हो, भले ही तस्वीर में वह चीज़ वास्तव में न दिख रही हो।

समस्या: गलत चीज़ पर सहमत होना

अतीत में, जब शोधकर्ताओं ने कई AI रोबोटों को मिलकर काम करने के लिए प्रेरित करने की कोशिश की, तो उन्होंने केवल उनके जवाबों पर बहस करने को कहा।

  • रोबोट A: "मुझे लगता है कि बैकपैक ग्रे रंग का है।"
  • रोबोट B: "मुझे लगता है कि बैकपैक ग्रे रंग का है।"
  • रोबोट C: "मुझे लगता है कि बैकपैक ग्रे रंग का है।"

यदि वे सभी सहमत होते हैं, तो सिस्टम मान लेता है कि उत्तर सही है। लेकिन यहाँ एक पेंच है: वे सभी गलत चीज़ पर गलत कारणों से सहमत हो सकते हैं।

हो सकता है कि रोबोट A ने बैकपैक देखा हो। हो सकता है कि रोबोट B ने एक ग्रे कुर्सी देखी और उसे बैकपैक समझ लिया। हो सकता है कि रोबोट C ने "ग्रे" इसलिए कहा क्योंकि यह एक आम रंग है। उन सबने "ग्रे" कहा, इसलिए सिस्टम ने इसे स्वीकार कर लिया, भले ही उनकी "आँखें" तस्वीर के अलग-अलग हिस्सों को देख रही थीं। यह एक जूरी की तरह है जो अपराध स्थल की तस्वीरों को एक साथ देखे बिना ही फैसले पर सहमत हो जाती है।

समाधान: "सहमत होने से पहले देखना"

इस पेपर के लेखकों ने, जिन्होंने EAGLE नामक एक सिस्टम बनाया है, महसूस किया कि AI रोबोटों के एक समूह के लिए एक-दूसरे पर भरोसा करने के लिए, उन्हें केवल उस शब्द पर सहमत नहीं होना चाहिए जो वे बोलते हैं; उन्हें इस पर भी सहमत होना चाहिए कि वे क्या देख रहे हैं

EAGLE को एक डिटेक्टिव टीम मीटिंग की तरह समझें जहाँ हर किसी को वोट देने से पहले साक्ष्य बोर्ड (evidence board) पर सटीक स्थान की ओर इशारा करना होता है।

यहाँ बताया गया है कि EAGLE कैसे काम करता है, चरण-दर-चरण:

  1. "क्या देखना है" का गाइड: सबसे पहले, सिस्टम यह पता लगाता है कि किस प्रकार के सुराग की आवश्यकता है। क्या यह एक एकल वस्तु (जैसे एक कुत्ता) है? एक संबंध (जैसे पेड़ के पास एक कुत्ता)? या पूरा दृश्य? यह रोबोटों को ठीक बताता है कि उन्हें कहाँ ध्यान केंद्रित करना है।
  2. "अपना काम दिखाओ" राउंड: प्रत्येक रोबोट तस्वीर को देखता है और एक उत्तर देता है, लेकिन उसे अपने उत्तर के समर्थन में छवि के विशिष्ट भाग के चारों ओर एक बॉक्स भी बनाना होगा। उसे एक वाक्य भी लिखना होगा जो समझाए, "मैं इस बॉक्स को देख रहा हूँ, और इसीलिए मुझे लगता है कि उत्तर X है।"
  3. "अंतर पहचानो" चेक: सिस्टम बॉक्स और स्पष्टीकरणों की तुलना करता है।
    • यदि रोबोट A बैकपैक की ओर इशारा करता है और रोबोट B कुर्सी की ओर, तो सिस्टम कहता है, "रुको, तुम एक ही चीज़ नहीं देख रहे हो! तुम अभी सहमत नहीं हो सकते।"
    • यदि वे सभी बैकपैक की ओर इशारा करते हैं और इस बात पर सहमत होते हैं कि वह ग्रे क्यों है, तो सिस्टम कहता है, "बहुत बढ़िया, आपकी आँखें एक ही दिशा में हैं। हम इस उत्तर पर भरोसा कर सकते हैं।"
  4. "दूसरी नज़र" (संशोधन): यदि रोबट असहमत होते हैं या अलग-अलग चीजें देख रहे होते हैं, तो उन्हें संशोधन करने का मौका मिलता है। वे एक-दूसरे के बॉक्स देखते हैं और कहते हैं, "ओह, मैं देख रहा हूँ कि आप कुर्सी नहीं, बल्कि बैकपैक की ओर इशारा कर रहे हैं। मुझे अपना उत्तर बदलने दें।"
  5. अंतिम निर्णय: यदि वे अभी भी सहमत नहीं हो पाते हैं, तो सिस्टम उस उत्तर को चुनता है जो सबसे अधिक रोबोटों द्वारा समर्थित है जो एक ही विजुअल साक्ष्य को देख रहे हैं।

यह क्यों महत्वपूर्ण है

इस पेपर ने छह अलग-अलग प्रकार की विजुअल पहेलियों (जैसे चार्ट पढ़ना, वस्तुओं को पहचानना, या जटिल दृश्यों को समझना) पर इस विचार का परीक्षण किया।

  • परिणाम: EAGLE अन्य तरीकों की तुलना में सही उत्तर पाने में बहुत बेहतर था।
  • दक्षता: इसे रोबोटों को अनंत काल तक बात करने के लिए कहने की आवश्यकता नहीं थी। आमतौर पर, "अपना काम दिखाने" और एक-दूसरे के बॉक्स की जाँच करने का केवल एक दौर ही गलतियों को सुधारने के लिए पर्याप्त था।
  • मुख्य अंतर्दृष्टि: यह पेपर साबित करता है कि उत्तर पर सहमति पर्याप्त नहीं है। आपको विजुअल साक्ष्य पर सहमति की आवश्यकता है। यदि रोबोट तस्वीर के एक ही हिस्से को देख रहे हैं, तो उन्हें अपनी कल्पना से धोखा दिए जाने की संभावना बहुत कम होती है।

संक्षेप में

एक समूह के दोस्तों की कल्पना करें जो फोटो में एक पक्षी की पहचान करने की कोशिश कर रहे हैं।

  • पुराना तरीका: वे सभी चिल्लाते हैं "यह एक गौरैया है!" और समूह इसे स्वीकार कर लेता है, भले ही एक व्यक्ति पत्थर की ओर देख रहा हो और दूसरा पेड़ की ओर।
  • EAGLE तरीका: उन्हें पहले पक्षी की ओर अपनी उंगलियों से इशारा करना होगा। यदि एक व्यक्ति पत्थर की ओर इशारा करता है, तो समूह रुक जाता है और कहता है, "रुको, तुम गलत चीज़ देख रहे हो!" वे तब तक बात करते रहते हैं जब तक कि सभी एक ही पक्षी की ओर इशारा न करने लगें। उसके बाद ही वे उसके नाम पर सहमत होते हैं।

यह तरीका AI टीमों को अधिक विश्वसनीय, तथ्य बनाने से कम संभावित और समझने में आसान बनाता है क्योंकि आप देख सकते हैं कि वे अपने उत्तर के लिए वास्तव में कहाँ देख रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →