Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence
यह शोध पत्र EAGLE का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त मल्टी-एजेंट फ्रेमवर्क है जो केवल उत्तरों की सहमति के बजाय संरेखित दृश्य साक्ष्यों को प्राथमिकता देकर विजन-लैंग्वेज मॉडल (Vision-Language Model) की सर्वसम्मति को बढ़ाता है, जिससे विविध VQA बेंचमार्क पर बेहतर और व्याख्या योग्य प्रदर्शन प्राप्त होता है।