Show, Don't Ask: Generative Visual Disambiguation for Composed Image Retrieval with Turn-Valid Coverage
यह शोध पत्र CLARA का प्रस्ताव करता है, जो कि कंपोज्ड इमेज रिट्रीवल के लिए एक जनरेटिव विजुअल डिसैम्बिग्युएशन फ्रेमवर्क है, जो टेक्स्ट आधारित प्रश्न पूछने के बजाय चयन के लिए वास्तविक इमेज प्रोटोटाइप का एक पैनल प्रस्तुत करके उपयोगकर्ता की मंशा की अस्पष्टता को हल करता है, जिससे कई इंटरैक्शन राउंड्स में वैध कॉन्फॉर्मल कवरेज गारंटी बनी रहती है और यह फाइन-ग्रेंड सिनेरियो में टेक्स्ट-आधारित बेसलाइन्स से बेहतर प्रदर्शन करता है।