← नवीनतम पेपर
💻 computer science

PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing

यह शोध पत्र PinPoint को प्रस्तुत करता है, जो मल्टी-आंसर ग्राउंड ट्रुथ्स, स्पष्ट हार्ड नेगेटिव्स और मल्टी-इमेज क्वेरीज़ से युक्त कंपोज्ड इमेज रिट्रीवल के लिए एक व्यापक वास्तविक-विश्व बेंचमार्क है, जो वर्तमान विधियों की महत्वपूर्ण सीमाओं को उजागर करता है, साथ ही इन कमियों को दूर करने के लिए एक ट्रेनिंग-फ्री MLLM-आधारित रीरैंकिंग समाधान का प्रस्ताव देता है।

मूल लेखक: Rohan Mahadev, Joyce Yuan, Patrick Poirson, David Xue, Hao-Yu Wu, Dmitry Kislyuk

प्रकाशित 2026-03-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rohan Mahadev, Joyce Yuan, Patrick Poirson, David Xue, Hao-Yu Wu, Dmitry Kislyuk

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल शॉपिंग वेबसाइट पर एक विशिष्ट पोशाक (outfit) खोजने की कोशिश कर रहे हैं। आप केवल "लाल ड्रेस" नहीं खोजना चाहते। आप कहना चाहते हैं, "मुझे इस फोटो वाली वह ड्रेस दिखाएं, लेकिन इसे लाल कर दें, जूतों को बदलकर बूट्स कर दें, और पूरे लुक को अधिक एलीगेंट (elegant) बना दें।"

यह कंपोज्ड इमेज रिट्रीवल (Composed Image Retrieval - CIR) है। यह एक डिजिटल स्टाइलिस्ट को एक संदर्भ फोटो और निर्देशों की एक सूची देने जैसा है।

लंबे समय तक, इन "डिजिटल स्टाइलिस्टों" का परीक्षण करने वाले कंप्यूटर वैज्ञानिकों के पास एक बहुत ही सरल परीक्षण था: उन्होंने कंप्यूटर से एक सही उत्तर खोजने के लिए कहा। यदि कंप्यूटर ने शीर्ष 10 परिणामों में से एक भी सही उत्तर ढूंढ लिया, तो उसे एक स्टार मिल जाता था।

लेकिन वास्तविक दुनिया में, जीवन इतना सरल नहीं है। हो सकता कि वहां कई अलग-अलग लाल ड्रेस हों जो आपके विवरण पर खरी उतरती हों, और कंप्यूटर गलती से एक लाल ड्रेस के बजाय एक लाल वॉलेट (बटुआ) दिखा दे। पुराने परीक्षणों ने इन गलतियों को नहीं पकड़ा।

पेश है PinPoint

"PinPoint" बेंचमार्क: एक कठिन परीक्षा

Pinterest के लेखकों ने एक नया, बहुत कठिन परीक्षण मैदान बनाया जिसे PinPoint कहा गया है। इसे एक बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) से अपग्रेड करके एक वास्तविक जीवन के जॉब इंटरव्यू में बदलने जैसा समझें।

यहाँ बताया गया है कि रोजमर्रा के उदाहरणों का उपयोग करते हुए PinPoint क्या विशेष बनाता है:

1. "कई सही उत्तरों" का नियम

  • पुराना तरीका: यदि आपने "नीली शर्ट" मांगी, तो परीक्षण केवल यह देखता था कि क्या कंप्यूटर ने एक विशिष्ट नीली शर्ट ढूंढ ली है।
  • PinPoint का तरीका: उन्होंने महसूस किया कि दर्जनों वैध नीली शर्टें हो सकती हैं। इसलिए, उन्होंने प्रत्येक क्वेरी के लिए 9.1 सही उत्तर चिह्नित किए। यह एक छात्र को केवल एक उत्तर खोजने के बजाय, कई सही उत्तरों में से किसी को भी खोजने के आधार पर ग्रेड देने जैसा है।

2. "ट्रैप डोर" (स्पष्ट नकारात्मक/Explicit Negatives)

  • पुराना तरीका: परीक्षण में केवल सही उत्तर थे। यदि कंप्यूटर भ्रमित हो गया और एक लाल शर्ट दिखा दी, तो परीक्षण को इससे फर्क नहीं पड़ता था क्योंकि वहां कोई "लाल शर्ट" गलत उत्तर के रूप में सूचीबद्ध नहीं थी जिसे जांचा जा सके।
  • PinPoint का तरीका: उन्होंने प्रत्येक क्वेरी के लिए 32.8 "ट्रैप" आइटम (हार्ड नेगेटिव्स) लगाए। ये वे चीजें हैं जो दिखने में बहुत समान हैं लेकिन गलत हैं (जैसे, जब आपने लाल ड्रेस मांगी हो तो लाल वॉलेट दिखाना)। यह परीक्षण करता है कि क्या कंप्यूटर वास्तव में ध्यान दे रहा है या केवल अनुमान लगा रहा है।

3. "वही विचार, अलग शब्द" का परीक्षण (पैराफ्रेज़/Paraphrases)

  • पुराना तरीका: कंप्यूटर का परीक्षण एक विशिष्ट वाक्य पर किया जाता था: "इसे नीला बनाओ।"
  • PinPoint का तरीका: उन्होंने कंप्यूटर का परीक्षण एक ही बात कहने के 6 अलग-अलग तरीकों के साथ किया: "इसे नीला बनाओ," "इसका रंग बदलकर नीला कर दो," "मुझे यह नीले रंग में चाहिए," आदि। यदि कंप्यूटर एक के लिए काम करता है लेकिन दूसरे के लिए विफल हो जाता है, तो वह वास्तव में स्मार्ट नहीं है; वह केवल विशिष्ट वाक्यांश को याद कर रहा है।

4. "डबल विजन" टेस्ट (मल्टी-इमेज)

  • पुराना तरीका: आप केवल एक संदर्भ फोटो दिखा सकते थे।
  • PinPoint का तरीका: उन्होंने उपयोगकर्ताओं को दो फोटो मिलाने की अनुमति दी (जैसे, "फोटो A से ड्रेस लें और फोटो B से जूते लें")। यह एक शेफ से एक किताब से रेसिपी लेने और दूसरी किताब से सामग्री मिलाने के लिए कहने जैसा है।

जब उन्होंने कंप्यूटरों का परीक्षण किया तो क्या हुआ?

लेखकों ने इस नए, कठिन PinPoint टेस्ट का उपयोग करके 20 से अधिक विभिन्न AI मॉडल (डिजिटल स्टाइलिस्ट) का परीक्षण किया। परिणाम चौंकाने वाले थे:

  • "फॉल्स पॉजिटिव" (False Positive) की समस्या: सर्वश्रेष्ठ मॉडल कुछ न कुछ सही खोजने में बहुत अच्छे थे, लेकिन गलत चीजों से बचने में वे बहुत खराब थे। वे "ट्रैप" आइटम्स (जैसे लाल वॉलेट) को लगभग 9% समय दिखाते रहे। यह एक ऐसे सर्च इंजन की तरह है जो आपको बार-बार उन चीजों के विज्ञापन दिखाता रहता है जिनकी आपने मांग नहीं की थी।
  • "भंगुरता" (Fragile) की समस्या: जब निर्देशों को फिर से लिखा गया, तो सर्वश्रेष्ठ मॉडलों का प्रदर्शन 25% गिर गया। यह एक ऐसे छात्र की तरह है जो गणित का सवाल हल कर सकता है यदि आप उसे नीली स्याही में लिखें, लेकिन यदि आप उसे लाल स्याही में लिखते हैं तो विफल हो जाता है। वे विचार को नहीं समझ रहे हैं; वे केवल शब्दों को याद कर रहे हैं।
  • "मल्टी-इमेज" संघर्ष: जब दो फोटो मिलाने के लिए कहा गया, तो मॉडल 40% से 70% तक खराब प्रदर्शन कर गए। वे एक तस्वीर देखने में अच्छे हैं, लेकिन दो को मिलाने में बहुत खराब हैं।

जादुई समाधान: "दूसरा विचार" (The Second Opinion)

लेखकों ने केवल समस्याओं की ओर इशारा नहीं किया; उन्होंने एक चतुर, मुफ्त समाधान भी दिया।

उन्होंने एक रीरैंकर (Reranker) जोड़ा। कल्पना कीजिए कि आपके पास एक तेज़, सस्ता सहायक है जो जल्दी से शेल्फ से 100 आइटम निकाल लेता है। वे तेज़ हैं, लेकिन वे गलतियाँ करते हैं। फिर, आपके पास एक सुपर-स्मार्ट, धीमा विशेषज्ञ (एक बड़ा AI मॉडल) है जो उन 100 वस्तुओं को एक-एक करके देखता है और कहता है, "नहीं, यह एक वॉलेट है, ड्रेस नहीं। हाँ, यह ड्रेस एकदम सही है।"

यह "सेकंड ओपिनियन" चरण:

  • इसके लिए मुख्य AI को दोबारा प्रशिक्षित करने की आवश्यकता नहीं थी (यह "ट्रेनिंग-फ्री" है)।
  • इसने परीक्षण किए गए प्रत्येक मॉडल में तुरंत सुधार किया।
  • इसने गलतियों (लाल वॉलेट) को काफी हद तक कम कर दिया।

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि हालांकि हमारे AI सर्च टूल्स स्मार्ट हो रहे हैं, फिर भी वे भंगुर (brittle) हैं। वे चीजें खोजने में अच्छे हैं लेकिन यह जानने में खराब हैं कि क्या नहीं दिखाना है, और जब आप अपनी शब्दावली बदलते हैं या उन्हें कई तस्वीरें दिखाते हैं तो वे भ्रमित हो जाते हैं।

PinPoint वह नया पैमाना है जिसकी हमें आवश्यकता है ताकि हम माप सकें कि क्या AI वास्तव में जटिल, वास्तविक दुनिया के लिए तैयार है। यह हमें सिखाता है कि एक वास्तव में सहायक AI बनाने के लिए, हमें केवल यह पूछना बंद करना होगा कि "क्या आपने इसे ढूंढ लिया?" और यह पूछना शुरू करना होगा कि "क्या आपने गलत चीजों से परहेज किया? क्या आपने मेरे कहने के दूसरे तरीके को समझा? क्या आप एक साथ दो तस्वीरें संभाल सकते हैं?"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →