← नवीनतम पेपर
💻 computer science

FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval

FlowCIR एक गणनात्मक रूप से कुशल ज़ीरो-शॉट कंपोज़्ड इमेज रिट्रीवल फ्रेमवर्क पेश करता है जो टेक्स्टुअल इनवर्जन के बिना संदर्भ और लक्ष्य एम्बेडिंग्स के बीच सिमेंटिक ट्रांसपोर्ट करने के लिए कंडीशनल फ्लो मैचिंग का लाभ उठाता है, जबकि साथ ही नकारात्मकता-प्रधान (negation-heavy) क्वेरीज़ को मजबूती से संभालने के लिए एक मल्टी-नेगेटिव स्टीयरिंग रणनीति का उपयोग भी करता है।

मूल लेखक: Zhenqi He, Ziqi Jiang, Yuanpei Liu, Yanghao Wang, Teng Wang, Long Chen

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenqi He, Ziqi Jiang, Yuanpei Liu, Yanghao Wang, Teng Wang, Long Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पुस्तकालय में एक विशिष्ट फोटो खोज रहे हैं, लेकिन आप उस फोटो का वर्णन शून्य से नहीं कर सकते। इसके बजाय, आपके पास एक संदर्भ फोटो (जैसे कि एक कुत्ते की तस्वीर) और एक टेक्स्ट निर्देश (जैसे "कुत्ते को आकाश की ओर देखते हुए दिखाएं") है। आपका लक्ष्य उस सटीक फोटो को खोजना है जो आपके संदर्भ फोटो के साथ आपके टेक्स्ट बदलाव को लागू करने के बाद मेल खाती हो। इसे कंपोज्ड इमेज रिट्रीवल (Composed Image Retrieval) कहा जाता है।

यह काम बिना किसी पूर्व प्रशिक्षण के (Zero-Shot) करना अविश्वसनीय रूप से कठिन है। पिछले तरीकों ने यह कोशिश की कि संदर्भ फोटो को कुछ "नकली शब्दों" में बदल दिया जाए और फिर उन शब्दों को आपके निर्देश के बगल में बस चिपका दिया जाए। इसे ऐसे समझें जैसे कि आप केवल तीन स्टिकी नोट्स का उपयोग करके एक जटिल पेंटिंग का वर्णन करने की कोशिश कर रहे हैं; इसमें आप अनिवार्य रूप से बारीक विवरण खो देते हैं, और परिणाम अक्सर एक गड़बड़ी जैसा होता है।

FlowCIR एक नया तरीका है जो खेल बदल देता है। यह कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग करके समझाया गया है:

1. पुराना तरीका बनाम नया तरीका

  • पुराना तरीका (Textual Inversion): कल्पना कीजिए कि आपके पास एक लाल कार की फोटो है। इसे कंप्यूटर को बताने के लिए, आप पूरी इमेज को "red-car-token" जैसे एक एकल शब्द में कंप्रेस करने की कोशिश करते हैं। फिर आप अपना निर्देश जोड़ते हैं, "इसे नीला बना दें।" कंप्यूटर इन दोनों टोकन को आपस में मिलाने की कोशिश करता है। यह रंगों के नाम चिल्लाकर पेंट मिलाने जैसा है; परिणाम अक्सर धुंधला और गलत होता है।
  • नया तरीका (Flow Matching): FlowCIR इसे नेविगेशन (मार्गदर्शन) की तरह मानता है। निर्देश को केवल एक शब्द में कंप्रेस करने के बजाय, यह निर्देश को एक मानचित्र पर एक शुरुआती बिंदु के रूप में और लक्षित फोटो को एक गंतव्य के रूप में मानता है। यह एक "प्रवाह" या "हवा" (flow field) सीखता है जो निर्देश को उसके शुरुआती बिंदु से सीधे सही लक्षित फोटो की ओर धीरे से धकेलता है, जबकि संदर्भ फोटो (लाल कार) को एक मार्गदर्शक के रूप में ध्यान में रखता है। यह एक सुचारू, निरंतर यात्रा है न कि एक अनाड़ी छलांग।

2. यह इतना तेज़ और कुशल क्यों है

अधिकांश पिछले तरीकों के लिए विशिष्ट उदाहरणों को सीखने के लिए विशाल कंप्यूटर और कई दिनों के प्रशिक्षण की आवश्यकता होती थी।

  • FlowCIR का रहस्य: यह उस विशाल मस्तिष्क (AI मॉडल) को फिर से प्रशिक्षित नहीं करता है जो छवियों और टेक्स्ट को समझता है। यह केवल एक छोटा, हल्का "नेविविगेटर" मॉड्यूल प्रशिक्षित करता है।
  • उपमा: कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट लाइब्रेरियन है जो पहले से ही पूरे पुस्तकालय को जानता है। उसे एक नई भाषा सिखाने के बजाय, आप बस एक छोटा, कुशल सहायक नियुक्त करते हैं जिसे पता है कि आपके अनुरोध के आधार पर किस गलियारे में चलना है। यह FlowCIR को एक मानक कंप्यूटर पर एक घंटे से भी कम समय में प्रशिक्षित करने की अनुमति देता है, जबकि अन्य तरीकों को सुपरकंप्यूटरों पर कई दिन लग सकते हैं।

3. "निषेध" की समस्या (The "No" Trap)

AI मॉडल अक्सर भ्रमित हो जाते हैं जब आप "नहीं" या "हटाएं" कहते हैं। यदि आप कहते हैं "कुत्ते को हटा दें," तो AI कुत्ते के बारे में सोचकर ही अटक सकता है, क्योंकि AI के मन में "कुत्ता" और "कोई कुत्ता नहीं" अक्सर बहुत करीब होते हैं।

  • समाधान (Multi-Negative Steering): FlowCIR के पास इसके लिए एक विशेष ट्रिक है। जब यह "कुत्ते को हटा दें" सुनता है, तो यह केवल सुनता नहीं है; यह मानसिक मानचित्र में "कुत्ते" के विचार को सक्रिय रूप से दूर धकेलता है।
  • उपमा: कल्पना कीजिए कि आप एक तेज़ शोर से दूर जाने की कोशिश कर रहे हैं। केवल आगे बढ़ने के बजाय, आप सक्रिय रूप से विपरीत दिशा में कदम उठाते हैं ताकि आप सुनिश्चित कर सकें कि आप उससे पर्याप्त दूर आ गए हैं। FlowCIR गणितीय रूप से ऐसा करता है, खोज को उन चीजों से दूर ले जाता है जिन्हें आप नहीं चाहते, जिससे यह "कोई धारियां नहीं" या "टोपी के बिना" जैसे निर्देशों को संभालने में बहुत बेहतर हो जाता है।

4. परिणाम

लेखकों ने मानक फोटो-खोज चुनौतियों पर FlowCIR का परीक्षण किया।

  • प्रदर्शन: इसने लगभग सभी अन्य हालिया तरीकों से बेहतर तरीके से सही फोटो ढूंढी।
  • दक्षता: इसने अपने प्रतिस्पर्धियों की तुलना में बहुत कम कंप्यूटिंग शक्ति और समय का उपयोग करते हुए यह उपलब्धि हासिल की।
  • मजबूती (Robustness): इसने पिछले सिस्टमों की तुलना में कठिन निर्देशों (जैसे वस्तुओं को हटाना) को बहुत बेहतर तरीके से संभाला।

संक्षेप में: FlowCIR एक "पहले की फोटो" और "बदलाव निर्देश" के आधार पर फोटो खोजने का एक स्मार्ट, तेज़ और अधिक कुशल तरीका है। शब्दों को बेतरतीब ढंग से आपस में टकराने के बजाय, यह दुनिया की समझ के माध्यम से सहजता से नेविगेट करता है ताकि ठीक वही छवि मिल सके जिसे आप खोज रहे हैं, भले ही आपने चीजों को हटाने के लिए कहा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →