← नवीनतम पेपर
💻 computer science

TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval

यह शोध पत्र दो नए निर्देश-समृद्ध मल्टी-मॉडिफिकेशन डेटासेट्स (M-FashionIQ और M-CIRR) को पेश करके और TEMA का प्रस्ताव देकर कंपोज्ड इमेज रिट्रीवल में अपर्याप्त एंटिटी कवरेज और क्लॉज-एंटिटी मिसअलाइनमेंट की सीमाओं को संबोधित करता है, जो सटीकता और दक्षता के बीच संतुलन बनाते हुए सरल और जटिल मल्टी-मॉडिफिकेशन क्वेरीज़ को प्रभावी ढंग से संभालता है।

मूल लेखक: Zixu Li, Yupeng Hu, Zhiheng Fu, Zhiwei Chen, Yongqi Li, Liqiang Nie

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zixu Li, Yupeng Hu, Zhiheng Fu, Zhiwei Chen, Yongqi Li, Liqiang Nie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नया पहनावा (outfit) खरीदने जा रहे हैं, लेकिन आप बिल्कुल शुरुआत से नहीं करना चाहते। आपको एक ड्रेस पसंद आती है (रेफरेंस इमेज), लेकिन आप उसमें कुछ बदलाव करना चाहते हैं। आप अपने दोस्त से कहते हैं, "मुझे यह ड्रेस पसंद है, लेकिन इसकी आस्तीन (sleeves) लंबी कर दो और इसका रंग बदलकर लाल कर दो।"

यही कंपोज्ड इमेज रिट्रीवल (CIR) का मूल विचार है: एक तस्वीर और एक टेक्स्ट निर्देश का उपयोग करके एक नई तस्वीर खोजना।

हालाँकि, वर्तमान तकनीक एक ऐसे दोस्त की तरह है जो केवल आपके अनुरोध के सबसे स्पष्ट हिस्सों को ही सुनता है। यदि आप कहते हैं, "आस्तीन लंबी कर दो, एक बेल्ट जोड़ दो, जूते बदल दो और मॉडल पर एक टोपी लगा दो," तो पुराने सिस्टम अक्सर भ्रमित हो जाते हैं। वे शायद केवल आस्तीन को ही बदल पाएंगे और बाकी सब को अनदेखा कर देंगे, या वे इस बात में उलझ सकते हैं कि आप कपड़ों के किस हिस्से के बारे में बात कर रहे हैं।

यह शोध पत्र एक नया सिस्टम पेश करता है जिसे TEMA (टेक्स्ट-ओरिएंटेड एंटिटी मैपिंग आर्किटेक्चर) कहा जाता है और इन समस्याओं को ठीक करने के लिए डेटा का एक नया सेट भी। यहाँ इसे सरल शब्दों में समझाया गया है:

1. समस्या: "अतिभारित शेफ" (The Overwhelmed Chef)

कल्पना कीजिए कि आप एक शेफ (AI) हैं और एक ग्राहक आपको एक जटिल ऑर्डर देता है:

"इस स्टेक को लें, इसे मीडियम-रेयर ग्रिल करें, इसमें गार्लिक बटर डालें, रोज़मेरी छिड़कें, लकड़ी के बोर्ड पर परोसें, और साइड में फ्राइज़ की जगह सलाद रखें।"

पुराने AI सिस्टम एक ऐसे शेफ की तरह हैं जो लंबी सूची से घबरा जाता है। वे:

  • सामग्री भूल सकते हैं (अपर्याप्त एंटिटी कवरेज): वे स्टेक को ग्रिल तो करते हैं लेकिन लंबी सूची के कारण रोज़मेरी डालना भूल जाते हैं।
  • निर्देशों को मिला सकते हैं (क्लॉज-एंटिटी मिसअलाइनमेंट): वे सलाद पर गार्लिक बटर डाल देते हैं बजाय स्टेक के, या वे सोचते हैं कि "लकड़ी का बोर्ड" वाला निर्देश सलाद पर लागू होता है।

शोधकर्ताओं ने पाया कि मौजूदा AI मॉडल सरल अनुरोधों ("इसे लाल बना दो") के लिए बेहतरीन हैं, लेकिन कई विस्तृत बदलावों वाले अनुरोधों में बुरी तरह विफल हो जाते हैं।

2. समाधान: नए व्यंजन और एक स्मार्ट सहायक शेफ (Sous-Chef)

इसे ठीक करने के लिए, लेखकों ने दो मुख्य कार्य किए:

A. नए व्यंजन (डेटासेट्स)

उन्हें एहसास हुआ कि पुराना ट्रेनिंग डेटा बहुत सरल था। इसलिए, उन्होंने दो नए "कुकबुक" (डेटासेट्स जिन्हें M-FashionIQ और M-CIRR कहा जाता है) बनाए।

  • छोटे नोट्स जैसे "रंग बदलें" के बजाय, उन्होंने लंबे, विस्तृत "निर्देश मैनुअल" (जिन्हें मल्टी-मॉडिफिकेशन टेक्स्ट कहा जाता है) लिखे।
  • उन्होंने इन विस्तृत निर्देशों को लिखने के लिए एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग किया, और फिर मनुष्यों ने यह सुनिश्चित करने के लिए उनकी जांच की कि वे सटीक हैं।
  • उपमा: यह एक ऐसी रेसिपी से अपग्रेड करने जैसा है जो सिर्फ कहती है "केक बनाएं" से लेकर एक ऐसी रेसिपी तक जो कहती है "मैदा, चीनी और अंडे मिलाएं; 350°F पर 30 मिनट तक बेक करें; वैनिला से फ्रॉस्ट करें; स्प्रिंकल्स डालें।"

B. स्मार्ट सहायक शेफ (The TEMA Model)

उन्होंने TEMA नामक एक नया AI मॉडल बनाया। TEMA को एक मुख्य शेफ के रूप में सोचें जिसके पास दो विशेष उपकरण हैं:

  1. "समरी नोट" (पार्सिंग असिस्टेंट):
    शेफ के खाना बनाना शुरू करने से पहले, यह टूल लंबे, जटिल ऑर्डर को पढ़ता है और एक त्वरित "चीट शीट" एक स्टिकी नोट पर लिख देता है।

    • उदाहरण: "ऑर्डर: स्टेक + गार्लिक + रोज़मेरी + सलाद।"
    • यह सुनिश्चित करता है कि लंबी सूची पढ़ते समय शेफ कोई भी मुख्य सामग्री (एंटिटी) न भूले।
  2. "ग्रुपिंग स्टेशन" (एंटिटी मैपिंग):
    यह टूल निर्देशों को व्यवस्थित करता है। यदि ग्राहक कहता है, "स्टेक पर गार्लिक डालें" और "स्टेक पर रोज़मेरी डालें," तो यह टूल इन दोनों निर्देशों को एक साथ समूहबद्ध करता है ताकि वे दोनों स्टेक पर जाएं, न कि सलाद पर।

    • यह एक ट्रैफिक कंट्रोलर की तरह काम करता है, यह सुनिश्चित करता है कि प्रत्येक विशिष्ट निर्देश छवि के सही भाग पर जाए।

3. वास्तविक जीवन में यह कैसे काम करता है

जब आप TEMA का उपयोग करते हैं:

  1. आप एक फोटो अपलोड करते हैं (रेफरेंस)।
  2. आप एक लंबा, विस्तृत अनुरोध टाइप करते हैं (जैसे, "बैकग्राउंड को बीच में बदल दें, व्यक्ति को सनग्लासेस पहनाएं, और शर्ट को नीला कर दें")।
  3. TEMA इसे तोड़ देता है: यह मुख्य परिवर्तनों का एक सारांश बनाता है और निर्देशों को तार्किक रूप से समूहबद्ध करता है।
  4. यह खोज करता है: यह वह आदर्श छवि ढूंढता है जो उन सभी विशिष्ट विवरणों से मेल खाती है, न कि केवल मुख्य विवरणों से।

4. परिणाम

शोधकर्ताओं ने अन्य शीर्ष AI मॉडलों के मुकाबले TEMA का परीक्षण किया।

  • सरल कार्यों पर: TEMA मौजूदा सर्वश्रेष्ठ मॉडलों के समान ही अच्छा काम करता है।
  • जटिल कार्यों पर: TEMA एक स्पष्ट विजेता था। यह लंबी सूचियों से भ्रमित नहीं हुआ। इसने सफलतापूर्वक उन छवियों को खोजा जो उसके अनुरोध के हर एक विवरण से मेल खाती थीं।

सारांश

इस शोध पत्र को एक AI को एक जागरूक व्यक्तिगत खरीदारी सहायक (personal shopper) सिखाने के रूप में समझें, न कि एक विचलित होने वाले सहायक के रूप में। उसे बेहतर ट्रेनिंग डेटा (विस्तृत निर्देश) और उन निर्देशों को व्यवस्थित करने का एक स्मार्ट तरीका (समरी और ग्रुपिंग टूल्स) देकर, उन्होंने यह संभव बना दिया है कि वह बिल्कुल वही चीज़ ढूंढे जो आप चाहते हैं, भले ही आपका अनुरोध जटिल और विशिष्ट हो।

मुख्य बात: यदि आप एक ही बार में एक तस्वीर को पांच अलग-अलग तरीकों से बदलना चाहते हैं, तो पुराना AI शायद केवल एक ही बदल पाएगा। TEMA उन पांचों को ठीक उसी तरह बदलता है जैसा आपने मांगा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →