← नवीनतम पेपर
💻 computer science

CIRCLED: A Multi-turn CIR Dataset with Consistent Dialogues across Domains

यह शोध पत्र CIRCLED को प्रस्तुत करता है, जो नौ डोमेन में फैला एक बड़े पैमाने का, उच्च-गुणवत्ता वाला मल्टी-टर्न कंपोज्ड इमेज रिट्रीवल (MTCIR) डेटासेट है, जो संवाद निरंतरता सुनिश्चित करके और भविष्य के अनुसंधान के लिए एक सुदृढ़ बेंचमार्क प्रदान करके फैशन-सीमित मौजूदा डेटासेट्स की सीमाओं को संबोधित करता है।

मूल लेखक: Tomohisa Takeda, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

प्रकाशित 2026-05-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tomohisa Takeda, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अनंत डिपार्टमेंट स्टोर में एक विशिष्ट पोशाक (outfit) खोजने की कोशिश कर रहे हैं, लेकिन आप उसे एक वाक्य में पूरी तरह से वर्णित नहीं कर सकते। आप जानते हैं कि आपको एक "लाल ड्रेस" चाहिए, लेकिन जब आप परिणाम देखते हैं, तो आप सोचते हैं, "नहीं, यह बहुत चमकीली है। मुझे यह और गहरी चाहिए, लंबी आस्तीन वाली, और शायद एक बेल्ट के साथ।"

कंप्यूटर विज्ञान की दुनिया में, इसे Multi-Turn Composed Image Retrieval (CIR) कहा जाता है। यह एक ऐसा सिस्टम है जहाँ आप एक तस्वीर और एक टेक्स्ट विवरण के साथ शुरुआत करते हैं, और फिर आप ठीक वही चीज़ खोजने के लिए बारी-बारी से (turn by turn) खोज को परिष्कृत (refine) करते रहते हैं जब तक कि आपको वह मिल न जाए जिसे आप चाहते हैं।

यह पेपर एक नया टूल पेश करता है जिसे CIRCLED कहा जाता है ताकि शोधकर्ता इस तरह की खोज के बेहतर सिस्टम बनाने में मदद कर सकें। यहाँ बताया गया है कि उन्होंने क्या किया है, सरल उपमाओं (analogies) का उपयोग करते हुए।

समस्या: "टूटा हुआ नक्शा" (The "Broken Map")

इस पेपर से पहले, शोधकर्ताओं के पास एक डेटासेट (अभ्यास समस्याओं का संग्रह) था जिसे Multi-turn FashionIQ कहा जाता था। लेकिन लेखक कहते हैं कि पुराना डेटासेट एक टूटे हुए नक्शे की तरह था।

  • समस्या: पुराने डेटासेट में, उत्तर खोजने के चरण हमेशा तर्कसंगत नहीं होते थे। कल्पना कीजिए कि आप एक "काली ड्रेस" की तलाश कर रहे हैं।
    • टर्न 1: आप "लाल ड्रेस" मांगते हैं।
    • टर्न 2: सिस्टम आपको एक "रंगीन पार्टी ड्रेस" दिखाता है।
    • टर्न 3: आप "काली ड्रेस" मांगते हैं।
    • गड़बड़ी (The Glitch): पुराने डेटासेट में कभी-कभी ऐसे चरण शामिल होते थे जहाँ खोज वास्तव में लक्ष्य से दूर हो जाती थी, या निर्देश दोहराव वाले निरर्थक होते थे (जैसे कि तीन बार लगातार "इसे लाल बनाओ" कहना)। यह एक ऐसे GPS की तरह था जो आपको उत्तर की ओर जाने के लिए कहता है, फिर दक्षिण की ओर, फिर उत्तर की ओर, बिना आपको कभी आपके गंतव्य के करीब लाए।
  • सीमा: पुराने डेटासेट में केवल कपड़े (फैशन) थे। इसने यह परीक्षण नहीं किया कि क्या सिस्टम एक कुत्ता, कार या लैंडस्केप खोज सकता है।

समाधान: CIRCLED (एक "परफेक्ट कम्पास")

लेखकों ने CIRCLED बनाया है, जो एक नया डेटासेट है जो एक परफेक्ट कम्पास की तरह काम करता है।

  1. निरंतर प्रगति (Consistent Progress): CIRCLED में, बातचीत का हर एक चरण आपको लक्ष्य के करीब ले जाता है। यदि लक्ष्य एक "काली ड्रेस" है, तो हर टर्न आपको काली ड्रेस के थोड़ा और करीब लाता है, कभी भटकता नहीं है।
  2. नई जानकारी (New Information): हर बार जब आप बोलते हैं, तो आप कुछ नया जोड़ते हैं। आप खुद को दोहराते नहीं हैं। यह एक जासूस द्वारा सुराग इकट्ठा करने जैसा है: "पहले, यह एक कुत्ता है। दूसरा, यह एक गोल्डन रिट्रीवर है। तीसरा, इसने लाल कॉलर पहना है।" प्रत्येक सुराग मूल्य जोड़ता है।
  3. व्यापक क्षितिज (Broader Horizons): वे केवल कपड़ों तक सीमित नहीं रहे। उन्होंने सामान्य वस्तुओं (जैसे CIRR और CIRCO डेटासेट में दी गई वस्तुएं) को शामिल करने के लिए डेटासेट का विस्तार किया, ताकि सिस्टम किसी भी चीज़ को खोजने के लिए सीख सके, न कि केवल फैशन।

उन्होंने इसे कैसे बनाया: "रोबोट शॉप असिस्टेंट" (The "Robot Shop Assistant")

इस डेटासेट को बनाने के लिए, उन्होंने केवल मनुष्यों से यादृच्छिक (random) बातचीत लिखने के लिए नहीं कहा। उन्होंने एक स्मार्ट, स्वचालित पाइपलाइन का उपयोग किया:

  1. शुरुआती बिंदु: उन्होंने मौजूदा सिंगल-टर्न खोजों (एक चित्र + एक टेक्स्ट) को लिया।
  2. सिमुलेशन (The Simulation): उन्होंने एक शक्तिशाली AI (एक LLM) का उपयोग किया जो एक "शॉप असिस्टेंट" के रूप में कार्य करता है।
    • AI खोज परिणामों को देखता है।
    • यदि सटीक वस्तु सबसे ऊपर नहीं है, तो AI उस "निकटतम वस्तु" को चुनता है जो उसे मिली है।
    • AI फिर उस "निकटतम वस्तु" को "परफेक्ट आइटम" में बदलने के लिए एक नया निर्देश लिखता है।
    • उदाहरण: "ड्रेस लाल है, लेकिन मुझे इसे काला चाहिए। साथ ही, एक बेल्ट जोड़ें।"
  3. गुणवत्ता नियंत्रण (The Filters): गुणवत्ता सुनिश्चित करने के लिए उन्होंने बातचीत को चार सख्त फिल्टरों से गुजारा:
    • सफलता फ़िल्टर (Success Filter): क्या खोज अंततः उस वस्तु को ढूंढ पाई? यदि नहीं, तो उसे हटा दें।
    • मल्टी-टर्न फ़िल्टर (Multi-turn Filter): क्या इसमें वास्तव में एक से अधिक चरण लगे? यदि उत्तर तुरंत मिल गया, तो यह "मल्टी-टर्न" बातचीत नहीं है, इसलिए इसे हटा दें।
    • रैंक-निरंतरता फ़िल्टर (Rank-Consistency Filter): क्या बीच में खोज परिणाम खराब हो गए? यदि "परफेक्ट आइटम" बीच की बातचीत में शीर्ष 10 सूची से गायब हो गया, तो बातचीत टूटी हुई है। इसे हटा दें।
    • नो-रिपीट फ़िल्टर (No-Repeat Filter): क्या AI ने केवल उन्हीं शब्दों को दोहराया? यदि नया निर्देश पुराने निर्देश के बहुत समान था, तो उसे हटा दें।

परिणाम: एक विशाल, उच्च-गुणवत्ता वाला खेल का मैदान (A Massive, High-Quality Playground)

अंतिम परिणाम के रूप में उनके पास 22,608 बातचीत (सेशन्स) का एक डेटासेट है।

  • यह पिछले सर्वश्रेष्ठ डेटासेट से लगभग दोगुना बड़ा है।
  • इसमें 200,000 से अधिक चित्र शामिल हैं।
  • यह फैशन (ड्रेस, शर्ट) और सामान्य वस्तुओं (जानवर, वस्तुएं) को कवर करता है।
  • बातचीत 2 से 6 टर्न तक फैली हुई है, और औसत लगभग 2.5 टर्न है।

यह क्यों मायने रखता है

लेखकों ने इस नए डेटासेट पर कई मौजूदा AI विधियों का परीक्षण किया। उन्होंने पाया कि:

  • टेक्स्ट ही सर्वोपरि है (Text is King): इन मल्टी-टर्न बातचीत में, आपके द्वारा दिए गए टेक्स्ट निर्देश संदर्भ चित्रों की तुलना में बहुत अधिक महत्वपूर्ण होते हैं।
  • प्रगतिशील सीखना (Progressive Learning): सबसे अच्छे सिस्टम वे होते हैं जो पूरी बातचीत के इतिहास को याद रख सकते हैं, न कि केवल आपकी आखिरी बात को।
  • एक नया मानक (A New Standard): क्योंकि CIRCLED सुसंगत और उच्च गुणवत्ता वाला है, यह शोधकर्ताओं को यह परीक्षण करने का एक निष्पक्ष तरीका देता है कि क्या उनके नए "सर्च रोबोट" वास्तव में स्मार्ट हो रहे हैं या केवल अनुमान लगा रहे हैं।

संक्षेप में, CIRCLED एक नया, उच्च-गुणवत्ता वाला प्रशिक्षण मैदान है जो यह सुनिश्चित करता है कि AI ठीक वही चीज़ खोजने के लिए एक तार्किक, चरण-दर-चरण बातचीत करना सीखे जिसे आप ढूंढ रहे हैं, बिना भ्रमित हुए या खुद को दोहराए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →