← नवीनतम पेपर
🤖 AI

UniRank: End-to-End Domain-Specific Reranking of Hybrid Text-Image Candidates

UniRank एक VLM-आधारित फ्रेमवर्क है जो बिना मोडैलिटी रूपांतरण के हाइब्रिड टेक्स्ट-इमेज उम्मीदवारों को मूल रूप से स्कोर करता है और डोमेन-विशिष्ट मल्टीमॉडल रीरैंकिंग कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए इंस्ट्रक्शन ट्यूनिंग और हार्ड-नेगेटिव-ड्रिवन RLHF वाले दो-चरणीय डोमेन अनुकूलन पाइपलाइन का उपयोग करता है।

मूल लेखक: Yupei Yang, Lin Yang, Wanxi Deng, Lin Qu, Shikui Tu, Lei Xu

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yupei Yang, Lin Yang, Wanxi Deng, Lin Qu, Shikui Tu, Lei Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइब्रेरियन हैं जो किसी ग्राहक के लिए एकदम सही किताब खोजने की कोशिश कर रहे हैं। ग्राहक आपको एक अस्पष्ट विवरण (क्वेरी/प्रश्न) देता है, और आपके पास हजारों संभावित मिलानों (कैंडिडेट्स/उम्मीदवारों) की एक शेल्फ है।

पुराने दिनों में, यदि कोई ग्राहक "बिल्ली की तस्वीर" मांगता, तो आपको बिल्लियों के वास्तविक टेक्स्ट विवरण वाली सभी किताबों को अनदेखा करना पड़ता और केवल उन किताबों को देखना पड़ता जिनमें टेक्स्ट विवरण हो। या, यदि आप तस्वीरों को देखने का प्रयास करते, तो आपको पहले हर एक तस्वीर को शब्दों में वर्णित करना पड़ता, जिसमें बहुत समय लगता और अक्सर मुख्य बात छूट जाती।

UniRank एक नया, सुपर-स्मार्ट लाइब्रेरियन सहायक है जिसे ठीक इसी समस्या को हल करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

समस्या: टेक्स्ट और इमेज के बीच "भाषा की बाधा"

पारंपरिक खोज इंजन (सर्च इंजन) शब्दों को शब्दों से मिलाने में माहिर होते हैं। लेकिन जब आप एक ही ढेर में टेक्स्ट (जैसे पेटेंट विवरण) और इमेज (जैसे डिज़ाइन स्केच) को मिलाते हैं, तो चीजें गड़बड़ा जाती हैं।

  • पुराना तरीका: टेक्स्ट को इमेज के साथ तुलना करने के लिए, पुराने सिस्टम इमेज को टेक्स्ट में बदलने के लिए मजबूर करते थे (जैसे उसके लिए कैप्शन लिखना)। यह एक सेब की तुलना सेब के विवरण से करने जैसा है; आप फल का वास्तविक स्वाद और बनावट खो देते हैं। यह धीमा भी है और इसमें बहुत अधिक स्टोरेज स्पेस की आवश्यकता होती है।
  • अंतराल (द गैप): टेक्स्ट-ओनली दिमाग स्वाभाविक रूप से तस्वीरों को देखने की तुलना में टेक्स्ट पढ़ने में बेहतर होता है। इससे एक पक्षपात पैदा होता है जहाँ सिस्टम एक सटीक तस्वीर की तुलना में टेक्स्ट वाले उत्तर को उच्च रैंक दे सकता है क्योंकि वह उसी "भाषा" में बोल रहा है।

समाधान: UniRank (यूनिवर्सल लाइब्रेरियन)

UniRank एक विज़न-लैंग्वेज मॉडल (VLM) पर आधारित एक सिस्टम है। एक VLM को एक ऐसे मस्तिष्क के रूप में समझें जिसने एक साथ देखना और पढ़ना सीखा है। UniRank इमेज को टेक्स्ट में बदलने या टेक्स्ट को इमेज में बदलने के लिए मजबूर नहीं करता है। यह दोनों को उनके मूल रूप में, अगल-बगल देखता है।

यहाँ वह स्टेप-बाय-स्टेप प्रक्रिया दी गई है जिसका उपयोग UniRank किसी विशिष्ट क्षेत्र (जैसे वैज्ञानिक शोध या उत्पाद डिज़ाइन) में विशेषज्ञ बनने के लिए करता है:

स्टेप 1: "इंस्ट्रक्शन" ट्रेनिंग (नियम सीखना)

सबसे पहले, UniRank को उस विशेष काम की भाषा का क्रैश कोर्स दिया जाता है।

  • उपमा: कल्पना कीजिए कि आपने एक स्मार्ट इंटर्न को काम पर रखा है जो पढ़ और देख सकता है, लेकिन उसे नहीं पता कि एक "अच्छा" वैज्ञानिक पेपर कैसा दिखता है। आप उसे उदाहरणों का एक ढेर देते हैं: "यह एक प्रश्न है, यह एक दस्तावेज़ है। क्या यह एक मैच है? 'हाँ' या 'ना' कहें।"
  • परिणाम: इंटर्न एक सरल "हाँ" या "ना" का निर्णय लेना सीख जाता है। लेकिन केवल शब्द बोलने के बजाय, सिस्टम यह देखता है कि इंटर्न उस "हाँ" या "ना" में कितना आत्मविश्वासी है। यह कॉन्फिडेंस स्कोर रैंकिंग नंबर बन जाता है। यह सिस्टम को एक टेक्स्ट दस्तावेज़ और एक इमेज दस्तावेज़ को एक ही पैमाने पर स्कोर करने की अनुमति देता है बिना एक को दूसरे में बदले।

स्टेप 2: "हार्ड नेगेटिव" की खोज (गलतियों से सीखना)

एक बार जब इंटर्न बुनियादी बातें जान जाता है, तो वह कठिन मामलों में गलतियाँ करना शुरू करता है। वह किसी अप्रासंगिक इमेज को "हाँ" मान सकता है क्योंकि वह दिखने में समान है, या वह एक सूक्ष्म संबंध को मिस कर सकता है।

  • उपमा: बॉस (सिस्टम) इंटर्न के काम को देखता है और उन मामलों को ढूंढता है जहाँ इंटर्न लगभग सही था लेकिन गलत निकला। इन्हें "हार्ड नेगेटिव्स" कहा जाता है।
  • कार्रवाई: सिस्टम एक ट्रेनिंग गेम बनाता है: "यहाँ एक ट्रिकी इमेज है जो मैच जैसी दिखती है लेकिन है नहीं। यहाँ असली मैच है। आपको किसे चुनना चाहिए?" यह सिस्टम को उस विशिष्ट क्षेत्र में काम आने वाले सूक्ष्म अंतरों को सीखने के लिए मजबूर करता है।

स्टेप 3: "रिवॉर्ड" गेम (रीइन्फोर्समेंट लर्निंग के साथ फाइन-ट्यूनिंग)

अंत में, सिस्टम "बेहतर बनाम बदतर" का खेल खेलता है।

  • उपमा: कल्पना कीजिए कि एक कोच इंटर्न को दो उम्मीदवारों के बीच चयन करते हुए देख रहा है। यदि इंटर्न बेहतर वाला चुनता है, तो उसे "रिवॉर्ड पॉइंट" मिलते हैं। यदि वह बदतर वाला चुनता है, तो उसे कोई अंक नहीं मिलते। सिस्टम इन पॉइंट्स का उपयोग अपने मस्तिष्क को एडजस्ट करने के लिए करता है, यह सीखने के लिए कि लगातार विजेता को चुनने में कैसे बेहतर होना है, भले ही विकल्प बहुत करीब क्यों न हों।
  • ट्विस्ट: UniRank इस गेम को खेलने के तरीके के बारे में स्मार्ट है। एक प्रश्न के लिए केवल एक विजेता चुनने के बजाय, यह एक ही प्रश्न के लिए पूरे कैंडिडेट लिस्ट को एक साथ देखता है। यह पूछता है, "इस विशिष्ट प्रश्न को देखते हुए, क्या कैंडिडेट A को कैंडिडेट B से उच्च रैंक दिया जाना चाहिए?" यह सुनिश्चित करता है कि अंतिम सूची पूरी तरह से व्यवस्थित हो, न कि केवल व्यक्तिगत "हाँ/ना" उत्तरों का संग्रह।

यह एक बड़ी बात क्यों है?

पेपर ने वास्तविक दुनिया के दो परिदृश्यों में UniRank का परीक्षण किया:

  1. वैज्ञानिक साहित्य (Scientific Literature): सही शोध पत्र खोजना (जिसमें अक्सर जटिल चार्ट और टेक्स्ट मिश्रित होते हैं)।
  2. डिज़ाइन पेटेंट (Design Patents): उन उत्पाद डिज़ाइनों को खोजना जो दिखने में समान हैं (जहाँ टेक्स्ट विवरण से अधिक विजुअल शेप मायने रखता है)।

परिणाम:

  • बेहतर सटीकता: UniRank ने मौजूदा सर्वोत्तम टूल्स की तुलना में बहुत अधिक बार सही उत्तर खोजे (विज्ञान में शीर्ष परिणाम में लगभग 9% और पेटेंट में 7% का सुधार)।
  • तेज़ और सस्ता: क्योंकि इसे हर इमेज को लंबे टेक्स्ट विवरण में बदलने की आवश्यकता नहीं है, यह कंप्यूटर स्टोरेज का बहुत सारा हिस्सा बचाता है और बहुत तेज़ी से चलता है। यह सीधे मेनू पढ़ने जैसा है, बजाय इसके कि आप ऑर्डर करने से पहले हर व्यंजन का अनुवाद सुनने के लिए एक ट्रांसलेटर का इंतज़ार करें।

सारांश

UniRank एक विशेष खोज उपकरण है जो टेक्स्ट और इमेज को समान मानता है। यह एक विशिष्ट कार्य को सीखता है: पहले नियमों को समझना, फिर अपनी सबसे कठिन गलतियों पर अभ्यास करना, और अंत में अपनी सूची को पूर्ण बनाने के लिए एक रैंकिंग गेम खेलना। यह तेज़ है, अधिक सटीक है, और अपना काम करने के लिए छवियों को शब्दों में अनुवाद करने की आवश्यकता नहीं रखता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →