← नवीनतम पेपर
💻 computer science

MuRF: Unlocking the Multi-Scale Potential of Vision Foundation Models

यह शोधपत्र MuRF को प्रस्तुत करता है, जो एक सार्वभौमिक और प्रशिक्षण-मुक्त अनुमान रणनीति है जो विभिन्न कंप्यूटर विज़न कार्यों में पूरक वैश्विक और सूक्ष्म-स्तरीय सेमेंटिक जानकारी का लाभ उठाने के लिए कई इमेज रिज़ॉल्यूशन के फीचर्स को फ्यूज करके विजन फाउंडेशन मॉडल्स को उन्नत करती है।

मूल लेखक: Bocheng Zou, Mu Cai, Mark Stanley, Dingfu Lu, Yong Jae Lee

प्रकाशित 2026-03-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bocheng Zou, Mu Cai, Mark Stanley, Dingfu Lu, Yong Jae Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पेंटिंग देख रहे हैं, जैसे कि एक हलचल भरी शहर की सड़क।

यदि आप दूर से (लो रेजोल्यूशन) देखते हैं, तो आपको एक बड़ी तस्वीर का शानदार अहसास होता है: आप सड़कों के लेआउट, ट्रैफिक के प्रवाह और दृश्य के समग्र मूड को देखते हैं। लेकिन यदि आप किसी सड़क के साइन को पढ़ने या किसी व्यक्ति के चेहरे के भाव देखने की कोशिश करते हैं, तो वह केवल एक धुंधला धब्बा बनकर रह जाता है।

यदि आप बिल्कुल करीब (हाई रेजोल्यूशन) खड़े होते हैं, तो आप साइन पर हर अक्षर पढ़ सकते हैं और ईंटों की बनावट देख सकते हैं। लेकिन अब, आपने संदर्भ (context) खो दिया है। आप यह नहीं बता पाएंगे कि वह व्यक्ति सड़क पार कर रहा है या बालकनी पर खड़ा है क्योंकि आप पूरी इमारत को नहीं देख पा रहे हैं।

वर्षों से, कंप्यूटर विज़न मॉडल (AI की "आंखें") को एक चुनाव करने के लिए मजबूर किया गया है: या तो दूर से देखें या करीब से देखें। उन्हें इमेज को प्रोसेस करने के लिए एक ही "स्वीट स्पॉट" साइज चुनना पड़ता था। यदि उन्होंने गलत साइज चुना, तो वे या तो बड़ी तस्वीर चूक जाते थे या बारीक विवरण।

पेश है MuRF (मल्टी-रेजोल्यूशन फ्यूजन)।

MuRF को केवल एक नया चश्मा न समझें, बल्कि इसे एक ही केस पर काम करने वाली एक शक्तिशाली टीम के जासूसों के रूप में देखें।

समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) का जाल

वर्तमान AI मॉडल एक ऐसे जासूस की तरह हैं जिसके पास केवल एक आवर्धक लेंस (magnifying glass) है।

  • यदि वे कम शक्ति वाले लेंस का उपयोग करते हैं, तो वे अपराध स्थल को पूरा देखते हैं लेकिन उंगलियों के निशान (fingerprints) मिस कर देते हैं।
  • यदि वे उच्च शक्ति वाले लेंस का उपयोग करते हैं, तो वे उंगलियों के निशान तो पूरी तरह देख लेते हैं, लेकिन यह मिस कर देते हैं कि अपराध पार्क में नहीं, बल्कि एक बैंक में हुआ था।

पेपर का तर्क है कि हमने AI को केवल एक लेंस चुनने के लिए मजबूर करके उसकी क्षमता को बर्बाद किया है।

समाधान: "सर्वव्यापी" टीम

MuRF एक स्मार्ट तरीका है जो AI को एक ही समय में कई लेंसों का उपयोग करने की अनुमति देता है।

यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:

  1. सेटअप: कल्पना कीजिए कि आपके पास एक जमा हुआ (frozen), सुपर-स्मार्ट AI दिमाग है (जिसे "विज़न फाउंडेशन मॉडल" कहा जाता है, जैसे DINOv2)। इसने पहले से ही दुनिया को देखना सीख लिया है, लेकिन यह एक रूटीन में फंसा हुआ है जहाँ यह छवियों को एक समय में केवल एक ही साइज में देखता है।
  2. ट्रिक: इमेज को केवल एक वर्जन में फीड करने के बजाय, MuRF उसी फोटो को तीन अलग-अलग साइज में छोटा कर देता है (जैसे ज़ूम आउट करना, नॉर्मल व्यू, और ज़ूम इन करना)।
  3. टीमवर्क: यह तीनों साइज को AI दिमाग में एक साथ फीड करता है।
    • छोटा वर्जन AI को बताता है: "हे, वह एक पूरी कार है!" (ग्लोबल कॉन्टेक्स्ट)।
    • बड़ा वर्जन AI को बताता है: "और यहाँ बंपर पर एक खरोंच है!" (फाइन डिटेल्स)।
  4. फ्यूजन (संलयन): MuRF इन तीनों दृश्यों से प्राप्त "नोट्स" को लेता है और उन्हें एक विशाल, परफेक्ट रिपोर्ट में जोड़ देता है। यह AI के दिमाग को नहीं बदलता है; यह बस दिमाग को काम करने के लिए बेहतर नोट्स प्रदान करता है।

यह एक बड़ी बात क्यों है (द "मैजिक" पार्ट)

पेपर दिखाता है कि यह सरल ट्रिक बिना AI को फिर से ट्रेन किए (जो आमतौर पर महंगा और धीमा होता है) कई अलग-अलग कार्यों में जादू की तरह काम करती है।

  • "वस्तुओं को खोजने" के लिए (सेगमेंटेशन):
    कल्पना कीजिए कि आप एक फोटो में बिल्ली की रूपरेखा खींचने की कोशिश कर रहे हैं।

    • पुराना तरीका: यदि आप ज़ूम आउट करते हैं, तो आप एक ऐसा धब्बा बनाते हैं जिसमें वह कुर्सी भी शामिल हो जाती है जिस पर बिल्ली बैठी है। यदि आप ज़ूम इन करते हैं, तो आप बिल्ली के कान की एक सटीक रूपरेखा बनाते हैं, लेकिन पूंछ को मिस कर देते हैं क्योंकि वह फ्रेम से बाहर है।
    • MuRF का तरीका: यह "धब्बे" वाले व्यू को "कान" वाले व्यू के साथ जोड़ता है। परिणाम? पूरी बिल्ली की एक परफेक्ट रूपरेखा, जिसमें कुर्सी पर बैठी हुई उसकी पूंछ भी शामिल है।
  • "AI के साथ बातचीत करने" के लिए (मल्टीमॉडल अंडरस्टैंडिंग):
    कल्पना कीजिए कि आप AI से पूछते हैं, "लाल शर्ट पहने व्यक्ति क्या कर रहा है?"

    • पुराना तरीका: AI लाल शर्ट देख सकता है (क्लोज अप) लेकिन यह मिस कर सकता है कि वह व्यक्ति वास्तव में सर्फ़बोर्ड पकड़े हुए है (दूर से)।
    • MuRF का तरीका: AI शर्ट और सर्फ़बोर्ड दोनों को एक साथ देखता है। वह जवाब दे सकता है, "व्यक्ति सर्फिंग कर रहा है," क्योंकि उसके पास पूरा संदर्भ है।
  • "दोषों को पहचानने" के लिए (एनोमली डिटेक्शन):
    कल्पना कीजिए कि एक फैक्ट्री इंस्पेक्टर धातु के पुर्जे पर खरोंच ढूंढ रहा है।

    • पुराना तरीका: एक छोटी सी खरोंच ज़ूम आउट करने पर अदृश्य हो सकती है। एक बड़ा डेंट ज़ूम इन करने पर शोर (noise) जैसा लग सकता है।
    • MuRF का तरीका: यह "वाइड व्यू" से बड़े डेंट को पहचानता है और "क्लोज व्यू" से छोटी खरोंच को, और उन्हें एक परफेक्ट निरीक्षण रिपोर्ट में मिला देता है।

निचोड़ (The Bottom Line)

MuRF एक अंधे व्यक्ति को एक साथ दूरबीन, माइक्रोस्कोप और वाइड-एंगल कैमरा देने जैसा है, और फिर उन्हें अपने दिमाग में उन छवियों को मिलाने देने जैसा है।

यह साबित करता है कि हमें AI को स्मार्ट बनाने के लिए बड़े, अधिक जटिल AI दिमाग बनाने की आवश्यकता नहीं है। हमें बस उन्हें एक ही समय में अलग-अलग दूरियों से दुनिया को देखना सिखाने की आवश्यकता है। यह एक सरल, यूनिवर्सल अपग्रेड है जो मौजूदा AI मॉडल्स को लगभग हर काम में काफी बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →