← नवीनतम पेपर
💻 computer science

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

यह शोधपत्र DetPO का प्रस्ताव करता है, जो एक ग्रेडिएंट-मुक्त, ब्लैक-बॉक्स टेस्ट-टाइम ऑप्टिमाइज़ेशन विधि है, जो विज़ुअल ट्रेनिंग उदाहरणों का लाभ उठाकर सामान्यीकरण की सीमाओं को दूर करने के लिए केवल टेक्स्ट-आधारित प्रॉम्प्ट्स को परिष्कृत करती है ताकि मल्टी-मोडल एलएलएम (Multi-Modal LLMs) में फ्यू-शॉट ऑब्जेक्ट डिटेक्शन प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

प्रकाशित 2026-03-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक जीनियस को नई चीजें सिखाना

कल्पना कीजिए कि आपके पास एक शानदार, विश्व-स्तरीय कला समीक्षक (Multi-Modal LLM) है जिसने लाखों पेंटिंग्स देखी हैं। वे तुरंत पहचान सकते हैं कि "कुत्ता," "कार," या "पेड़" क्या है क्योंकि उन्होंने इन्हें हर जगह देखा है।

हालाँकि, यदि आप उन्हें एक दुर्लभ, चमकते हुए मशरूम की तस्वीर दिखाते हैं जिसे उन्होंने पहले कभी नहीं देखा, या किसी कारखाने में एक दोषपूर्ण मछली की प्लेट दिखाते हैं, तो वे भ्रमित हो जाते हैं। वे कह सकते हैं, "मुझे नहीं पता कि यह क्या है," या इससे भी बुरा, वे गलत अंदाज़ा लगा सकते हैं और कह सकते हैं, "यह एक कुत्ता है!"

शोधकर्ताओं ने इस जीनियस को कुछ उदाहरणों (जैसे कि मशरूम की 5 तस्वीरें दिखाने) का उपयोग करके इन नई, अजीब चीजों को पहचानने के लिए सिखाना चाहा। लेकिन वे एक दीवार से टकरा गए: केवल तस्वीरें दिखाना ठीक से काम नहीं कर रहा था। AI बहुत अधिक कठोर था।

प्रस्तुत है DetPO (डिटेक्शन प्रॉम्प्ट ऑप्टिमाइज़ेशन)। DetPO को केवल तस्वीरें दिखाने वाले शिक्षक के रूप में नहीं, बल्कि एक सुपर-स्मार्ट संपादक (Editor) के रूप में सोचें जो AI के निर्देश मैनुअल को तब तक फिर से लिखता है जब तक कि AI अंततः उसे "समझ" न ले।


समस्या: केवल तस्वीरें दिखाना क्यों विफल रहा

आमतौर पर, जब हम AI को एक नई अवधारणा सिखाना चाहते हैं, तो हम In-Context Learning का उपयोग करते हैं। यह एक छात्र को टेस्ट पेपर देने जैसा है जिसके ऊपर कुछ उदाहरण दिए गए हैं और आप कहते हैं, "यहाँ एक 'मशरूम' कैसा दिखता है। अब सभी मशरूम ढूंढो।"

शोधकर्ताओं ने इसे आज़माया, लेकिन यह उल्टा पड़ गया।

  • उपमा: कल्पना कीजिए कि आप एक शेफ को नया व्यंजन बनाने के लिए कह रहे हैं। आप उन्हें उस व्यंजन की एक फोटो देते हैं और कहते हैं, "इसे बनाओ।" शेफ फोटो की लाइटिंग, एंगल या प्लेट की वजह से भ्रमित हो सकता है।
  • परिणाम: AI उदाहरणों के विजुअल शोर (visual noise) से विचलित हो गया और वास्तव में इसने तब भी खराब प्रदर्शन किया जब आपने इसे केवल एक सरल टेक्स्ट विवरण दिया होता जैसे, "मशरूम को खोजो।"

समाधान: DetPO (एक "संपादक" दृष्टिकोण)

वास्तविक परीक्षण के दौरान AI को तस्वीरों को देखने के लिए मजबूर करने के बजाय, DetPO परीक्षण शुरू होने से पहले निर्देशों को फिर से लिखने के लिए उन तस्वीरों का उपयोग करता है।

यहाँ DetPO कैसे काम करता है, चरण-दर-चरण:

1. "ड्राफ्टिंग" चरण (प्रारंभिक प्रॉम्प्ट)

सिस्टम नए ऑब्जेक्ट (जैसे, चमकता हुआ मशरूम) की कुछ तस्वीरें लेता है और AI से पूछता है: "इस वस्तु का विस्तार से वर्णन करें।"

  • उपमा: AI मशरूम के लिए एक "वांटेड पोस्टर" का पहला ड्राफ्ट लिखता है।

2. "एडिटिंग" चरण (कॉन्ट्रास्टिव रिफाइनमेंट)

यही जादुगरिक हिस्सा है। सिस्टम प्रशिक्षण तस्वीरों पर AI के नए निर्देशों को चलाता है।

  • यदि AI एक मशरूम को मिस कर देता है (False Negative): सिस्टम कहता है, "अरे, तुमने इसे मिस कर दिया! फोटो को देखो। तुमने क्या मिस किया? क्या यह उसकी चमक है? या उसका आकार?" AI फिर उस "वांटेड पोस्टर" को उन छूटे हुए विवरणों को शामिल करने के लिए अपडेट करता है।
  • यदि AI सोचता है कि एक पत्थर मशरूम है (False Positive): सिस्टम कहता है, "रुको! यह पत्थर है, मशरूम नहीं। पत्थर में क्या अलग है? यह सख्त और ग्रे है।" AI पोस्टर को अपडेट करता है ताकि यह कहा जा सके, "नरम और चमकता हुआ होना चाहिए," ताकि पत्थरों के साथ भ्रमित होने से बचा जा सके।

उपमा: कल्पना कीजिए कि एक जासूस (AI) एक विशिष्ट अपराधी को पकड़ने की कोशिश कर रहा है।

  • राउंड 1: जासूस एक रैंडम आदमी को गिरफ्तार करता है क्योंकि वह अपराधी जैसा "लगता है।"
  • संपादक (DetPO): "नहीं, यह वह नहीं है! असली अपराधी की फोटो देखो। असली अपराधी के बाएं गाल पर एक निशान है। जिस आदमी को तुमने गिरफ्तार किया उसमें वह निशान नहीं है। अपना विवरण अपडेट करो!"
  • राउंड 2: जासूस असली अपराधी को मिस कर देता है क्योंकि वह दाएं गाल पर निशान ढूंढ रहा था।
  • संपादक: "तुमने उसे मिस कर दिया! फोटो दिखाती है कि निशान बाएं तरफ है। अपना विवरण अपडेट करो!"

सिस्टम इस लूप को दोहराता है, निर्देशों को बार-बार परिष्कृत करता है, जब तक कि AI लक्ष्य वस्तु को अन्य चीजों से पूरी तरह से अलग नहीं पहचान लेता।

3. "कॉन्फिडेंस चेक" (VQA स्कोर)

कभी-कभी, बेहतरीन निर्देशों के बावजूद, AI बहुत अधिक आत्मविश्वासी हो जाता है। वह कह सकता है, "मुझे 99% यकीन है कि यह पत्थर एक मशरूम है!"

  • समाधान: DetPO एक दूसरा चरण जोड़ता है। यह AI के अनुमान को लेता है और उससे एक साधारण हाँ/ना प्रश्न पूछता है: "क्या यह वास्तव में एक मशरूम है?"
  • उपमा: यह एक मैनेजर द्वारा कर्मचारी की रिपोर्ट को दोबारा चेक करने जैसा है। यदि कर्मचारी कहता है, "मुझे मशरूम मिला!" तो मैनेजर उस स्थान को देखता है और पूछता है, "क्या तुम पक्का हो?" यदि मैनेजर सुनिश्चित नहीं है, तो कॉन्फिडेंस स्कोर गिर जाता है, और गलत अलार्म को अनदेखा कर दिया जाता है।

यह क्यों महत्वपूर्ण है

  • कोई भारी काम नहीं: आमतौर पर, AI को नया कार्य सिखाने के लिए, आपको उसे "Fine-tune" करना पड़ता है। यह AI को 6 महीने के बूट कैंप में भेजने जैसा है। यह महंगा, धीमा और शक्तिशाली कंप्यूटर की आवश्यकता वाला काम है।
  • DetPO एक शॉर्टकट है: DetPO AI को साधारण अंग्रेजी में लिखा गया एक चीट शीट (Cheat Sheet) देने जैसा है। यह AI के दिमाग को नहीं बदलता; यह केवल उसे बेहतर निर्देश देता है।
  • ब्लैक-बॉक्स फ्रेंडली: कई बेहतरीन AI मॉडल (जैसे Gemini या Qwen) "ब्लैक बॉक्स" हैं—आप उनके अंदर नहीं देख सकते या उनके कोड को बदल नहीं सकते। DetPO इनके साथ पूरी तरह काम करता है क्योंकि यह केवल उन शब्दों को बदलता है जो आप उन्हें टाइप करते हैं, न कि स्वयं कोड को।

परिणाम

शोधकर्ताओं ने 20 अलग-अलग कठिन डेटासेट्स (जैसे एक्स-रे, ड्रोन फोटोज़ और पानी के नीचे के दृश्य) पर इसका परीक्षण किया।

  • DetPO से पहले: AI भ्रमित था और बहुत सी गलतियाँ कर रहा था।
  • DetPO के बाद: AI एक मास्टर डिटेक्टिव बन गया, जो उन वस्तुओं को बहुत उच्च सटीकता के साथ ढूंढ लेता था जिन्हें उसने पहले कभी नहीं देखा था। कुछ मामलों में, इसने उन विशेष AI मॉडल्स को भी पीछे छोड़ दिया जो विशेष रूप से उन कार्यों के लिए बनाए गए थे।

सारांश

DetPO एक चतुर तरीका है जो कुछ उदाहरण तस्वीरों को एक परफेक्टली लिखे गए निर्देश मैनुअल में बदल देता है। AI को तस्वीरें याद करने के लिए मजबूर करने के बजाय, यह तस्वीरों का उपयोग AI के निर्देशों को ठीक करने के लिए करता है, जिससे उसे यह सिखाया जाता है कि क्या देखना है और क्या अनदेखा करना है। यह उन्हें शुरू से फिर से प्रशिक्षित किए बिना सुपर-इंटेलिजेंट AI को नई स्किल्स सिखाने का एक सस्ता, तेज़ और प्रभावी तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →