← नवीनतम पेपर
💻 computer science

RegionReasoner: Region-Grounded Multi-Round Visual Reasoning

यह शोध पत्र RegionReasoner प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो स्पष्ट बाउंडिंग बॉक्स उद्धरणों और वैश्विक-स्थानीय अर्थ संबंधी निरंतरता की आवश्यकता के माध्यम से ग्राउंडेड, बहु-चरण दृश्य तर्क को लागू करता है, साथ ही एक नए बेंचमार्क जिसे RegionDial-Bench कहा जाता है, को भी पेश करता है, ताकि विजन-लैंग्वेज मॉडलों में स्थानिक ग्राउंडिंग और तर्क सटीकता में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Wenfang Sun, Hao Chen, Yingjun Du, Yefeng Zheng, Cees G. M. Snoek

प्रकाशित 2026-03-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenfang Sun, Hao Chen, Yingjun Du, Yefeng Zheng, Cees G. M. Snoek

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक बहुत ही बुद्धिमान, लेकिन थोड़े भुलक्कड़ दोस्त के साथ "Where's Waldo?" (या "Where's Wally?") का खेल खेल रहे हैं।

पुराने दिनों में, यदि आप अपने दोस्त से पूछते, "लाल टोपी वाले आदमी को ढूँढो," तो वे तस्वीर देखते, एक जगह इशारा करते और कहते, "वहाँ!" यदि फिर आप उनसे पूछते, "ठीक है, अब उस आदमी के बगल में खड़े कुत्ते को ढूँढो," तो वे भ्रमित हो सकते थे। वे शायद लाल टोपी वाले आदमी की सटीक स्थिति भूल जाते, या वे बिना आदमी को देखे ही कुत्ते के स्थान का अनुमान लगाने लगते। वे शायद एक ऐसे कुत्ते की कल्पना कर लेते जो वहाँ था ही नहीं।

यह पेपर ठीक इसी समस्या को ठीक करने के लिए RegionReasoner नामक एक नई प्रणाली पेश करता है। यह ऐसा है जैसे आपने अपने दोस्त को कई राउंड बेहतर तरीके से खेलने में मदद करने के लिए स्टिकी नोट्स (sticky notes) और एक नियम पुस्तिका (rulebook) दे दी हो।

यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. समस्या: "भुलक्कड़ जासूस" (The Forgetful Detective)

वर्तमान AI मॉडल किसी तस्वीर को देखने और एक प्रश्न का उत्तर देने में बहुत अच्छे हैं। लेकिन जब आप उनसे एक ऐसा दूसरा प्रश्न पूछते हैं जो पहले के उत्तर पर निर्भर करता है (जैसे, "बिल्ली को ढूँढो, फिर बिल्ली के बगल में चूहे को ढूँढो"), तो वे अपना रास्ता भटक जाते हैं।

  • समस्या: वे पहले ऑब्जेक्ट की सटीक लोकेशन भूल जाते हैं। वे कह सकते हैं, "चूहा बिल्ली के पास है," लेकिन उन्हें वास्तव में यह नहीं पता होता कि बिल्ली अब कहाँ है। वे दिशाहीन हो जाते हैं, जैसे कोई जासूस जो अपराध स्थल को भूलकर अंदाज़ लगाने लगता है।

2. समाधान: "स्टिकी नोट" सिस्टम (RegionReasoner)

लेखकों ने AI के सोचने का एक नया तरीका बनाया है। केवल अनुमान लगाने के बजाय, AI को एक बहुत ही विशिष्ट प्रारूप में अपने विचार लिखने के लिए मजबूर किया जाता है, जैसे कि एक जासूसी लॉगबुक।

हर बार जब AI किसी प्रश्न का उत्तर देता है, तो उसे चार विशिष्ट भाग बनाने होते हैं:

  • : पूरी तस्वीर का एक त्वरित सारांश (बड़ी तस्वीर/The Big Picture)।
  • : उस विशिष्ट वस्तु का विवरण जिसे उन्होंने अभी खोजा है (स्टिकी नोट/The Sticky Note)।
  • : तर्क प्रक्रिया। महत्वपूर्ण रूप से, AI को उस वस्तु के सटीक निर्देशांक (coordinates) (जैसे कि एक GPS पता) लिखने होंगे जिसके बारे में वह बात कर रहा है। वह केवल "बिल्ली" नहीं कह सकता; उसे कहना होगा "बिल्ली [100, 200, 300, 400] पर है।"
  • : नए ऑब्जेक्ट का अंतिम स्थान।

उपमा (Analogy): कल्पना कीजिए कि आपके दोस्त को "लाल टोपी वाले आदमी" के GPS निर्देशांक एक स्टिकी नोट पर लिखने होंगे इससे पहले कि वे "कुत्ते" को ढूँढ सकें। कुत्ते को ढूँढते समय, उन्हें स्टिकी नोट पढ़ना होगा और कहना होगा, "मैं [100, 200...] के निर्देशांकों के पास एक कुत्ता ढूँढ रहा हूँ।" यह उन्हें भटकने से रोकता है।

3. कोच: "रिवॉर्ड सिस्टम" (Reinforcement Learning)

आप एक AI को यह सब कैसे सिखाते हैं? आप उन्हें केवल उदाहरण नहीं दिखाते; आप एक सख्त कोच की तरह एक रिवॉर्ड सिस्टम (पुरस्कार प्रणाली) का उपयोग करते हैं।

लेखक दो विशेष नियम (रिवॉर्ड्स) पेश करते हैं जिनके लिए AI को अंक मिलते हैं:

  • "साइटेशन" रिवॉर्ड (The Citation Reward): AI को अंक तभी मिलते हैं जब वह अपनी सोच (thinking log) में पिछले ऑब्जेक्ट के निर्देशांकों का स्पष्ट रूप से उल्लेख करता है। यदि वह "स्टिकी नोट" का हवाला दिए बिना अनुमान लगाने की कोशिश करता है, तो उसे दंड (penalty) मिलता है। यह उसे वास्तविकता से जुड़े रहने के लिए मजबूर करता है।
  • "कंसिस्टेंसी" रिवॉर्ड (The Consistency Reward): AI को अंक मिलते हैं यदि उसकी पूरी तस्वीर का विवरण उसके विशिष्ट ऑब्जेक्ट के विवरण से मेल खाता है। यदि वह शुरुआत में कहता है कि पूरी तस्वीर "धूप वाली" है, लेकिन फिर अपने विशिष्ट ऑब्जेक्ट को "अंधेरे में" बताता है, तो उसके अंक कट जाते हैं। यह कहानी को तार्किक बनाए रखता है।

4. नया खेल का मैदान: RegionDial-Bench

यह परीक्षण करने के लिए कि क्या यह वास्तव में काम करता है, लेखकों ने RegionDial-Bench नामक एक नया प्रशिक्षण मैदान बनाया है।

  • इसे "Where's Waldo?" के एक नए, कठिन संस्करण के रूप में समझें जहाँ प्रश्न एक दूसरे से जुड़े हुए हैं।
  • उन्होंने मौजूदा डेटासेट्स को लिया और उन्हें इस तरह से फिर से लिखा कि राउंड 2 के लिए राउंड 1 के उत्तर का संदर्भ देना अनिवार्य हो गया।
  • उन्होंने AI का बॉक्सेस खोजने (Detection) और आउटलाइन बनाने (Segmentation) दोनों पर परीक्षण किया।

5. परिणाम: "सुपर डिटेक्टिव" (The Super Detective)

जब उन्होंने RegionReasoner का अन्य स्मार्ट AI मॉडलों के मुकाबले परीक्षण किया:

  • वह थका नहीं: जबकि अन्य मॉडल बातचीत लंबी होने के साथ (राउंड 5, 6, 7 में) बदतर होते गए, RegionReasoner सटीक बना रहा।
  • उसने भ्रम पैदा नहीं किया (Hallucination): उसने ऐसे ऑब्जेक्ट्स की कल्पना करना बंद कर दिया जो वहाँ थे ही नहीं, क्योंकि उसे अपने "स्टिकी नोट्स" की जाँच करने के लिए मजबूर किया गया था।
  • वह अधिक सटीक था: उसने सही ऑब्जेक्ट्स को बहुत अधिक बार ढूँढा, विशेष रूप से बाद के कठिन राउंड में।

सारांश

RegionReasoner AI को एक मेथोडिकल (बारीकी से काम करने वाला) जासूस बनाने जैसा है, न कि एक खयाली पुलाव पकाने वाला कलाकार

  • पुराना AI: "मुझे लगता है कि कुत्ता बिल्ली के पास है... शायद?" (अनुमान लगाता है और भटक जाता है)।
  • RegionReasoner: "मैंने [X, Y] पर बिल्ली को पाया। अब मैं [X, Y] के पास एक कुत्ता ढूँढ रहा हूँ। मैंने [A, B] पर कुत्ता पाया।" (सटीक, ठोस और सुसंगत)।

AI को अपने स्रोतों का हवाला देने और अपनी कहानी को सुसंगत रखने के लिए मजबूर करके, लेखकों ने एक ऐसी प्रणाली बनाई है जो बिना अपना मानसिक संतुलन खोए जटिल, बहु-चरणीय विजुअल रीजनिंग (visual reasoning) को संभाल सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →