← नवीनतम पेपर
🤖 AI

Perceptual Flow Network for Visually Grounded Reasoning

अनुकूलतम ज्यामितीय पर्यवेक्षण के कारण लार्ज-विज़न लैंग्वेज मॉडल्स में होने वाले भाषा पूर्वाग्रह और मतिभ्रम (hallucination) को संबोधित करने के लिए, यह शोध पत्र 'परसेप्चुअल फ्लो नेटवर्क' (PFlowNet) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो धारणा (perception) को तर्क (reasoning) से अलग करता है और विजुअल रीजनिंग बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए वेरिएशनल रीइन्फोर्समेंट लर्निंग का उपयोग करता है।

मूल लेखक: Yangfu Li, Yuning Gong, Hongjian Zhan, Teng Li, Yuanhuiyi Lyu, Tianyi Chen, Qi Liu, Ziyuan Huang, Zhihang Zhong, Dandan Zheng, Yue Lu

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yangfu Li, Yuning Gong, Hongjian Zhan, Teng Li, Yuanhuiyi Lyu, Tianyi Chen, Qi Liu, Ziyuan Huang, Zhihang Zhong, Dandan Zheng, Yue Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Perceptual Flow Network for Visually Grounded Reasoning" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

समस्या: "अति-आत्मविश्वासी" जासूस

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान जासूस (एक Large Vision-Language Model, या LVLM) है जो रहस्य सुलझाने में माहिर है। हालाँकि, इस जासूस की एक बुरी आदत है: वह कभी-कभी भ्रम (hallucinate) का शिकार हो जाता है। वह पूरे आत्मविश्वास के साथ कह सकता है, "मुझे मेज पर एक लाल बिल्ली दिख रही है," जबकि वास्तव में वहाँ सिर्फ एक लाल सेब होता है।

इसे ठीक करने के लिए, पिछले तरीकों ने जासूस को एक "मास्टर डिटेक्टिव" (एक विजुअल एक्सपर्ट AI) पर आधारित एक सख्त नियम पुस्तिका देने की कोशिश की। नियम पुस्तिका कहती थी, "यदि आपको लगता है कि आप कोई वस्तु देख रहे हैं, तो उसका आपका रेखाचित्र मास्टर डिटेक्टिव के रेखाचित्र से बिल्कुल मेल खाना चाहिए।"

पेपर की खोज: लेखकों ने पाया कि यह "बिल्कुल सटीक मिलान" का नियम वास्तव में जासूस को जटिल पहेलियाँ सुलझाने में और भी खराब बना देता है।

  • उपमा: कल्पना कीजिए कि मास्टर डिटेक्टिव यह साबित करने के लिए कि वह एक पत्ती है, उस विशिष्ट पत्ती के चारों ओर एक छोटा, सटीक घेरा बनाता है। यदि हमारा जासूस केवल उस छोटे घेरे को ही बनाने के लिए मजबूर किया जाता है, तो वह संदर्भ (context) को खो देता है। वह टहनी, आकाश या आस-पास की अन्य पत्तियों को नहीं देख पाता। उसे "टनल विजन" (एक ही चीज़ पर ध्यान केंद्रित करना) हो जाता है। वह ज्यामितीय रूप से सटीक होने पर इतना केंद्रित हो जाता है कि वह पूरी तस्वीर के बारे में तर्क करने की अपनी क्षमता खो देता है।

समाधान: PFlowNet (एक "लचीला खोजकर्ता")

लेखक एक नया सिस्टम प्रस्तावित करते हैं जिसे PFlowNet कहा जाता है। जासूस को मास्टर डिटेक्टिव की सटीक रेखाओं की नकल करने के लिए मजबूर करने के बजाय, PFlowNet जासूस को उत्तर देने से पहले एक संरचित और लचीले तरीके से छवि का अन्वेषण (explore) करना सिखाता है।

PFlowNet को एक दो-चरणीय जांच प्रक्रिया के रूप में सोचें:

चरण 1: "स्काउट" (Perceptual Flow)

जासूस द्वारा अंतिम उत्तर देने से पहले, उसे सबूत इकट्ठा करने के लिए एक "स्काउट" (Scout) को बाहर भेजना होगा।

  • योजना बनाने का चरण (The Planning Step): स्काउट पहले सोचता है, "ठीक है, मैं क्या ढूँढ रहा हूँ? क्या यह एक कार है? एक व्यक्ति है?" (यह Planning State है)।
  • अन्वेषण का चरण (The Exploration Step): इसके बाद स्काउट कुछ स्नैपशॉट लेता है (छवि के विभिन्न हिस्सों पर ज़ूम करता है) और प्रत्येक स्थान के बारे में एक छोटा नोट लिखता है।
    • उदाहरण: "मुझे यहाँ एक सफेद फूलदान दिख रहा है। इसके बगल में, मुझे एक छोटी मूर्ति दिख रही है।"
  • मुख्य अंतर: पुराने तरीके के विपरीत, स्काउट को मास्टर डिटेक्टिव द्वारा खोजे गए सटीक स्थानों को खोजने के लिए मजबूर नहीं किया जाता है। उन्हें कहानी को बेहतर ढंग से समझने में मदद करने के लिए थोड़े अलग क्षेत्रों को देखने की अनुमति है। वे उपयोगी सबूतों की तलाश कर रहे हैं, न कि केवल पूर्णतः सटीक सबूतों की।

चरण 2: "जज" (Reasoning)

एक बार जब स्काउट अपने नोट्स और स्नैपशॉट एकत्र कर लेता है, तो मुख्य जासूस उन्हें पढ़ता है और अंतिम उत्तर देता है। क्योंकि अब जासूस के पास एक स्पष्ट, संरचित कहानी है ("मैंने एक फूलदान देखा, फिर मैंने उसके बगल में एक मूर्ति देखी"), उनके मनगढ़ंत बातें करने की संभावना बहुत कम हो जाती है।

उन्होंने इसे कैसे प्रशिक्षित किया: "रिवॉर्ड गेम"

मॉडल को यह सिखाने के लिए, लेखकों ने तीन चतुर युक्तियों वाले एक विशेष प्रशिक्षण खेल का उपयोग किया:

  1. "अच्छे बनाम बुरे" साक्ष्य का परीक्षण:
    मॉडल को अंक मिलते हैं यदि वह अपना नोट लिखने के लिए छवि के सही भाग पर ज़ूम करता है, और अंक कट जाते हैं यदि वह बैकग्राउंड के बारे में लिखता है। यह एक ऐसे खेल की तरह है जहाँ आपको खजाने के संदूक को देखने पर बोनस मिलता है और खाली फर्श को घूरने पर दंड मिलता। यह मॉडल को यह सिखाता है कि वास्तव में क्या महत्वपूर्ण है।

  2. "सेफ ज़ोन" का नियम (Vicinal Geometric Shaping):
    मॉडल को बताया जाता है: "आप अन्वेषण कर सकते हैं और नई चीजें देख सकते हैं, लेकिन मानचित्र से बहुत ज्यादा दूर न भटकें।"

    • उपमा: कल्पना कीजिए कि एक कुत्ते के गले में पट्टा बंधा है। पट्टा एक ही कठोर खंभे (मास्टर डिटेक्टिव के सटीक बॉक्स) से नहीं बंधा है। इसके बजाय, पट्टा कुत्ते को एक पूरे मोहल्ले (एक "vicinity") में घूमने की अनुमति देता है। कुत्ता गेंद खोजने के लिए अलग-अलग रास्तों पर चल सकता है, लेकिन वह दूसरे शहर में नहीं भाग सकता (जो कि एक भ्रम/hallucination होगा)। यह रचनात्मकता और सुरक्षा के बीच संतुलन बनाता है।
  3. "स्व-जांच" लूप (The "Self-Check" Loop):
    मॉडल को अपने काम की जाँच करने के लिए प्रशिक्षित किया जाता है। यदि वह किसी स्थान पर ज़ूम करता है और उसका वर्णन लिखता है, तो वह खुद से पूछता है, "क्या यह वर्णन केवल तभी समझ में आता है जब मैं इस विशिष्ट ज़ूम-इन किए गए स्थान को देख रहा हूँ?" यदि उत्तर हाँ है, तो उसे रिवॉर्ड मिलता है। यह मॉडल को सामान्य, अस्पष्ट विवरण लिखने से रोकता है जो किसी भी चीज़ पर लागू हो सकते हैं।

परिणाम: यह क्यों मायने रखता है

पेपर का दावा है कि यह नई विधि एक बड़ा सुधार है:

  • बेहतर सटीकता: कठिन परीक्षणों पर जहाँ मॉडल को सूक्ष्म विवरण खोजने होते हैं या स्थानिक संबंधों (जैसे "क्या कप किताब के बाईं ओर है?") के बारे में तर्क करना होता है, PFlowNet ने पिछले शीर्ष मॉडलों की तुलना में काफी अधिक स्कोर किया।
  • कम भ्रम (Fewer Hallucinations): क्योंकि मॉडल को उत्तर देने से पहले जो वह देखता है उसे सूचीबद्ध करके "अपना काम दिखाने" के लिए मजबूर किया जाता है, इसलिए वह तथ्य बनाना बंद कर देता है।
  • दक्षता (Efficiency): अन्य तरीकों के विपरीत जिन्हें जटिल कोड चलाने या बाहरी उपकरणों का उपयोग करने की आवश्यकता होती है (जो धीमा और बोझिल है), PFlowNet यह "सोच" आंतरिक रूप से टेक्स्ट का उपयोग करके करता है। यह एक ऐसे जासूस की तरह है जो हर सुराग के लिए विशेषज्ञों की पूरी टीम को बुलाने के बजाय अपने दिमाग में और एक नोटबुक के साथ केस सुलझाता है।

सारांश

संक्षेप में, PFlowNet AI को एक कठोर रोबोट बनने के लिए मजबूर करना बंद करता है जो सटीक रेखाचित्रों की नकल करता है। इसके बजाय, यह AI को एक विचारशील खोजकर्ता बनना सिखाता है जो सबूत इकट्ठा करता है, अपने काम की जाँच करता है, और फिर पहेली सुलझाता है। यह देखने की स्वतंत्रता और वास्तविकता में टिके रहने के अनुशासन के बीच संतुलन बनाता है, जिसके परिणामस्वरूप एक स्मार्ट, अधिक विश्वसनीय विजुअल डिटेक्टिव तैयार होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →