← नवीनतम पेपर
💬 NLP

OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks

OpenVLThinkerV2 एक सुदृढ़, सामान्य-उद्देश्य वाला मल्टीमॉडल रीजनिंग मॉडल है जो इंटर-टास्क ग्रेडिएंट इक्विटी और स्थिरता सुनिश्चित करने के लिए गॉसियन GRPO (G2^2RPO) को पेश करके और सूक्ष्म धारणा (fine-grained perception) के साथ बहु-चरणीय तर्क (multi-step reasoning) को प्रभावी ढंग से संतुलित करने के लिए नवीन रिस्पॉन्स लेंथ और एंट्रॉपी शेपिंग तंत्रों के माध्यम से विविध विजुअल कार्यों में श्रेष्ठ प्रदर्शन प्राप्त करता है।

मूल लेखक: Wenbo Hu, Xin Chen, Yan Gao-Tian, Yihe Deng, Nanyun Peng, Kai-Wei Chang

प्रकाशित 2026-04-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenbo Hu, Xin Chen, Yan Gao-Tian, Yihe Deng, Nanyun Peng, Kai-Wei Chang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अराजक छात्र (AI मॉडल) को एक विशाल, बहु-विषयक परीक्षा के लिए प्रशिक्षित कर रहे हैं। इस परीक्षा में जटिल गणितीय समस्याओं को हल करने से लेकर, घने दस्तावेज़ों को पढ़ने, फोटो में वस्तुओं की पहचान करने और 3D स्थानों को नेविगेट करने तक सब कुछ शामिल है।

यह पेपर OpenVLThinkerV2 को पेश करता है, जो इस छात्र का एक नया संस्करण है जिसने बहुत अधिक प्रभावी ढंग से अध्ययन करना सीख लिया है। इसका असली रहस्य केवल "कड़ी मेहनत से पढ़ाई करना" नहीं है; बल्कि यह है कि छात्र को कैसे ग्रेड दिया जाता है और वह यह कैसे तय करता है कि उसे किस बारे में सोचना है।

यहाँ उनके तीन मुख्य नवाचारों का विवरण दिया गया, जिन्हें सरल उपमाओं के साथ समझाया गया है:

1. समस्या: "अनुचित ग्रेडिंग स्केल"

अतीत में, जब इन AI मॉडलों को प्रशिक्षित किया जाता था, तो शोधकर्ता GRPO नामक विधि का उपयोग करते थे। इसे एक ऐसे शिक्षक के रूप में सोचें जो एक कक्षा को ग्रेड दे रहा है जहाँ कुछ छात्र 10-प्रश्नों की गणित की क्विज़ (जिसे सही या गलत पाना आसान है) देते हैं और अन्य 100-पेज के निबंध परीक्षा (जहाँ स्कोर एक निरंतर संख्या है) देते हैं।

  • समस्या: शिक्षक ने इन ग्रेड्स को एक साधारण "औसत और फैलाव" (average and spread) फॉर्मूले का उपयोग करके सामान्य करने की कोशिश की। लेकिन क्योंकि गणित की क्विज़ के स्कोर या तो 0 या 100 होते हैं, और निबंध के स्कोर उनके बीच कहीं भी हो सकते हैं, इसलिए फॉर्मूला भ्रमित हो गया।
  • परिणाम: एक छात्र जिसने निबंध पर एक भाग्यशाली "परफेक्ट" स्कोर प्राप्त किया, उसने पूरी क्लास के ग्रेड को बिगाड़ दिया, जिससे शिक्षक ने अन्य छात्रों को बहुत अधिक सुधारने (over-correct) की कोशिश की। यह ऐसा था जैसे एक तेज़ शोर बाकी ऑर्केस्ट्रा की आवाज़ को दबा दे। AI को "ग्रेडिएंट एक्सप्लोशन्स" (gradient explosions) का सामना करना पड़ा—अनिश्चित रूप से अत्यधिक उतार-चढ़ाव के कारण, जो मूल रूप से एक पैनिक अटैक जैसा था क्योंकि फीडबैक बहुत अनियंत्रित और असंगत था।

2. समाधान A: "Gaussian GRPO" (द परफेक्ट कर्व)

लेखकों ने एक नई ग्रेडिंग प्रणाली पेश की जिसे G2RPO कहा जाता है।

  • उपमा: कल्पना कीजिए कि कच्चे स्कोर देखने के बजाय, शिक्षक हर टेस्ट को एक परफेक्ट, स्मूथ बेल कर्व (Gaussian distribution) पर फिट होने के लिए मजबूर करता है।
  • यह कैसे काम करता है: यदि कोई छात्र एक "भाग्यशाली" परफेक्ट स्कोर प्राप्त करता है, तो सिस्टम गणितीय रूप से कहता है, "ठीक है, यह बहुत अच्छा है, लेकिन इस विशिष्ट कर्व पर, यह केवल एक 'बहुत अच्छा' स्कोर माना जाएगा, न कि 'ईश्वर-तुल्य' (god-tier) स्कोर।" यदि किसी छात्र का स्कोर बहुत खराब है, तो उसे सीमित कर दिया जाता है ताकि वह पूरी क्लास को नीचे न खींच सके।
  • लाभ: यह निष्पक्षता पैदा करता है। चाहे वह गणित की समस्या हो, दस्तावेज़ स्कैन करना हो, या स्थानिक पहेली (spatial puzzle), AI को संतुलित और स्थिर फीडबैक मिलता है। यह मॉडल को एक अजीब आउटलायर स्कोर के कारण पागल होने से रोकता है। यह हर छात्र को एक व्यक्तिगत, निष्पक्ष रिपोर्ट कार्ड देने जैसा है जो विषय की परवाह किए बिना एक ही मानक में फिट बैठता है।

3. समाधान B: "Response Length Shaping" (द "कम बोलो, अधिक सोचो" कोच)

AI की एक आदत थी कि वह कार्य के आधार पर या तो बहुत अधिक बोलता था या बहुत कम।

  • समस्या:
    • गणित/तर्क (Math/Reasoning) के लिए: AI कभी-कभी छोटा, आलसी उत्तर देता था जब उसे अपना "काम दिखाने" और गहराई से सोचने की आवश्यकता होती थी।
    • विजुअल कार्यों (जैसे फोटो में बिल्ली ढूंढना) के लिए: AI कभी-कभी एक लंबी, भ्रमित करने वाली कहानी सुनाने लगता था जब एक सरल "हाँ, यह एक बिल्ली है" की आवश्यकता होती थी।
  • सुधार: लेखकों ने एक "लेंथ कोच" जोड़ा।
    • गणित के लिए: कोच कहता है, "आपको एक लंबा स्पष्टीकरण लिखना होगा। सोचते रहो!"
    • विजुअल्स के लिए: कोच कहता है, "ज़्यादा मत सोचो! बस मुझे सीधा उत्तर दो।"
  • परिणाम: AI यह सीख जाता है कि कब बातूनी होना है और कब संक्षिप्त रहना है, जिससे सटीकता बेहतर होती है और 'हैलुसिनेशन' (बनाई गई बातें) कम होती हैं।

4. समाधान C: "Entropy Shaping" (द "गोल्डिलॉक्स" ज़ोन)

AI के संदर्भ में, "एन्ट्रॉपी" (entropy) यादृच्छिकता या अन्वेषण का माप है।

  • एन्ट्रॉपी कोलैप्स (Entropy Collapse): AI बहुत आत्मविश्वासी हो जाता है और नई चीज़ें आज़माना बंद कर देता है। वह बस एक ही सुरक्षित, उबाऊ उत्तर दोहराता रहता है।
  • एन्ट्रॉपी एक्सप्लोजन (Entropy Explosion): AI बहुत ज़्यादा अनियंत्रित हो जाता है और केवल अलग दिखने के लिए बकवास या निरर्थक बातें उत्पन्न करने लगता है।

लेखकों ने एक "गोल्डिलॉक्स" गार्डरेल जोड़ा। उन्होंने AI कितना रैंडम हो सकता है, इसके लिए एक न्यूनतम और अधिकतम सीमा निर्धारित की।

  • यदि AI बहुत उबाऊ हो जाता है, तो गार्डरेल उसे थोड़ा और अन्वेषण करने के लिए प्रेरित करता है।
  • यदि AI बहुत ज़्यादा पागल हो जाता है, तो गार्डरेल उसे वापस वास्तविकता में खींच लाता है।
    यह AI को उस "स्वीट स्पॉट" में रखता है जहाँ वह कठिन समस्याओं को हल करने के लिए पर्याप्त रचनात्मक है लेकिन विश्वसनीय होने के लिए पर्याप्त स्थिर भी है।

भव्य परिणाम: OpenVLThinkerV2

इन तीन सुधारों को जोड़कर:

  1. निष्पक्ष ग्रेडिंग (G2RPO): AI को अजीब स्कोर पर घबराने से रोकता है।
  2. लेंथ कोचिंग: AI को बताता है कि कब गहराई से सोचना है और कब त्वरित होना है।
  3. गोल्डिलॉक्स गार्डरेल्स: AI को बहुत उबाऊ या बहुत पागल होने से रोकता है।

इसका परिणाम एक वास्तविक "जनरलिस्ट" (Generalist) मॉडल है। यह केवल एक चीज़ में उत्कृष्ट नहीं है; यह गणित, दस्तावेज़ पढ़ने, चार्ट समझने और स्पेस को नेविगेट करने में अविश्वसनीय रूप से मजबूत है। पेपर के परीक्षणों में, इस नए मॉडल ने न केवल अन्य ओपन-सोर्स मॉडलों को हराया, बल्कि बड़ी टेक कंपनियों (जैसे GPT-4o और Gemini 2.5 Pro) के सबसे शक्तिशाली, महंगे, क्लोज्ड-सोर्स मॉडलों को भी 18 विभिन्न प्रकार के विजुअल कार्यों में पीछे छोड़ दिया।

संक्षेप में: उन्होंने AI को सिखाया कि एक मानकीकृत परीक्षा निष्पक्ष रूप से कैसे ली जाती है, यह कैसे पता लगाया जाए कि कब चुप रहना है और कब बोलना है, और दबाव में शांत कैसे रहना है। परिणाम एक सुपर-स्मार्ट, ऑल-राउंड विजुअल थंकर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →