← नवीनतम पेपर
💬 NLP

Vero: An Open RL Recipe for General Visual Reasoning

वेरो (Vero) विजन-लैंग्वेज मॉडल्स का एक पूर्णतः खुला परिवार है जो 600K विविध नमूनों और टास्क-रूटेड रिवॉर्ड्स के माध्यम से सुदृढीकरण शिक्षण (reinforcement learning) को स्केल करके अत्याधुनिक सामान्य दृश्य तर्क प्रदर्शन प्राप्त करता है, जो यह प्रदर्शित करता है कि व्यापक डेटा कवरेज ही सफलता का प्राथमिक चालक है और यह किसी भी प्रोप्रायटरी डेटा या सोचने के पैटर्न पर निर्भर नहीं है।

मूल लेखक: Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को यह सिखाने की कोशिश कर रहे हैं कि तस्वीरों को देखने और उनके बारे में सवालों के जवाब देने में जीनियस कैसे बना जाए।

अभी के अधिकांश सबसे स्मार्ट रोबोट्स (जैसे बड़ी टेक कंपनियों के) एक ब्लैक बॉक्स की तरह हैं। हम जानते हैं कि वे तस्वीरों में गणित की समस्याओं को हल करने या चार्ट पढ़ने में अविश्वसनीय रूप से स्मार्ट हैं, लेकिन हमें यह नहीं पता कि उन्होंने यह कैसे सीखा। उनका ट्रेनिंग डेटा और तरीके एक तिजोरी में बंद गुप्त रेसिपी की तरह हैं।

यह पेपर Vero को पेश करता है, जो एक विश्व-स्तरीय विजुअल रीज़नर (visual reasoner) बनाने के लिए रसोई को खोलने और आपको सटीक रेसिपी दिखाने जैसा है। लेखकों ने न केवल एक स्मार्ट रोबोट बनाया; उन्होंने इसके ब्लूप्रिंट, सामग्री और खाना पकाने के निर्देश भी जनता के लिए जारी कर दिए।

यहाँ इसका सरल विवरण दिया गया है कि उन्होंने इसे कैसे किया, कुछ रोज़मर्रा के उदाहरणों का उपयोग करते हुए:

1. समस्या: "स्पेशलिस्ट" का जाल

कल्पना कीजिए कि आपने एक ऐसा शेफ काम पर रखा है जो केक बनाने (STEM/गणित) में माहिर है। फिर आप उनसे एक टपकते हुए नल (स्थानिक तर्क/spatial reasoning) को ठीक करने या सूर्यास्त के बारे में एक मज़ेदार कविता लिखने के लिए कहते हैं। वे बुरी तरह विफल हो सकते हैं।

पेपर में पाया गया कि यदि आप एक AI को केवल एक प्रकार के कार्य (जैसे केवल गणित) पर प्रशिक्षित करते हैं, तो वह उस एक चीज़ में बहुत अच्छा हो जाता है लेकिन वास्तव में बाकी सब चीज़ों में खराब हो जाता है। यह एक ऐसे संगीतकार की तरह है जो केवल स्केल का अभ्यास करता है और गाना बजाना भूल जाता है।

2. समाधान: "ऑल-यू-कैन-ईट" बुफे

लेखकों ने Vero-600K नामक एक विशाल डेटासेट बनाया। इसे एक विशाल, पूरी तरह से संतुलित बुफे के रूप में सोचें जिसमें छह अलग-अलग फूड स्टेशन हैं:

  • STEM: गणित और विज्ञान के चित्र।
  • चार्ट और OCR: ग्राफ और छवियों में टेक्स्ट को पढ़ना।
  • स्पेशियल और एक्शन (Spatial & Action): यह समझना कि चीजें कहाँ हैं और उन्हें कैसे हिलाया जाए (जैसे एक रोबोटिक हाथ)।
  • नॉलेज (Knowledge): दुनिया के बारे में जो आप जानते हैं उसका उपयोग करके सवालों के जवाब देना।
  • ग्राउंडिंग और काउंटिंग (Grounding & Counting): विशिष्ट वस्तुओं को खोजना और उन्हें गिनना।
  • कैप्शनिंग (Captioning): रचनात्मक विवरण लिखना।

रोबोट को केवल केक खिलाने के बजाय, उन्होंने उसे एक ही समय में हर चीज़ का थोड़ा-थोड़ा हिस्सा खिलाया। उन्होंने पाया कि विविधता ही असली सीक्रेट सॉस है। सभी छह स्टेशनों से खाने के माध्यम से, रोबोट ने सोचने के विभिन्न "मोड्स" के बीच स्विच करना सीखा।

3. प्रशिक्षण विधि: "सीटी के साथ कोच"

उन्होंने रीइन्फोर्समेंट लर्निंग (RL) नामक तकनीक का उपयोग किया। कल्पना कीजिए कि एक कोच एक एथलीट को प्रशिक्षित कर रहा है:

  • एथलीट एक चाल चलता है।
  • यदि वह सही करता है, तो कोच उसे हाई-फाइव देता है (एक इनाम)।
  • यदि वह गलत करता है, तो कोच कहता है "फिर से कोशिश करो।"

लेखकों ने एक स्मार्ट रेफरी सिस्टम (जिसे "टास्क-रूटेड रिवॉर्ड्स" कहा जाता है) बनाया।

  • यदि रोबोट गणित की समस्या हल कर रहा है, तो रेफरी नंबरों की जांच करता है।
  • यदि रोबोट एक कविता लिख रहा है, तो रेफरी जांचता है कि क्या यह सुनने में अच्छी है और नियमों का पालन करती है।
  • यदि रोबोट किसी वस्तु की ओर इशारा कर रहा है, तो रेफरी जांचता है कि क्या निर्देशांक (coordinates) सही हैं।

महत्वपूर्ण रूप से, उन्होंने रोबोट को बोलने से पहले सोचने के लिए सिखाया। उन्होंने इसे अपना "विचार प्रक्रिया" (जैसे एक रफ पैड) लिखने के लिए मजबूर किया (अंतिम उत्तर देने से पहले)। यह एक छात्र को, "अपना काम दिखाओ" कहने जैसा है, जो उन्हें मूर्खतापूर्ण गलतियों से बचने में मदद करता है।

4. परिणाम: गुप्त दिग्गजों को हराना

परिणाम? उनका ओपन-सोर्स रोबोट (Vero) इतना स्मार्ट हो गया कि उसने 30 में से 23 कठिन परीक्षणों में बड़ी कंपनियों के "गुप्त" रोबोट्स को हरा दिया।

  • यह केवल चार्ट पर प्रशिक्षित मॉडल्स की तुलना में जटिल चार्ट को बेहतर ढंग से पढ़ सकता था।
  • यह केवल पहेलियों पर प्रशिक्षित मॉडल्स की तुलना में स्थानिक पहेलियों (spatial puzzles) को बेहतर ढंग से हल कर सकता था।
  • यह अभी भी रचनात्मक कैप्शन लिख सकता था, भले ही वह कठिन गणित भी कर रहा हो।

5. यह क्यों मायने रखता है

इससे पहले, यदि आप एक स्मार्ट विजुअल AI बनाना चाहते थे, तो आपको अनुमान लगाना पड़ता था कि किस डेटा का उपयोग करना है या बड़ी कंपनी को एक्सेस के लिए भुगतान करना पड़ता था।

  • "ब्लैक बॉक्स" युग: "हम पर भरोसा करें, हमारा रोबोट स्मार्ट है क्योंकि हमने इसे गुप्त डेटा पर प्रशिक्षित किया है।"
  • "Vero" युग: "यहाँ उन 59 डेटासेट्स की सटीक सूची है जिनका हमने उपयोग किया, यहाँ कोड है, और यहाँ बताया गया है कि हमने उन्हें कैसे मिलाया। आप भी यह कर सकते हैं।"

संक्षेप में:
लेखकों ने साबित किया कि एक वास्तव में स्मार्ट विजुअल AI बनाने के लिए, आपको एक गुप्त सुपर-रेसिपी की आवश्यकता नहीं है। आपको बस विविधता की आवश्यकता है। विभिन्न प्रकार की विजुअल समस्याओं को एक साथ मिलाकर और AI को अपने काम की जांच करने का एक स्पष्ट तरीका देकर, आप एक सामान्य-उद्देश्य वाला "मस्तिष्क" बना सकते हैं जो दुनिया के सबसे महंगे, बंद-ऑफ सिस्टम जितना ही अच्छा है। उन्होंने साम्राज्य की चाबियाँ सभी के लिए सौंप दी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →