FineVision: Open Data Is All You Need
FineVision ने 24 मिलियन सावधानीपूर्वक क्यूरेट किए गए विजन-लैंग्वेज नमूनों का सबसे बड़ा ओपन कॉर्पस पेश किया है, जिसे एक कठोर अर्ध-स्वचालित पाइपलाइन के माध्यम से बनाया गया है जो मानव निरीक्षण के साथ 200 से अधिक स्रोतों को एकीकृत करता है ताकि संदूषण और दोहराव को समाप्त किया जा सके, जो अंततः इस डेटासेट पर प्रशिक्षित मॉडलों को मौजूदा ओपन विकल्पों की तुलना में काफी बेहतर प्रदर्शन करने में सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को दुनिया को देखना और समझना सिखाने की कोशिश कर रहे हैं, ठीक वैसे ही जैसे एक इंसान करता है। ऐसा करने के लिए, आपको उसे लाखों तस्वीरें दिखानी होंगी और उसे उनके बारे में बात करना सिखाना होगा। यही वह काम है जो "विज़न-लैंग्वेज मॉडल्स" (VLMs) करते हैं।
हालाँकि, अब तक, जनता के लिए उपलब्ध "पाठ्यपुस्तकें" (डेटासेट्स) बहुत अस्त-व्यस्त थीं। वे एक ऐसी लाइब्रेरी की तरह थीं जहाँ कुछ किताबें अलग-अलग भाषाओं में लिखी थीं, कुछ पन्ने फटे हुए थे, कुछ में गलतियाँ (typos) थीं, और कुछ तो उन सवालों की नकल भी थीं जिन पर बाद में रोबोट का टेस्ट लिया जाना था। इस वजह से ओपन-सोर्स रोबोट्स के लिए उन महंगे और गुप्त रोबोट्स की बराबरी करना मुश्किल हो गया था जिन्हें बड़ी टेक कंपनियाँ बनाती हैं।
FineVision एक नई, विशाल और बेहद सावधानी से साफ की गई लाइब्रेरी है जिसे Hugging Face, टेक्निकल यूनिवर्सिटी ऑफ म्यूनिख और स्टैनफोर्ड के शोधकर्ताओं द्वारा बनाया गया है। यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया और यह क्यों महत्वपूर्ण है, जिसे सरल भाषा में समझाया गया है:
1. बड़ी सफाई (डेटा क्यूरेशन)
शोधकर्ताओं ने डेटा के 200 से अधिक विभिन्न स्रोतों को इकट्ठा किया—एकेडेमिक पेपर्स से लेकर क्लाउड स्टोरेज फोल्डर्स तक। लेकिन उन्हें बस एक साथ ढेर कर देने से काम नहीं चलता।
- अनुवादक (The Translator): उन्होंने एक "अर्ध-स्वचालित" प्रणाली (AI सहायकों का उपयोग करके) बनाई ताकि इन सभी विभिन्न स्वरूपों (formats) को एक मानक भाषा में अनुवादित किया जा सके। कल्पना कीजिए कि आप 200 अलग-अलग प्रकार की रेसिपी (कुछ फ्रेंच में, कुछ जापानी में, कुछ नैपकिन पर लिखी हुई) ले रहे हैं और उन सभी को एक ही, आसान-से-अनुसरण करने योग्य कुकबुक फॉर्मेट में बदल रहे हैं।
- मानवीय संपादक (The Human Editors): AI परफेक्ट नहीं है। इसलिए, मानव समीक्षकों ने संपादकों के रूप में काम किया। उन्होंने AI के काम की जाँच की, गलतियों को सुधारा और यह सुनिश्चित किया कि "रेसिपी" सुरक्षित और सटीक हो। यदि AI ने रूपांतरण में कोई गलती की, तो इंसानों ने उसे ठीक किया और AI को फिर से प्रयास करने के लिए कहा।
- डुप्लीकेशन हटाना (The De-Duplication): उन्होंने डुप्लिकेट छवियों को खोजने और हटाने के लिए एक विशेष "कॉपी डिटेक्टर" का उपयोग किया। यदि बिल्ली की एक ही तस्वीर लाइब्रेरी में 50 बार दिखाई देती थी, तो उन्होंने केवल एक को रखा (या उन्हें एक समृद्ध बातचीत में मिला दिया) ताकि रोबोट एक ही बिल्ली को बार-बार रट न ले।
- टेस्ट-सुरक्षित क्षेत्र (The Test-Safe Zone): उन्होंने इन रोबोट्स को ग्रेड देने के लिए उपयोग किए जाने वाले 66 मानक टेस्ट के विरुद्ध लाइब्रेरी की जाँच की। यदि उन्हें लाइब्रेरी में कोई ऐसी तस्वीर मिली जो भविष्य के टेस्ट की तस्वीर के समान थी, तो उन्होंने उसे हटा दिया। यह सुनिश्चित करता है कि रोबोट वास्तव में सीख रहा है, न कि केवल उत्तरों को रटकर नकल कर रहा है।
2. लाइब्रेरी के अंदर क्या है?
अंतिम परिणाम FineVision है, जो 24 मिलियन सैंपल (लगभग 17 मिलियन छवियां) का एक संग्रह है। यह केवल तस्वीरों का ढेर नहीं है; यह बातचीत के रूप में व्यवस्थित है।
- विविधता: इसमें साधारण "यह क्या है?" जैसे सवालों से लेकर चार्ट पढ़ने, गणित की समस्याओं को हल करने या किसी दस्तावेज़ को समझने जैसे जटिल कार्यों तक सब कुछ शामिल है।
- "एक्शन" सेक्शन: लाइब्रेरी का एक विशेष हिस्सा रोबोट को कंप्यूटर इंटरफेस (जैसे माउस क्लिक करना या फोन स्क्रीन पर टाइप करना) का उपयोग करना सिखाता है। उन्होंने इसे इस तरह मानकीकृत किया कि रोबोट एक सार्वभौमिक "एक्शन की भाषा" सीख सके जो डेस्कटॉप, फोन और ब्राउज़र पर काम करती है।
- गुणवत्ता नियंत्रण: लाइब्रेरी में मौजूद हर एक बातचीत को AI जजों द्वारा (और इंसानों द्वारा भी) चार चीजों पर स्कोर किया गया था:
- फॉर्मेटिंग: क्या टेक्स्ट साफ और पठनीय है?
- प्रासंगिकता (Relevance): क्या उत्तर वास्तव में प्रश्न से मेल खाता है?
- विजुअल डिपेंडेंसी: क्या उत्तर के सही होने के लिए चित्र को देखना आवश्यक है?
- पत्राचार (Correspondence): क्या चित्र वास्तव में वही दिखाता है जिसके बारे में प्रश्न पूछ रहा है?
3. परिणाम: क्या यह काम करता है?
शोधकर्ताओं ने इस नई लाइब्रेरी का उपयोग करके एक छोटे रोबोट मॉडल को प्रशिक्षित किया और इसकी तुलना अन्य लोकप्रिय, अव्यवस्थित लाइब्रेरी से प्रशिक्षित मॉडल्स से की।
- स्कोरबोर्ड: FineVision पर प्रशिक्षित रोबोट ने 11 अलग-अलग टेस्ट में काफी अधिक स्कोर किया। इसने पिछले सर्वश्रेष्ठ ओपन-सोर्स लाइब्रेरी को बड़े अंतर से पीछे छोड़ दिया (प्रतिस्पर्धी के आधार पर प्रदर्शन में लगभग 11% से 38% का सुधार हुआ)।
- "चीटिंग" टेस्ट: जब उन्होंने प्रशिक्षण डेटा से कुछ बचे हुए "चीट" इमेज (डेटा जो टेस्ट से लीक हो सकता था) को हटा दिया, तो FineVision रोबोट का प्रदर्शन बहुत कम गिरा। इसके विपरीत, अन्य रोबोट्स का प्रदर्शन काफी गिर गया। यह साबित करता है कि FineVision ने रोबोट को समझना सिखाया, न कि केवल रटना।
- GUI का जादू: FineVision पर प्रशिक्षित रोबोट अन्य छोटे मॉडल्स की तुलना में कंप्यूटर स्क्रीन (बटन क्लिक करना, टाइप करना) को नेविगेट करने में भी बहुत बेहतर था, और इसने उन मॉडल्स के बराबर प्रदर्शन किया जो आकार में उससे चार गुना बड़े थे।
निष्कर्ष
पेपर का दावा है कि साफ, विविध और अच्छी तरह से व्यवस्थित डेटा ही असली सफलता का मंत्र (secret sauce) है। आपको अनिवार्य रूप से एक बड़े मॉडल या एक गुप्त डेटासेट की आवश्यकता नहीं है; आपको बस एक बेहतर लाइब्रेरी की आवश्यकता है। FineVision साबित करता है कि डेटा को साफ करके और उसे सावधानीपूर्वक व्यवस्थित करके, ओपन-सोर्स मॉडल्स अंततः बड़े, क्लोज्ड-सोर्स मॉडल्स की बराबरी कर सकते हैं।
शोधकर्ताओं ने अपनी लाइब्रेरी और डेटा को साफ करने के लिए उपयोग किए गए टूल्स को जारी कर दिया है, ताकि पूरे समुदाय को स्मार्ट और अधिक विश्वसनीय AI विजन सिस्टम बनाने में मदद मिल सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।