Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini
यह शोधपत्र जेमिनी एम्बेडिंग 2 (Gemini Embedding 2) को प्रस्तुत करता है, जो एक नेटिव मल्टीमॉडल एम्बेडिंग मॉडल है जो वीडियो, ऑडियो, इमेज और टेक्स्ट को एक एकल रिप्रजेंटेशन स्पेस में एकीकृत करता है, विविध यूनिमॉडल, क्रॉस-मोडल और मल्टीमॉडल रिट्रीवल कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करता है और विशिष्ट डोमेन में मजबूत ज़ीरो-शॉट क्षमताओं का प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल पुस्तकालय है जिसमें किताबें, फिल्में, संगीत की रिकॉर्डिंग और फोटोग्राफ्स हैं। अभी, यदि आप किसी ऐसी विशिष्ट धुन को खोजना चाहते हैं जो किसी फिल्म के दृश्य जैसी लगती हो, या किसी ऐसे व्यंजन की रेसिपी खोजना चाहते हैं जो किसी फोटो से मेल खाती हो, तो आपको आमतौर पर सब कुछ पहले टेक्स्ट (शब्दों) में बदलना पड़ता है। आपको फोटो का वर्णन लिखना होगा, ऑडियो को शब्दों में बदलना होगा, और फिर सर्च करना होगा। यह एक पेंट के नाम की सूची देखकर एक विशिष्ट रंग को खोजने जैसा है; इसमें आप रंग का वास्तविक "अहसास" खो देते हैं।
Gemini Embedding 2 गूगल का नया टूल है जो खेल बदल देता है। सब कुछ टेक्स्ट में बदलने के बजाय, यह एक एकल, सार्वभौमिक "भाषा" बनाता है जहाँ चित्र, ध्वनियाँ, वीडियो और शब्द सभी एक ही बोली बोलते हैं।
यहाँ बताया गया है कि यह कैसे काम करता है और यह क्यों महत्वपूर्ण है, सरल उपमाओं का उपयोग करते हुए:
1. सार्वभौमिक अनुवादक (मूल विचार)
पुराने तरीके को अलग-अलग भाषाओं के लिए अलग-अलग डिक्शनरी रखने जैसा समझें। यदि आप एक फ्रांसीसी किताब की तुलना जर्मन फिल्म से करना चाहते थे, तो आपको दोनों को पहले अंग्रेजी में अनुवाद करना पड़ता था, जिससे अक्सर बारीकियां खो जाती थीं।
Gemini Embedding 2 एक सार्व通用 अनुवादक की तरह है जो "अर्थ" (Meaning) बोलता है।
- यह एक वीडियो, एक गाना, एक फोटो या टेक्स्ट का एक पैराग्राफ लेता है और उन सभी को एक ही प्रकार के "ID कार्ड" (एक गणितीय वेक्टर) में बदल देता है।
- क्योंकि वे सभी एक ही "भाषा" में हैं, मॉडल तुरंत देख सकता है कि कुत्ते के भौंकने का एक वीडियो और "एक तेज़ आवाज़ वाला कुत्ता" कहने वाला टेक्स्ट आपस में संबंधित हैं, भले ही एक ध्वनि हो और दूसरा शब्द। इसे ध्वनि को शब्दों में बदलने की आवश्यकता नहीं है; यह ध्वनि को सीधे समझता है।
2. "ऑल-इन-वन" शेफ
पिछले मॉडल उन शेफ की तरह थे जो केवल एक ही प्रकार का खाना अच्छा बना सकते थे। एक शेफ टेक्स्ट में माहिर था, दूसरा छवियों में, और एक अन्य वीडियो में। यदि आपको तीनों के साथ एक भोजन चाहिए था, तो आपको तीन अलग-अलग शेफ को काम पर रखना पड़ता था और उम्मीद करनी पड़ती थी कि वे स्वाद पर सहमत हों।
Gemini Embedding 2 एक मास्टर शेफ है जो किसी भी सामग्री को संभाल सकता है।
- इसे कार्यों के एक विशाल मिश्रण पर प्रशिक्षित किया गया था: कोड पढ़ना, फिल्मों को समझना, ऑडियो सुनना और दस्तावेजों का विश्लेषण करना।
- क्योंकि इसने इस विशाल विविधता से सीखा है, इसलिए जब आप सामग्रियों को मिलाते हैं तो यह भ्रमित नहीं होता है। आप एक फोटो और एक वाक्य के मिश्रण का उपयोग करके एक वीडियो क्लिप खोजने के लिए कह सकते हैं, और यह उस संयोजन को पूरी तरह से समझ लेता है।
3. "ज़ीरो-शॉट" सुपरपावर
आमतौर पर, यदि आप चाहते हैं कि कंप्यूटर किसी बहुत विशिष्ट विषय (जैसे खगोल विज्ञान या खाना बनाना) को समझे, तो आपको इसे विशेष रूप से उस विषय के लिए पढ़ाना पड़ता है। यह एक छात्र को केवल सौर मंडल के बारे में पढ़ाने के लिए एक ट्यूटर रखने जैसा है।
Gemini Embedding 2 एक ऐसे छात्र की तरह है जो पहले से ही हर चीज़ में विशेषज्ञ है।
- पेपर दिखाता है कि यह मॉडल बिना किसी अतिरिक्त प्रशिक्षण के माइक्रोस्कोपी (जीव विज्ञान), खगोल विज्ञान, ललित कला (Fine Art) और खाना पकाने जैसे विशिष्ट विषयों पर अविश्वसनीय रूप से अच्छा काम करता है।
- यह "आउट-ऑफ-द-बॉक्स" तैयार है। यदि आप इसे स्टार चार्ट या जटिल रेसिपी की तस्वीर दिखाते हैं, तो यह तुरंत उन विशिष्ट मॉडलों की तुलना में संदर्भ को बेहतर ढंग से समझ लेता है जो केवल उनमें से किसी एक के लिए प्रशिक्षित थे।
4. ऑडियो ब्रेकथ्रू (ट्रांसक्रिप्शन की अब ज़रूरत नहीं)
ऑडियो के साथ सर्च करने की सबसे बड़ी समस्याओं में से एक यह है कि कंप्यूटरों को आमतौर पर सर्च करने से पहले ऑडियो को "पढ़ना" (भाषण को टेक्स्ट में बदलना) पड़ता है। यह लिरिक्स (बोल) पढ़कर गाना खोजने जैसा है, लेकिन यदि गायक अस्पष्ट बोल रहा है या उसका लहजा (accent) बहुत अलग है, तो कंप्यूटर लिरिक्स को गलत समझ लेता है और आप गाना कभी नहीं ढूंढ पाते।
Gemini Embedding 2 बीच के माध्यम (middleman) को छोड़ देता है।
- यह सीधे कच्ची ध्वनि (raw sound) को सुनता है। यह आवाज के लहजे, पिच और भावना को समझता है, न कि केवल शब्दों को।
- पेपर ने पाया कि ट्रांसक्राइब किए गए टेक्स्ट की तुलना में कच्चे ऑडियो के साथ सर्च करना बहुत अधिक सटीक है। यह भीड़ में अपने दोस्त की आवाज़ को पहचानने जैसा है, बिना यह सुने कि वे क्या कह रहे हैं।
5. इसे कैसे बनाया गया (ट्रेनिंग रेसिपी)
इस "सार्वभौमिक अनुवादक" को बनाने के लिए, टीम ने इसे एक समय में एक चीज़ नहीं सिखाई। उन्होंने तीन-चरणीय कुकिंग प्रक्रिया का उपयोग किया:
- प्री-फाइन-ट्यूनिंग (Pre-Fine-Tuning): उन्होंने मॉडल को डेटा का एक विशाल, अव्यवस्थित ढेर दिया (टेक्स्ट, कोड, इमेज) ताकि इसे जानकारी को "एनकोड" करने के विचार से परिचित कराया जा सके।
- फाइन-ट्यूनिंग (Fine-Tuning): उन्होंने इसे चीजों को आपस में मिलाने के बहुत विशिष्ट, उच्च-गुणवत्ता वाले उदाहरण दिए (जैसे एक प्रश्न को उत्तर से, या एक वीडियो को विवरण से मिलाना)।
- मॉडल सूपिंग (Model Souping): यह एक चतुर तकनीक है जहाँ उन्होंने प्रशिक्षित मॉडल के कई अलग-अलग संस्करणों को लिया और उन्हें आपस में "मिश्रित" किया, जैसे कि सही स्वाद पाने के लिए सूप के विभिन्न बैचों को मिलाना। इसने अंतिम मॉडल को अधिक स्थिर बनाया और इसे एक साथ विभिन्न प्रकार के कार्यों को संभालने में बेहतर बनाया।
निचोड़
Gemini Embedding 2 एक शक्तिशाली नया इंजन है जो कंप्यूटर को दुनिया को वैसे ही समझने की अनुमति देता है जैसे इंसान समझते हैं: सब कुछ देखते, सुनते और पढ़ते हुए एक जुड़े हुए पूर्ण (connected whole) के रूप में। चाहे आप टेक्स्ट विवरण का उपयोग करके वीडियो के एक विशिष्ट क्षण को खोज रहे हों, गुनगुनाई हुई धुन के आधार पर एक गाना ढूंढ रहे हों, या ऐसे दस्तावेज़ को खोज रहे हों जिसमें चार्ट और टेक्स्ट शामिल हों, यह मॉडल यह सब एक एकीकृत स्थान में करता है, और अक्सर उन विशिष्ट उपकरणों से बेहतर करता है जो केवल उन्हीं में से किसी एक काम के लिए डिज़ाइन किए गए थे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।