← नवीनतम पेपर
💻 computer science

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

यह शोधपत्र जेमिनी एम्बेडिंग 2 (Gemini Embedding 2) को प्रस्तुत करता है, जो एक नेटिव मल्टीमॉडल एम्बेडिंग मॉडल है जो वीडियो, ऑडियो, इमेज और टेक्स्ट को एक एकल रिप्रजेंटेशन स्पेस में एकीकृत करता है, विविध यूनिमॉडल, क्रॉस-मोडल और मल्टीमॉडल रिट्रीवल कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करता है और विशिष्ट डोमेन में मजबूत ज़ीरो-शॉट क्षमताओं का प्रदर्शन करता है।

मूल लेखक: Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Sam
प्रकाशित 2026-05-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Samari, Kevin Poulet, Daniel Cer, Kaifeng Chen, Paul Suganathan, Hui Hui, Jovan Andonov, Philippe Schlattner, Jay Han, Iftekhar Naim, Wing Lowe, Vladimir Pchelin, Albert Yang, Yi-Ting Chen, Zhongli Ding, Grace Zhang, Georg Heigold, Yichang Chen, Antoine Reveillon, Brendan Mccloskey, Wenlei Zhou, Dahun Kim, Rui Meng, Emma Wang, Jack Zheng, Halley Fede, Zhen Yang, Keegan Mosley, Brian Potetz, Sahil Dua, Henrique Schechter Vera, Shen Gao, Hesen Zhang, Andreas Hess, Hengxuan Ying, Alberto Montes, Karan Gill, Min Choi, Sebastian Russo, Anja Hauth, Jinhyuk Lee, Michael Boratko, Megan Barnes, Vikram Rao, Claudiu Musat, Cyril Allauzen, Ehsan Variani, Shankar Kumar, Tom Bagby, Junyi Jiao, Yang Gu, Tengxin Li, Ayush Agrawal, Roberto Santana, Dev Nath, Stephen Karukas, Shuoxuan Han, Lucia Loher, Alice Twu, Nidhi Vyas, Siddharth Bhai, Frank Palma Gomez, Wangyuan Zhang, Chaoren Liu, Jizheng Yang, Steve Qiu, Shijie Zhang, Sujay Kulkarni, Sascha Rothe, Sean Nakamoto, Raphael Hoffmann, Zach Gleicher, Yunhsuan Sung, Qin Yin, Tom Duerig, Mojtaba Seyedhosseini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल पुस्तकालय है जिसमें किताबें, फिल्में, संगीत की रिकॉर्डिंग और फोटोग्राफ्स हैं। अभी, यदि आप किसी ऐसी विशिष्ट धुन को खोजना चाहते हैं जो किसी फिल्म के दृश्य जैसी लगती हो, या किसी ऐसे व्यंजन की रेसिपी खोजना चाहते हैं जो किसी फोटो से मेल खाती हो, तो आपको आमतौर पर सब कुछ पहले टेक्स्ट (शब्दों) में बदलना पड़ता है। आपको फोटो का वर्णन लिखना होगा, ऑडियो को शब्दों में बदलना होगा, और फिर सर्च करना होगा। यह एक पेंट के नाम की सूची देखकर एक विशिष्ट रंग को खोजने जैसा है; इसमें आप रंग का वास्तविक "अहसास" खो देते हैं।

Gemini Embedding 2 गूगल का नया टूल है जो खेल बदल देता है। सब कुछ टेक्स्ट में बदलने के बजाय, यह एक एकल, सार्वभौमिक "भाषा" बनाता है जहाँ चित्र, ध्वनियाँ, वीडियो और शब्द सभी एक ही बोली बोलते हैं।

यहाँ बताया गया है कि यह कैसे काम करता है और यह क्यों महत्वपूर्ण है, सरल उपमाओं का उपयोग करते हुए:

1. सार्वभौमिक अनुवादक (मूल विचार)

पुराने तरीके को अलग-अलग भाषाओं के लिए अलग-अलग डिक्शनरी रखने जैसा समझें। यदि आप एक फ्रांसीसी किताब की तुलना जर्मन फिल्म से करना चाहते थे, तो आपको दोनों को पहले अंग्रेजी में अनुवाद करना पड़ता था, जिससे अक्सर बारीकियां खो जाती थीं।

Gemini Embedding 2 एक सार्व通用 अनुवादक की तरह है जो "अर्थ" (Meaning) बोलता है।

  • यह एक वीडियो, एक गाना, एक फोटो या टेक्स्ट का एक पैराग्राफ लेता है और उन सभी को एक ही प्रकार के "ID कार्ड" (एक गणितीय वेक्टर) में बदल देता है।
  • क्योंकि वे सभी एक ही "भाषा" में हैं, मॉडल तुरंत देख सकता है कि कुत्ते के भौंकने का एक वीडियो और "एक तेज़ आवाज़ वाला कुत्ता" कहने वाला टेक्स्ट आपस में संबंधित हैं, भले ही एक ध्वनि हो और दूसरा शब्द। इसे ध्वनि को शब्दों में बदलने की आवश्यकता नहीं है; यह ध्वनि को सीधे समझता है।

2. "ऑल-इन-वन" शेफ

पिछले मॉडल उन शेफ की तरह थे जो केवल एक ही प्रकार का खाना अच्छा बना सकते थे। एक शेफ टेक्स्ट में माहिर था, दूसरा छवियों में, और एक अन्य वीडियो में। यदि आपको तीनों के साथ एक भोजन चाहिए था, तो आपको तीन अलग-अलग शेफ को काम पर रखना पड़ता था और उम्मीद करनी पड़ती थी कि वे स्वाद पर सहमत हों।

Gemini Embedding 2 एक मास्टर शेफ है जो किसी भी सामग्री को संभाल सकता है।

  • इसे कार्यों के एक विशाल मिश्रण पर प्रशिक्षित किया गया था: कोड पढ़ना, फिल्मों को समझना, ऑडियो सुनना और दस्तावेजों का विश्लेषण करना।
  • क्योंकि इसने इस विशाल विविधता से सीखा है, इसलिए जब आप सामग्रियों को मिलाते हैं तो यह भ्रमित नहीं होता है। आप एक फोटो और एक वाक्य के मिश्रण का उपयोग करके एक वीडियो क्लिप खोजने के लिए कह सकते हैं, और यह उस संयोजन को पूरी तरह से समझ लेता है।

3. "ज़ीरो-शॉट" सुपरपावर

आमतौर पर, यदि आप चाहते हैं कि कंप्यूटर किसी बहुत विशिष्ट विषय (जैसे खगोल विज्ञान या खाना बनाना) को समझे, तो आपको इसे विशेष रूप से उस विषय के लिए पढ़ाना पड़ता है। यह एक छात्र को केवल सौर मंडल के बारे में पढ़ाने के लिए एक ट्यूटर रखने जैसा है।

Gemini Embedding 2 एक ऐसे छात्र की तरह है जो पहले से ही हर चीज़ में विशेषज्ञ है।

  • पेपर दिखाता है कि यह मॉडल बिना किसी अतिरिक्त प्रशिक्षण के माइक्रोस्कोपी (जीव विज्ञान), खगोल विज्ञान, ललित कला (Fine Art) और खाना पकाने जैसे विशिष्ट विषयों पर अविश्वसनीय रूप से अच्छा काम करता है।
  • यह "आउट-ऑफ-द-बॉक्स" तैयार है। यदि आप इसे स्टार चार्ट या जटिल रेसिपी की तस्वीर दिखाते हैं, तो यह तुरंत उन विशिष्ट मॉडलों की तुलना में संदर्भ को बेहतर ढंग से समझ लेता है जो केवल उनमें से किसी एक के लिए प्रशिक्षित थे।

4. ऑडियो ब्रेकथ्रू (ट्रांसक्रिप्शन की अब ज़रूरत नहीं)

ऑडियो के साथ सर्च करने की सबसे बड़ी समस्याओं में से एक यह है कि कंप्यूटरों को आमतौर पर सर्च करने से पहले ऑडियो को "पढ़ना" (भाषण को टेक्स्ट में बदलना) पड़ता है। यह लिरिक्स (बोल) पढ़कर गाना खोजने जैसा है, लेकिन यदि गायक अस्पष्ट बोल रहा है या उसका लहजा (accent) बहुत अलग है, तो कंप्यूटर लिरिक्स को गलत समझ लेता है और आप गाना कभी नहीं ढूंढ पाते।

Gemini Embedding 2 बीच के माध्यम (middleman) को छोड़ देता है।

  • यह सीधे कच्ची ध्वनि (raw sound) को सुनता है। यह आवाज के लहजे, पिच और भावना को समझता है, न कि केवल शब्दों को।
  • पेपर ने पाया कि ट्रांसक्राइब किए गए टेक्स्ट की तुलना में कच्चे ऑडियो के साथ सर्च करना बहुत अधिक सटीक है। यह भीड़ में अपने दोस्त की आवाज़ को पहचानने जैसा है, बिना यह सुने कि वे क्या कह रहे हैं।

5. इसे कैसे बनाया गया (ट्रेनिंग रेसिपी)

इस "सार्वभौमिक अनुवादक" को बनाने के लिए, टीम ने इसे एक समय में एक चीज़ नहीं सिखाई। उन्होंने तीन-चरणीय कुकिंग प्रक्रिया का उपयोग किया:

  1. प्री-फाइन-ट्यूनिंग (Pre-Fine-Tuning): उन्होंने मॉडल को डेटा का एक विशाल, अव्यवस्थित ढेर दिया (टेक्स्ट, कोड, इमेज) ताकि इसे जानकारी को "एनकोड" करने के विचार से परिचित कराया जा सके।
  2. फाइन-ट्यूनिंग (Fine-Tuning): उन्होंने इसे चीजों को आपस में मिलाने के बहुत विशिष्ट, उच्च-गुणवत्ता वाले उदाहरण दिए (जैसे एक प्रश्न को उत्तर से, या एक वीडियो को विवरण से मिलाना)।
  3. मॉडल सूपिंग (Model Souping): यह एक चतुर तकनीक है जहाँ उन्होंने प्रशिक्षित मॉडल के कई अलग-अलग संस्करणों को लिया और उन्हें आपस में "मिश्रित" किया, जैसे कि सही स्वाद पाने के लिए सूप के विभिन्न बैचों को मिलाना। इसने अंतिम मॉडल को अधिक स्थिर बनाया और इसे एक साथ विभिन्न प्रकार के कार्यों को संभालने में बेहतर बनाया।

निचोड़

Gemini Embedding 2 एक शक्तिशाली नया इंजन है जो कंप्यूटर को दुनिया को वैसे ही समझने की अनुमति देता है जैसे इंसान समझते हैं: सब कुछ देखते, सुनते और पढ़ते हुए एक जुड़े हुए पूर्ण (connected whole) के रूप में। चाहे आप टेक्स्ट विवरण का उपयोग करके वीडियो के एक विशिष्ट क्षण को खोज रहे हों, गुनगुनाई हुई धुन के आधार पर एक गाना ढूंढ रहे हों, या ऐसे दस्तावेज़ को खोज रहे हों जिसमें चार्ट और टेक्स्ट शामिल हों, यह मॉडल यह सब एक एकीकृत स्थान में करता है, और अक्सर उन विशिष्ट उपकरणों से बेहतर करता है जो केवल उन्हीं में से किसी एक काम के लिए डिज़ाइन किए गए थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →