← नवीनतम पेपर
💻 computer science

BidirLM: From Text to Omnimodal Bidirectional Encoders by Adapting and Composing Causal LLMs

यह शोध पत्र BidirLM को प्रस्तुत करता है, जो उच्च-प्रदर्शन वाले द्विदिशीय एनकोडर्स (bidirectional encoders) का एक परिवार है, जिसे एक नवीन प्रायर मास्किंग चरण (prior masking phase), कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को रोकने के लिए लीनियर वेट मर्जिंग और डेटा मिक्सचर की एक दोहरी रणनीति, और मल्टीमॉडल क्षमताओं को निर्बाध रूप से एकीकृत करने के लिए विशिष्ट कॉज़ल मॉडल्स के साथ संयोजन के माध्यम से कॉज़ल LLMs को व्यवस्थित रूप से अनुकूलित करके बनाया गया है।

मूल लेखक: Nicolas Boizard, Théo Deschamps-Berger, Hippolyte Gisserot-Boukhlef, Céline Hudelot, Pierre Colombo

प्रकाशित 2026-04-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nicolas Boizard, Théo Deschamps-Berger, Hippolyte Gisserot-Boukhlef, Céline Hudelot, Pierre Colombo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, अत्यधिक विशिष्ट शेफ है। यह शेफ बाएं से दाएं खाना पकाने में विशेषज्ञ है। वे एक रेसिपी लिख सकते हैं, केक बेक कर सकते हैं, या स्टेप-बाय-स्टेप भोजन बना सकते हैं, लेकिन वे केवल उन सामग्रियों को देख सकते हैं जिन्हें उन्होंने पहले ही कटोरे में डाल दिया है। वे उन सामग्रियों की ओर नहीं झांक सकते जिन्हें वे बाद में डालेंगे ताकि वे अभी निर्णय ले सकें। अधिकांश आधुनिक लार्ज लैंग्वेज मॉडल्स (LLMs) इसी तरह काम करते हैं: वे कॉज़ल (आगे की ओर देखने वाले) जनरेटर हैं।

हालाँकि, एक और प्रकार का शेफ भी है: बाइडायरेक्शनल (द्विदिश) शेफ। यह शेफ एक साथ पूरे कटोरे की सामग्री को देख सकता है—जो पहले से वहां है और जो आगे आने वाली है—ताकि वह संदर्भ (context) को पूरी तरह से समझ सके। यह कार्यों के लिए बहुत अच्छा है जैसे कि किसी पैराग्राफ के बारे में प्रश्न का उत्तर देना या घास के ढेर में सुई ढूंढना (सर्च), लेकिन इन शेफों को शुरू से बनाना अविश्वसनीय रूप से महंगा और समय लेने वाला है।

समस्या:
दुनिया बेहतरीन "बाएं से दाएं" जाने वाले शेफों से भरी हुई है (गणित, कोडिंग, सुरक्षा, विजन और ऑडियो के लिए विशिष्ट मॉडल)। लेकिन हमने उन्हें "समझने" वाले कार्यों के लिए अनदेखा कर दिया क्योंकि हमें लगा कि उस "सब कुछ देखने" की क्षमता प्राप्त करने के लिए हमें नए शेफ बनाने की आवश्यकता होगी।

समाधान: BidirLM
यह पेपर एक जादुई किचन हैक पेश करता है जिसे BidirLM कहा जाता है। एक नया शेफ रखने के बजाय, वे मौजूदा "बाएं से दाएं" जाने वाले शेफों को पीछे और आगे दोनों तरफ एक साथ देखना सिखाते हैं, जिससे वे शक्तिशाली "ओम्नीडायरेक्शनल" (सर्वदिशीय) समझने वाली मशीन बन जाते हैं।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं (analogies) में विभाजित किया गया है:

1. "मास्किंग" वॉर्म-अप (महत्वपूर्ण चरण)

कई शोधकर्ताओं ने इन शेफों को पीछे देखने के लिए बस एक स्विच बदलने की कोशिश की, लेकिन यह अच्छी तरह से काम नहीं किया। पेपर ने एक गुप्त सामग्री की खोज की: मास्किंग चरण

  • उपमा: कल्पना कीजिए कि आप एक ऐसे छात्र को पढ़ा रहे हैं जो एक बार में एक पेज करके किताब पढ़ने का आदी है। यदि आप अचानक उनसे एक साथ पूरी किताब पढ़ने को कहते हैं, तो वे भ्रमित हो जाते हैं।
  • समाधान: पहले, आप टेक्स्ट में यादृच्छिक शब्दों को ढक देते हैं (मास्किंग) और उनसे पूरे वाक्य के संदर्भ का उपयोग करके उन शब्दों का अनुमान लगाने के लिए कहते हैं। यह उनके मस्तिष्क को "भविष्य" और "अतीत" को एक साथ देखने के लिए पुनर्गठित करने के लिए मजबूर करता है।
  • परिणाम: पेपर ने पाया कि इस चरण को छोड़ना एक गलती है। पूरी तस्वीर को समझने के लिए उन्हें सिखाने से पहले आपको यह "अनुमान लगाने वाला खेल" अवश्य करना चाहिए।

2. "याददाश्त खोने" की समस्या (कैटास्ट्रोफिक फॉरगेटिंग)

जब आप एक शेफ को पीछे देखने के लिए प्रशिक्षित करते हैं, तो वे अक्सर उन विशिष्ट व्यंजनों को बनाना भूल जाते हैं जिनके लिए वे मूल रूप से प्रसिद्ध थे (जैसे गणित या कोडिंग)। इसे कैटास्ट्रोफिक फॉरगेटिंग कहा जाता है।

  • उपमा: यह एक मास्टर बढ़ई को मास्टर इलेक्ट्रीशियन बनाने जैसा है। यदि आप सावधान नहीं हैं, तो वे हथौड़ा चलाना भूल सकते हैं।
  • समाधान: लेखकों ने वेट मर्जिंग (Weight Merging) नामक तकनीक का उपयोग किया।
    • कल्पना कीजिए कि आपके पास एक ही शेफ के दो संस्करण हैं: शेफ A (मूल विशेषज्ञ) और शेफ B (नया सर्वदिशीय विशेषज्ञ)।
    • एक को चुनने के बजाय, उन्होंने एक स्मूदी ब्लेंडर लिया। उन्होंने शेफ A के मस्तिष्क का 50% और शेफ B के मस्तिष्क का 50% मिला दिया।
    • परिणाम: नया शेफ मूल कौशल (गणित, कोडिंग) को बनाए रखता है और साथ ही संदर्भ को समझने की नई क्षमता भी प्राप्त करता है। उन्हें शुरू से फिर से प्रशिक्षित करने की आवश्यकता नहीं थी; उन्होंने बस ज्ञान को ब्लेंड (मिश्रित) कर दिया।

3. "स्विस आर्मी नाइफ" (ओम्नीमोडल)

पेपर केवल टेक्स्ट तक ही सीमित नहीं रहा। वे एक ऐसा शेफ बनाना चाहते थे जो टेक्स्ट, इमेज और ऑडियो तीनों को एक साथ समझ सके।

  • उपमा: आमतौर पर, खाना पकाने, पेंट करने और गाने वाला शेफ पाने के लिए, आपको तीन अलग-अलग लोगों की आवश्यकता होगी।
  • समाधान: उन्होंने अपने नए "ओम्नीडायरेक्शनल टेक्स्ट शेफ" को एक "विज़न शेफ" (जो छवियों को जानता है) और एक "ऑडियो शेफ" (जो ध्वनि को जानता है) के साथ मिला दिया।
  • परिणाम: उन्होंने BidirLM-Omni बनाया। यह एक एकल, कॉम्पैक्ट मॉडल है जो एक दस्तावेज़ पढ़ सकता है, एक तस्वीर देख सकता है और एक वॉयस रिकॉर्डिंग सुन सकता है, और इन तीनों के संदर्भ को समझ सकता है। यह एक स्विस आर्मी नाइफ की तरह है जो उन व्यक्तिगत उपकरणों जितना ही तेज है जिन्हें इसने प्रतिस्थापित किया है।

यह क्यों महत्वपूर्ण है

  • यह ओपन सोर्स है: उन्होंने इस रहस्य को छिपाकर नहीं रखा। उन्होंने रेसिपी जारी की ताकि कोई भी इसे कर सके।
  • यह कुशल है: नए मॉडलों को शुरू से प्रशिक्षित करने के लिए लाखों डॉलर खर्च करने के बजाय, आप मौजूदा, विशिष्ट मॉडलों को इस ब्लेंडिंग तकनीक का उपयोग करके मुफ्त (या बहुत सस्ते) में "अपग्रेड" कर सकते हैं।
  • यह बेहतर है: उनके नए मॉडल लगभग हर परीक्षण पर वर्तमान के सर्वश्रेष्ठ ओपन-सोर्स मॉडलों को हरा देते हैं, गणित की समस्याओं को समझने से लेकर छवियों और ध्वनियों को पहचानने तक।

संक्षेप में:
पेपर कहता है, "अपने विशिष्ट उपकरणों को फेंक न दें! हमने पाया है कि कैसे आपके मौजूदा, उच्च-प्रदर्शन वाले AI मॉडलों को लिया जाए, उन्हें एक त्वरित 'कॉन्टेक्स्ट' वर्कआउट दिया जाए, और उन्हें उनके विशिष्ट ज्ञान के साथ मिश्रित किया जाए ताकि एक सुपर-स्मार्ट, सर्वदर्शी AI बनाया जा सके जो टेक्स्ट, इमेज और साउंड को दुनिया में मौजूद किसी भी अन्य चीज़ से बेहतर समझता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →