← नवीनतम पेपर
🤖 machine learning

RePercENT: Scaling Disentangled Representation Learning Beyond Two Modalities

RePercENT एक स्व-पर्यवेक्षित (self-supervised), प्लग-एंड-प्ले फ्रेमवर्क है जो संयुक्त पूर्व-प्रशिक्षण (joint pre-training) की आवश्यकता के बिना पूर्व-निकाले गए एम्बेडिंग्स पर कार्य करके दो से अधिक मोडैलिटीज में विलगित प्रतिनिधित्व शिक्षण (disentangled representation learning) को सक्षम करने के लिए मौजूदा विधियों की स्केलेबिलिटी सीमाओं को दूर करता है।

मूल लेखक: Vasiliki Rizou, Pascal Frossard, Dorina Thanou

प्रकाशित 2026-06-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vasiliki Rizou, Pascal Frossard, Dorina Thanou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप तीन अलग-अलग दोस्तों द्वारा सुनाई जा रही एक जटिल कहानी को समझने की कोशिश कर रहे हैं: एक केवल चित्रों में बोलता है, एक संगीत में, और एक टेक्स्ट (लेख) में। लंबे समय से, AI शोधकर्ता इन दोस्तों को एक ही मिश्रित सारांश में जबरदस्ती डालकर उन्हें "सहमत" करने की कोशिश कर रहे हैं। यह तब तो अच्छा काम करता है जब वे सब बिल्कुल एक ही बात कह रहे हों, लेकिन यह तब विफल हो जाता है जब उनके पास ऐसे अनूठे रहस्य होते हैं जो दूसरों को नहीं पता होते।

यह शोध पत्र एक नई विधि पेश करता है जिसे RePercENT (रिड्यूस्ड-कॉम्प्लेक्सिटी पर्सिवर-बेस्ड डिसेंटैंगलमेंट) कहा जाता है, ताकि इस समस्या को हल किया जा सके। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से यहाँ समझाया गया है:

समस्या: "स्मूदी" बनाम "सलाद"

अधिकांश वर्तमान AI मॉडल मल्टीमॉडल डेटा के साथ एक स्मूदी की तरह व्यवहार करते हैं। वे इमेज, टेक्स्ट और ऑडियो को आपस में इस तरह मिला देते हैं कि आप यह पहचान ही नहीं पाते कि एक सामग्री कहाँ समाप्त होती है और दूसरी कहाँ शुरू होती है। यह सामान्य समझ के लिए तो बढ़िया है, लेकिन यदि आप यह जानना चाहते हैं कि संगीत ने वह क्या योगदान दिया जो टेक्स्ट ने नहीं दिया, तो आप उसे अलग नहीं कर सकते।

इसके अलावा, मौजूदा विधियाँ एक दो-व्यक्ति नृत्य की तरह हैं। वे दो दोस्तों (जैसे, इमेज और टेक्स्ट) के बीच के कदमों को समझने में माहिर हैं, लेकिन यदि आप एक तीसरा दोस्त (जैसे, मॉलिक्यूलर डेटा) जोड़ देते हैं, तो डांस फ्लोर बहुत भीड़भाड़ वाला हो जाता है, और गणित को हल करना असंभव हो जाता है।

समाधान: "स्मार्ट सॉर्टिंग हैट" (बुद्धिमान छँटाई टोपी)

RePercENT एक स्मार्ट सॉर्टिंग हैट की तरह कार्य करता है जो बिना घबराए पूरे समूह को एक साथ संभाल सकता है। सब कुछ एक स्मूदी में मिलाने के बजाय, यह एक सलाद बनाता है जहाँ हर सामग्री अपनी पहचान बनाए रखती है लेकिन फिर भी एक ही व्यंजन का हिस्सा होती है।

यहाँ बताया गया है कि यह जादू कैसे करता है:

  1. "प्लग-एंड-प्ले" किचन:
    कल्पना कीजिए कि आपके पास पहले से ही कटे हुए सब्जियाँ हैं (ये CLIP जैसे शक्तिशाली AI मॉडलों से प्राप्त "एम्बेडिंग्स" हैं)। RePercENT को खुद सब्जियाँ काटने या खाना बनाना सीखने की आवश्यकता नहीं है। यह बस इन पहले से तैयार किए गए अवयवों को लेता है और उन्हें छाँटता है। इसका मतलब है कि यह किसी भी प्रकार के डेटा (इमेज, टेक्स्ट, मेडिकल स्कैन) के साथ काम कर सकता है बिना इसे शुरुआत से फिर से प्रशिक्षित किए।

  2. "पेयरवाइज" रणनीति (सीक्रेट सॉस):
    सबसे बड़ी बाधा यह थी कि 3 दोस्तों के साथ, उनके बीच बातचीत के कई तरीके होते हैं (A+B, B+C, A+C, और A+B+C)। इस सब को एक साथ मैप करने की कोशिश करना हेडफ़ोन की एक उलझी हुई गांठ को सुलझाने जैसा है।
    RePercENT इसे जोड़ों (pairs) को देखकर हल करता है। यह पूछता है: "दोस्त A, दोस्त B के साथ क्या साझा करता है?" और "दोस्त A अपने पास क्या रखता है?" यह हर जोड़े के लिए व्यक्तिगत रूप से ऐसा करता है।

  • उपमा: एक पूरे ऑर्केस्ट्रा को एक साथ व्यवस्थित करने के बजाय, कंडक्टर वायलिन सेक्शन को सुनता है, फिर ब्रास सेक्शन को, फिर वुडविंड्स को, यह समझने के लिए कि वे मिलकर क्या बजाते हैं और वे अकेले क्या बजाते हैं। यह काम को सरल और स्केलेबल रखता है, चाहे आप कितने भी वाद्य यंत्र जोड़ दें।
  1. "प्रतियोगिता" का खेल:
    सिस्टम के भीतर, छोटे "स्लॉट्स" (सोचिए कि ये खाली बाल्टियाँ हैं) होते हैं। सिस्टम एक विशेष खेल का उपयोग करता है जिसे ग्रुप स्लॉट अटेंशन कहा जाता है।
  • कल्पना कीजिए कि दो बाल्टियाँ हैं जिन पर "साझा रहस्य" (Shared Secret) और "मेरा अपना रहस्य" (My Own Secret) लिखा है।
  • जब जानकारी आती है, तो ये दोनों बाल्टियाँ उसे पकड़ने के लिए प्रतिस्पर्धा करती हैं।
  • यदि जानकारी ऐसी है जो दोनों दोस्त जानते हैं, तो "साझा" बाल्टी जीत जाती है। यदि वह कुछ ऐसा है जो केवल एक दोस्त जानता है, तो "अपना रहस्य" बाल्टी जीत जाती है।
  • यह प्रतिस्पर्धा सुनिश्चित करती है कि AI आलसी न हो जाए और सब कुछ एक ही बाल्टी में न डाल दे; यह उसे सटीक होने के लिए मजबूर करती है।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

  • यह स्केल करता है: आप अधिक दोस्तों (मोडालिटीज) को जोड़ सकते हैं बिना सिस्टम के क्रैश हुए या इसके महंगा हुए। यह रैखिक रूप से बढ़ता है (एक और दोस्त जोड़ने से काम का एक अनुमानित हिस्सा बढ़ता है), जबकि पुराने तरीके घातीय (exponentially) रूप से बढ़ते थे (एक दोस्त जोड़ने से गणित विस्फोट जैसा हो जाता था)।
  • यह गायब दोस्तों को भी संभालता है: यदि कोई दोस्त पार्टी में देर से आता है (मिसिंग डेटा), तो सिस्टम टूटता नहीं है। क्योंकि इसने जोड़ों के आधार पर जानकारी को छाँटना सीखा है, इसलिए यह उन दोस्तों के "साझा" और "अद्वितीय" हिस्सों को अभी भी समझ सकता है जो वहाँ मौजूद हैं।
  • यह वास्तविक जीवन में काम करता है: लेखकों ने इसका परीक्षण किया:
    • आलंकारिक भाषा (Figurative Language): मुहावरों और रूपकों को समझना (जैसे, "It's raining cats and dogs")। उन्होंने पाया कि "साझा" अर्थ को "अद्वितीय" दृश्य विवरणों से अलग करने से AI को इन कठिन वाक्यांशों को मानक मॉडलों की तुलना में बेहतर समझने में मदद मिली।
    • मेडिकल ऑन्कोलॉजी: उन्होंने इसका उपयोग कैंसर डेटा (टिश्यू स्लाइड्स की इमेज, मॉलिक्यूलर डेटा और पेशेंट रिकॉर्ड) पर किया। उन्होंने पाया कि मॉलिक्यूलर डेटा से जो अद्वितीय है उसे इमेज के साथ साझा की गई चीज़ों से अलग करके, वे कैंसर के प्रकारों की अधिक सटीक भविष्यवाणी कर सके, खासकर उन कठिन मामलों में जहाँ कच्चा डेटा भ्रमित करने वाला था।

निचोड़

RePercENT चीजों को गंदे मिश्रण में मिलाए बिना, कई सूचना स्रोतों को सुनने के लिए AI को सिखाने का एक नया तरीका है। यह एक चतुर "जोड़ी-दर-जोड़ी" छँटाई प्रणाली का उपयोग करता है जो कुशल है, डेटा गायब होने पर भी मजबूत है, और गणितीय रूप से सिद्ध है कि यह साझा और अद्वितीय के बीच का सर्वोत्तम अलगाव ढूंढ सकता है। यह सूचना की उलझी हुई गांठ को स्पष्ट, अलग और समझने योग्य टुकड़ों के एक व्यवस्थित सेट में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →