← नवीनतम पेपर
💬 NLP

PolyFrame at MWE-2026 AdMIRe 2: When Words Are Not Enough: Multimodal Idiom Disambiguation

PolyFrame सिस्टम MWE-2026 AdMIRe2 साझा कार्य में मल्टीमॉडल मुहावरा विसंकेतन (multimodal idiom disambiguation) की चुनौती को संबोधित करने के लिए फ्रोजन CLIP और BGE M3 एनकोडर द्वारा संवर्धित एक एकीकृत पाइपलाइन का उपयोग करता है, जिसमें इडियम-अवेयर पैराफ्रेसिंग और सेंटेंस-टाइप प्रेडिक्शन जैसे हल्के मॉड्यूल शामिल हैं, जो बड़े मॉडलों को फाइन-ट्यून किए बिना महत्वपूर्ण प्रदर्शन लाभ और मजबूत ज़ीरो-शॉट बहुभाषी स्थानांतरण प्राप्त करते हैं।

मूल लेखक: Nina Hosseini-Kivanani

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nina Hosseini-Kivanani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मानव भाषा समझना सिखाने की कोशिश कर रहे हैं, विशेष रूप से उन पेचीदा हिस्सों को जहाँ शब्दों का अर्थ वह नहीं होता जो वे कहते हैं।

समस्या: "शाब्दिक" रोबोट (The "Literal" Robot)

एक मानक AI मॉडल के बारे में सोचें जो एक बहुत ही बुद्धिमान, लेकिन अत्यंत शाब्दिक (literal) रोबोट शेफ की तरह है। यदि आप उसे कहते हैं, "It's raining cats and dogs" (बिल्ली और कुत्तों की बारिश हो रही है), तो वह तुरंत आसमान से गिरती हुई बिल्लियों और कुत्तों की तलाश करने लगता है। उसे मजाक समझ नहीं आता क्योंकि वह हर शब्द को उसके वास्तविक अर्थ में लेता है।

वास्तविक दुनिया में, इसे मुहावरा (idiom) कहा जाता है। मुहावरे वे वाक्यांश हैं जहाँ अर्थ छिपा होता है (जैसे "break a leg" का अर्थ "गुड लक" है, न कि वास्तव में हड्डी तोड़ना)। यह एक भाषा में भी काफी कठिन है, लेकिन कल्पना कीजिए कि आपको एक साथ 15 अलग-अलग भाषाओं में ऐसा करना है, और साथ ही यह भी देखना है कि क्या वे चित्रों से मेल खाते हैं। यही AdMIRe 2 प्रतियोगिता की चुनौती थी।

समाधान: "पॉलीफ्रेम" टीम (The "PolyFrame" Team)

शोधकर्ताओं ने (नीना होसेइनी-किवानानी के नेतृत्व में) PolyFrame नामक एक सिस्टम बनाया। रोबोट के पूरे मस्तिष्क को फिर से प्रशिक्षित करने के बजाय (जो महंगा और धीमा है), उन्होंने एक चतुर "अनुवादक" (translator) और "फ़िल्टर" (filter) सिस्टम बनाया जो रोबट के सामने बैठता है।

यहाँ बताया गया है कि उनका सिस्टम, एक सरल उपमा का उपयोग करते हुए, चरण-दर-चरण कैसे काम करता है:

1. जासूस (वाक्य का प्रकार पहचानना - Sentence Typing)

सबसे पहले, सिस्टम एक जासूस की तरह कार्य करता है। यह वाक्य को पढ़ता है और पूछता है: "क्या यह व्यक्ति शाब्दिक रूप से बोल रहा है, या वे रूपक (metaphor) का उपयोग कर रहे हैं?"

  • यदि यह शाब्दिक है: "I saw a big fish in the pond." (मैंने तालाब में एक बड़ी मछली देखी।) -> सिस्टम कहता है, "ठीक है, मुझे एक असली मछली की तस्वीर दिखाओ।"
  • यदि यह मुहावरेदार है: "He is a big fish in a small company." (वह एक छोटी कंपनी में बड़ा आदमी है।) -> सिस्टम कहता है, "आह, यह मछलियों के बारे में नहीं है! यह एक शक्तिशाली व्यक्ति के बारे में है।"

2. अनुवादक (मुहावरे का पुनर्लेखन - Idiom Rewriting)

यह सबसे महत्वपूर्ण ट्रिक है। यदि जासूस एक मुहावरे को पकड़ लेता है, तो सिस्टम केवल अनुमान नहीं लगाता; वह वाक्य को फिर से लिखता है ताकि रोबोट समझ सके।

  • मूल: "He is a big fish." (वह एक बड़ी मछली है।)
  • रोबोट के लिए पुनर्लिखित: "He is a very important person." (वह एक बहुत महत्वपूर्ण व्यक्ति है।)
    रोबोट के लिए भ्रमित करने वाले मुहावरे को एक स्पष्ट, शाब्दिक विवरण से बदलकर, सिस्टम अंततः उसे यह समझने में मदद करता है कि उसे क्या खोजना है। यह रोबोट को पहेली सुलझाने से ठीक पहले एक शब्दकोश की परिभाषा देने जैसा है।

3. दोहरा जाँच (बहु-आयामी स्कोरिंग - Multimodal Scoring)

सिस्टम केवल सोचने के एक तरीके पर निर्भर नहीं रहता। यह समस्या को देखने के लिए तीन अलग-अलग "आंखों" का उपयोग करता है:

  • आंख 1 (दृष्टि - Vision): यह वाक्य की सीधे चित्रों से तुलना करता है।
  • आंख 2 (पाठ - Text): यह वाक्य की चित्रों के कैप्शन (विवरण) से तुलना करता है।
  • आंख 3 (हाइब्रिड - Hybrid): यह दोनों का मिश्रण उपयोग करता है।

4. निर्णायक (बोर्डा फ्यूजन - Borda Fusion)

अंत में, सिस्टम एक स्पोर्ट्स जज की तरह कार्य करता है। प्रत्येक "आंख" चित्रों की रैंकिंग देती है (प्रथम स्थान, द्वितीय स्थान, आदि)। सिस्टम इन रैंकिंग को बोर्डा काउंट (Borda Count) नामक वोटिंग पद्धति का उपयोग करके जोड़ता है। यह केवल एक आंख के विजेता को नहीं चुनता; यह निर्णय लेने के लिए समग्र सहमति (consensus) को देखता है कि कौन सा चित्र सबसे अच्छा मिलान है।

परिणाम: यह क्यों काम किया

शोधकर्ताओं ने एक बुनियादी रोबोट के साथ शुरुआत की जिसने परीक्षण पर केवल 6.7% उत्तर सही दिए। मुहावरों के मामले में यह बहुत खराब था।

अपना "जासूस" और "अनुवादक" चरण जोड़ने के बाद:

  • अंग्रेजी में सटीकता बढ़कर 60% हो गई।
  • यह बिना किसी अतिरिक्त प्रशिक्षण के पुर्तगाली में भी उतना ही अच्छा काम करता है (Zero-Shot), जो यह साबित करता है कि सिस्टम सामान्यीकरण (generalize) करने में सक्षम था।
  • 15 भाषाओं वाली अंतिम प्रतियोगिता में, उन्होंने ठोस परिणाम प्राप्त किए, जिससे यह सिद्ध हुआ कि आपको इसे हल करने के लिए किसी विशाल, महंगे सुपरकंप्यूटर की आवश्यकता नहीं है; आपको बस प्रश्न को पेश करने का एक स्मार्ट तरीका चाहिए।

मुख्य निष्कर्ष (The Big Takeaway)

पेपर का मुख्य सबक यह है कि आपको रोबोट को सब कुछ शुरू से सिखाने की आवश्यकता नहीं है। इसके बजाय, आप उसे थोड़ा सा सहयोग देकर भ्रमित करने वाली मानवीय शब्दावली को स्पष्ट, शाब्दिक भाषा में अनुवादित कर सकते हैं।

इसे इस तरह सोचें: यदि आप किसी विदेशी को एक जटिल चुटकुले को समझाना चाहते हैं, तो आप उनके मस्तिष्क की पूरी भाषा सेटिंग्स को नहीं बदलते हैं। आप बस कहते हैं, "इस चुटकुले का वास्तविक अर्थ यह है," और फिर उन्हें हंसने देते हैं। PolyFrame बिल्कुल यही करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →