← नवीनतम पेपर
🤖 AI

CodeMMR: Bridging Natural Language, Code, and Image for Unified Retrieval

यह शोध पत्र CodeMMR पेश करता है, जो एक एकीकृत रिट्रीवल मॉडल और इसका साथ देने वाला MMCoIR बेंचमार्क है, जो प्राकृतिक भाषा, कोड और छवियों को संयुक्त रूप से एम्बेड करके कोड सर्च के अंतर को पाटता है ताकि मौजूदा टेक्स्ट-केंद्रित बेसलाइन से बेहतर प्रदर्शन किया जा सके और अगली पीढ़ी के इंटेलिजेंट प्रोग्रामिंग सिस्टम के लिए रिट्रीवल-ऑगमेंटेड जनरेशन को बढ़ाया जा सके।

मूल लेखक: Jiahui Geng, Qing Li, Fengyu Cai, Fakhri Karray

प्रकाशित 2026-04-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiahui Geng, Qing Li, Fengyu Cai, Fakhri Karray

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो उस डिश को फिर से बनाने की कोशिश कर रहे हैं जिसे आपने किसी फूड ब्लॉग पर देखा था। आपके पास रेसिपी (कोड) है, तैयार भोजन की तस्वीर (इमेज) है, और स्वाद का विवरण (प्राकृतिक भाषा) है।

सॉफ्टवेयर डेवलपमेंट की दुनिया में, प्रोग्रामर्स हर दिन इसी तरह की चुनौती का सामना करते हैं। उन्हें ऐसा कोड खोजना होता है जो एक विशिष्ट दृश्य परिणाम (visual result) से मेल खाता हो, या एक ऐसी तस्वीर ढूंढनी होती है जो कोड के एक ब्लॉक से मेल खाती हो। लेकिन अब तक, कोड के लिए "सर्च इंजन" ऐसे शेफ की तरह थे जो केवल रेसिपी पढ़ सकते थे लेकिन फोटो देख नहीं सकते थे या विवरण समझ नहीं सकते थे। वे केवल टेक्स्ट तक सीमित थे, उस विजुअल जादू को मिस कर रहे थे जो सॉफ्टवेयर को काम करने के योग्य बनाता है।

यह पेपर एक नया सिस्टम पेश करता है जिसे CodeMMR कहा जाता है और एक नया "टेस्ट किचन" जिसे MMCoIR कहा जाता है ताकि इस समस्या को ठीक किया जा सके। यहाँ इसका सरल विवरण दिया गया है:

1. समस्या: "अंधा" सर्च इंजन

वर्तमान में, यदि कोई डेवलपर एक विशिष्ट चार्ट बनाने या वेबसाइट लेआउट बनाने वाला कोड खोजना चाहता है, तो उसे शब्दों में इसका वर्णन करना पड़ता है। लेकिन कोड केवल शब्द नहीं है; यह टेक्स्ट, लॉजिक और विजुअल्स का मिश्रण है।

  • पुराना तरीका: यह एक संग्रहालय में किसी विशिष्ट पेंटिंग को खोजने की कोशिश करने जैसा है जहाँ आप केवल अपने दिमाग में रंगों का वर्णन कर सकते हैं, बिना तस्वीर दिखाए या कैनवास की ओर इशारा किए।
  • अंतराल (The Gap): मौजूदा टूल्स विजुअल हिस्से को अनदेखा करते हैं। वे यह नहीं समझते कि पायथन (Python) का एक टुकड़ा वास्तव में एक तस्वीर है जो अभी खींची जानी बाकी है।

2. समाधान: "यूनिवर्सल ट्रांसलेटर" (CodeMMR)

लेखकों ने CodeMMR बनाया है, जो एक सुपर-स्मार्ट AI मॉडल है जो एक यूनिवर्सल ट्रांसलेटर के रूप में कार्य करता है।

  • उपमा (Analogy): कल्पना कीजिए कि एक लाइब्रेरियन है जो तीन भाषाएँ धाराप्रवाह बोलता है: अंग्रेजी (प्राकृतिक भाषा), पायथन/HTML (कोड), और सांकेतिक भाषा (इमेज)।
  • यह कैसे काम करता है: इन तीनों को अलग-अलग चीजों के रूप में मानने के बजाय, CodeMMR इन सभी को एक ही "गुप्त भाषा" (एक साझा सिमेंटिक स्पेस) में अनुवादित करता है। इस स्पेस में, टेक्स्ट "एक नीला गोला" और नीले गोले की इमेज और कोड draw_circle(color='blue') तीनों का सटीक एक ही अर्थ होता है।
  • जादू: क्योंकि वे सभी एक ही "गुप्त भाषा" बोल रहे हैं, इसलिए आप कोड का उपयोग करके एक तस्वीर मांग सकते हैं, या एक तस्वीर का उपयोग करके कोड मांग सकते हैं, और सिस्टम इसे पूरी तरह से समझ जाता है।

3. टेस्ट किचन: MMCoIR

यह सिद्ध करने के लिए कि उनका नया ट्रांसलेटर काम करता है, टीम ने MMCoIR बनाया।

  • उपमा: इसे एक बड़े, कठोर "टेस्ट टेस्ट" या AI के लिए "ड्राइविंग टेस्ट" के रूप में सोचें।
  • इसमें क्या है: उन्होंने पांच अलग-अलग प्रकार के विजुअल्स से जुड़ी चुनौतियों का एक विशाल संग्रह इकट्ठा किया:
    1. वेबपेज (जैसे घर बनाना)।
    2. डेटा चार्ट (जैसे मौसम का नक्शा पढ़ना)।
    3. वेक्टर ग्राफिक्स (जैसे डिजिटल क्लिप आर्ट)।
    4. स्कीमैटिक्स (जैसे इलेक्ट्रिकल ब्लूप्रिंट)।
    5. UML डायग्राम (जैसे संगठनात्मक चार्ट)।
  • परिणाम: उन्होंने इस किचन में पुराने मॉडल्स का परीक्षण किया, और अधिकांश बुरी तरह विफल रहे। वे चित्र और कोड के बीच के संबंध को जोड़ने में असमर्थ थे।

4. परिणाम: एक नया चैंपियन

जब उन्होंने इस किचन में CodeMMR का परीक्षण किया:

  • इसने प्रतियोगिता को पछाड़ दिया: इसने औसत रूप से अगले सबसे अच्छे AI से लगभग 10 अंक अधिक प्राप्त किए। यह एक मास्टर शेफ की तरह था जो भोजन की फोटो देखकर तुरंत सही रेसिपी ढूंढ सकता था।
  • यह AI को बेहतर कोड लिखने में मदद करता है: उन्होंने अन्य AI मॉडल्स (LLMs) को कोड लिखने में मदद करने के लिए CodeMMR का उपयोग किया। जब AI, CodeMMR का उपयोग करके सही विजुअल उदाहरणों को "लुक अप" कर सकता है, तो वह कम गलतियाँ करता है।
    • वास्तविक दुनिया का प्रभाव: यदि आप किसी AI को "बिक्री दिखाने वाला एक चार्ट बनाने" के लिए कहते हैं, और वह CodeMMR का उपयोग करके पहले एक समान चार्ट ढूंढ लेता है, तो वह गलती से पाई चार्ट नहीं बनाएगा जब आपको बार ग्राफ चाहिए था। वह बारीकियों को सही ढंग से पकड़ लेगा।

यह क्यों महत्वपूर्ण है

यह प्रोग्रामिंग के भविष्य के लिए एक बड़ा कदम है।

  • इंसानों के लिए: इसका मतलब है कि आप केवल कीवर्ड्स के बजाय स्केच, स्क्रीनशॉट या विवरण का उपयोग करके कोड खोज सकते हैं।
  • AI के लिए: यह AI सहायकों को बहुत अधिक विश्वसनीय बनाता है। "भ्रमित होने" (hallucinating - चीजें बनाने) के बजाय, वे एक विजुअल उदाहरण को देख सकते हैं और कह सकते हैं, "आह, मैं समझ गया कि यह कैसे काम करता है," और सटीक रूप से उसकी नकल कर सकते हैं।

संक्षेप में: पेपर कहता है, "कोड केवल टेक्स्ट नहीं है; यह एक विजुअल भाषा भी है। हमने एक ऐसा टूल बनाया है जो एक साथ तीनों (टेक्स्ट, कोड और इमेज) को समझता है, जिससे सॉफ्टवेयर डेवलपमेंट तेज़, आसान और त्रुटियों से मुक्त हो जाता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →