← नवीनतम पेपर
💬 NLP

JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence

यह शोध पत्र JanusCoder को प्रस्तुत करता है, जो सबसे बड़े मल्टीमॉडल कोड कॉर्पस (JanusCode-800K) पर प्रशिक्षित एक मौलिक विजुअल-प्रोग्रामेटिक इंटरफेस है, जो टेक्स्ट, विजुअल्स या दोनों से कोड उत्पन्न करने के लिए बनाया गया है, और विविध कोडिंग कार्यों में वाणिज्यिक मॉडलों के बराबर या उनसे बेहतर प्रदर्शन प्राप्त करता है।

मूल लेखक: Qiushi Sun, Jingyang Gong, Yang Liu, Qiaosheng Chen, Lei Li, Kai Chen, Qipeng Guo, Ben Kao, Fei Yuan

प्रकाशित 2026-04-15
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Qiushi Sun, Jingyang Gong, Yang Liu, Qiaosheng Chen, Lei Li, Kai Chen, Qipeng Guo, Ben Kao, Fei Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली वास्तुकार (architect) है जो केवल एक ब्लूप्रिंट (टेक्स्ट) पढ़कर इमारत का डिज़ाइन बना सकता है। लेकिन क्या होगा अगर आप चाहते कि वह वास्तुकार आपके द्वारा नैपकिन पर बनाए गए एक स्केच को भी देखे, या किसी बिखरे हुए कमरे की फोटो को देखे, और कहे, "आह, मैं समझ गया कि आपका मतलब क्या है! मैं ठीक वैसा ही बनाने के लिए कोड लिखूँगा"?

यही वह समस्या है जिसे JanusCoder हल करता है।

यहाँ इस पेपर की कहानी है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "अंधा" वास्तुकार

लंबे समय से, AI मॉडल टेक्स्ट निर्देशों (जैसे "बिक्री दिखाने वाला एक चार्ट बनाएं") के आधार पर कोड लिखने में बहुत अच्छे थे। हालांकि, जब आपने उन्हें एक तस्वीर दी और कहा, "इस विशिष्ट चार्ट को बनाने के लिए कोड बनाएं," तो वे संघर्ष करने लगे।

क्यों? क्योंकि डेटा गायब था। यह एक शेफ को केवल रेसिपी दिखाकर एक विशिष्ट व्यंजन बनाना सिखाने जैसा है, उसे कभी वास्तविक भोजन दिखाए बिना। AI के पास "चित्र + कोड" के जोड़ों के बीच संबंध सीखने के लिए पर्याप्त उदाहरण नहीं थे।

2. समाधान: "किचन सिम्युलेटर" (डेटा सिंथेसिस)

शोधकर्ताओं ने महसूस किया कि वे केवल लोगों के परफेक्ट उदाहरण अपलोड करने का इंतज़ार नहीं कर सकते। इसलिए, उन्होंने एक विशाल, स्वचालित किचन सिम्युलेटर बनाया।

  • टूलकिट: उन्होंने एक सॉफ्टवेयर टूलकिट बनाई है जो एक रोबोट शेफ की तरह काम करती है। यह मौजूदा कोड को लेती है, उसे देखती है, और पूछती है, "क्या होगा अगर हम रंग बदल दें?" या "क्या होगा अगर हम एक बटन जोड़ दें?"
  • जादुई लूप (Magic Loop): रोबोट कोड लिखता है, तस्वीर देखने के लिए उसे रन करता है, और फिर एक सुपर-स्मार्ट AI जज का उपयोग करके जाँच करता है: "क्या यह चित्र वैसा ही दिखता है जैसा निर्देश में पूछा गया था?"
  • परिणाम: उन्होंने 800,000 उच्च गुणवत्ता वाले उदाहरण (JanusCode-800K) उत्पन्न किए। यह अपने प्रकार का सबसे बड़ा पुस्तकालय है, जिसमें साधारण चार्ट से लेकर जटिल, इंटरैक्टिव वेबसाइटों और यहाँ तक कि गणितीय एनिमेशन (जैसे प्रसिद्ध 3Blue1Brown वीडियो) तक सब कुछ शामिल है।

3. मुख्य सितारा: JanusCoder (द यूनिवर्सल ट्रांसलेटर)

इस विशाल लाइब्रेरी के साथ, उन्होंने JanusCoder नामक मॉडलों का एक नया परिवार प्रशिक्षित किया।

JanusCoder को दो भाषाओं के बीच एक यूनिवर्सल ट्रांसलेटर के रूप में सोचें:

  1. तर्क की भाषा (कोड): सख्त, गणितीय निर्देश जिन्हें कंप्यूटर समझते हैं।
  2. दृष्टि की भाषा (विजुअल्स): वे चित्र, चार्ट और इंटरफेस जो इंसान देखते हैं।

यह क्या खास बनाता है?
अधिकांश AI मॉडल विशेषज्ञ होते हैं: एक मॉडल केवल टेक्स्ट को चार्ट में बदलना जानता है, और दूसरा केवल एक स्क्रीनशॉट को वेबसाइट में बदलना जानता है। JanusCoder एक जनरलिस्ट (generalist) है। यह एक ही मस्तिष्क में ये सभी चीजें कर सकता है:

  • टेक्स्ट से विजुअल: "ग्लोबल टेम्परेचर का एक ग्राफ बनाएं।" -> कोड और ग्राफ जेनरेट करता है।
  • विजुअल से टेक्स्ट: एक वेबसाइट का स्क्रीनशॉट दिखाता है। -> "इस साइट को फिर से बनाने के लिए यहाँ कोड है।"
  • एडिट मोड: एक वेबसाइट दिखाता है और कहता है "बटन को लाल बनाओ।" -> "यहाँ अपडेट किया गया कोड है।"

4. प्रमाण: दिग्गजों को पछाड़ना

शोधकर्ताओं ने JanusCoder का परीक्षण सबसे बड़े, सबसे महंगे कमर्शियल AI मॉडलों (जैसे GPT-4o) के खिलाफ किया।

  • परिणाम: उनके ओपन-सोर्स मॉडल (जो छोटे और मुफ्त उपयोग के लिए हैं) उन महंगे दिग्गजों के समान प्रदर्शन करते हैं, और कभी-कभी उनसे बेहतर भी।
  • क्यों? क्योंकि उन्होंने केवल AI को कोड का "अनुमान" लगाना नहीं सिखाया; उन्होंने इसे कोड के तर्क और अंतिम दृश्य परिणाम के बीच के संबंध को समझना सिखाया।

बड़ी तस्वीर का रूपक (Analogy)

कल्पित कीजिए कि आप पियानो बजाना सीख रहे हैं।

  • पुराना AI: आप केवल शीट म्यूजिक (टेक्स्ट) पढ़कर सीख सकते थे। यदि कोई आपके लिए एक गाना बजाता था (विजुअल), तो आप नोट्स का पता नहीं लगा पाते थे।
  • JanusCoder: यह एक ऐसे छात्र की तरह है जिसने एक जादुई शिक्षक के साथ अभ्यास किया है जो किसी भी सुने गए गाने के लिए तुरंत शीट म्यूजिक दिखा सकता है, और आपके द्वारा लिखे गए किसी भी गाने को बजा सकता है। यह उस अंतर को पाटता है जो आप देखते हैं और जो आप लिखते हैं, उसके बीच।

संक्षेप में: JanusCoder एक नया, ओपन-सोर्स AI है जो एक तस्वीर देख सकता है और उसे बनाने के लिए कोड लिख सकता है, या एक विवरण पढ़ सकता है और उस चित्र को बना सकता है, और वह भी उस स्तर के कौशल के साथ जो बाजार के सबसे महंगे AI को टक्कर देता है। यह किसी के लिए भी केवल एक स्केच दिखाकर या एक विचार का वर्णन करके जटिल सॉफ्टवेयर बनाने का द्वार खोलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →