← नवीनतम पेपर
💬 NLP

VisCoder2: Building Multi-Language Visualization Coding Agents

यह शोध पत्र VisCoder2 को प्रस्तुत करता है, जो बड़े पैमाने के VisCode-Multi-679K डेटासेट पर प्रशिक्षित बहु-भाषा विज़ुअलाइज़ेशन कोडिंग मॉडल्स का एक परिवार है और जिसे VisPlotBench के माध्यम से मूल्यांकित किया गया है, जो 12 प्रोग्रामिंग भाषाओं में इटरेटिव सेल्फ-डीबगिंग के माध्यम से मौजूदा ओपन-सोर्स बेसलाइन से काफी बेहतर प्रदर्शन करता है और प्रोप्राइटरी मॉडल के प्रदर्शन के करीब पहुँचता है।

मूल लेखक: Yuansheng Ni, Songcheng Cai, Xiangchao Chen, Jiarong Liang, Zhiheng Lyu, Jiaqi Deng, Kai Zou, Ping Nie, Fei Yuan, Xiang Yue, Wenhu Chen

प्रकाशित 2026-04-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuansheng Ni, Songcheng Cai, Xiangchao Chen, Jiarong Liang, Zhiheng Lyu, Jiaqi Deng, Kai Zou, Ping Nie, Fei Yuan, Xiang Yue, Wenhu Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो केवल अपने sous-chef (एक AI) को वर्णन करके एक सुंदर, जटिल व्यंजन (एक डेटा विज़ुअलाइज़ेशन) बनाना चाहते हैं। अतीत में, यदि आपने AI से "समय के साथ बिक्री दिखाने वाला एक चार्ट बनाएं" कहा होता, तो वह आपको एक ऐसी रेसिपी दे देता जिसमें सामग्री गायब होती, या जिसमें गलत ओवन तापमान होता, या जो एक जले हुए कचरे जैसा दिखता। यह अक्सर एक ही प्रयास के बाद हार मान लेता, जिससे एक टूटा हुआ व्यंजन पीछे रह जाता।

VisCoder2 एक नया, अत्यंत बुद्धिमान sous-chef है जिसे न केवल व्यंजन पकाने के लिए, बल्कि उसे चखने, यह महसूस करने के लिए कि वह नमकीन है, और रेसिपी को तब तक ठीक करने के लिए प्रशिक्षित किया गया है जब तक कि वह एकदम सही न हो जाए।

यहाँ इस पेपर की तीन मुख्य सामग्रियों का सरल विवरण दिया गया है:

1. विशाल कुकबुक: VisCode-Multi-679K

समस्या: पिछले AI शेफ मुख्य रूप से "Python" (एक लोकप्रिय कुकिंग भाषा) की रेसिपी पर प्रशिक्षित थे। यदि आपने उनसे "LaTeX" (गणितीय चार्ट के लिए एक शानदार, सटीक भाषा) या "LilyPond" (संगीत स्कोर के लिए एक भाषा) का उपयोग करके कुछ पकाने के लिए कहा होता, तो वे पूरी तरह से अनभिज्ञ होते। वे शायद ही कभी गलतियों को सुधारना सीखते थे।

समाधान: शोधकर्ताओं ने VisCode-Multi-679K नामक एक विशाल लाइब्रेरी बनाई।

  • उपमा: एक लाइब्रेरी की कल्पना करें जिसमें 679,000 उत्तम रेसिपी हैं।
  • विविधता: ये केवल एक प्रकार के खाना पकाने के लिए नहीं हैं। ये 12 अलग-अलग "भाषाओं" (जैसे Python, HTML, SVG और यहाँ तक कि संगीत संकेतन) को कवर करते हैं।
  • सीक्रेट सॉस: महत्वपूर्ण रूप से, इस लाइब्रेरी में केवल अंतिम रेसिपी ही नहीं है। इसमें शेफ और आलोचक के बीच की बातचीत भी शामिल है। यह AI को सिखाता है: "मैंने एक बार चार्ट बनाने की कोशिश की, लेकिन कंप्यूटर ने कहा 'Error: Missing Bracket।' इसलिए, मैंने ब्रैकेट जोड़ा और फिर से प्रयास किया।"
  • यह क्यों मायने रखता है: यह AI को सिखाता है कि गलती करना ठीक है, जब तक कि आप उसे ठीक करना जानते हों।

2. अंतिम स्वाद परीक्षण: VisPlotBench

समस्या: आप कैसे जानेंगे कि एक नया AI शेफ वास्तव में अच्छा है? पिछले परीक्षण ऐसे थे जैसे AI को "एक वृत्त खींचने" के लिए कहना और यह देखना कि क्या वह वृत्त जैसा दिखता है। उन्होंने यह नहीं जांचा कि क्या वृत्त सही रंग का था, या यदि वृत्त एक वर्ग बन गया तो क्या AI उसे ठीक कर सकता था।

समाधान: उन्होंने एक कठोर "स्वाद परीक्षण" प्रतियोगिता, VisPlotBench बनाया।

  • उपमा: यह एक 8-लेन वाला रेस ट्रैक है। प्रत्येक लेन एक अलग प्रोग्रामिंग भाषा (Python, Mermaid, Asymptote, आदि) का प्रतिनिधित्व करती है।
  • चुनौती: AI को एक प्राकृतिक भाषा निर्देश दिया जाता है (जैसे, "मुझे हीट ज़ोन के साथ दुनिया का एक मानचित्र दिखाएं")। इसे कोड लिखना होगा, इसे चलाना होगा, और देखना होगा कि क्या चित्र दिखाई देता है।
  • ट्विस्ट: यदि चित्र दिखाई नहीं देता है, तो AI को त्रुटि संदेश (error message) देखने, कोड को ठीक करने और फिर से प्रयास करने के लिए तीन मौके मिलते हैं। यह उसकी "स्वयं-डीबग" (self-debug) करने की क्षमता का परीक्षण करता है।

3. स्टार शेफ: VisCoder2

परिणाम: विशाल कुकबुक (VisCode-Multi-679K) का उपयोग करके, उन्होंने VisCoder2 नामक AI मॉडलों का एक नया परिवार प्रशिक्षित किया।

  • प्रदर्शन:
    • पहले: ओपन-सोर्स AI मॉडल जूनियर शेफ की तरह थे। वे Python में सरल चार्ट बना सकते थे लेकिन यदि उन्हें LaTeX या Asymptote जैसी जटिल भाषा का उपयोग करने के लिए कहा जाता, तो वे घबरा जाते और हार मान लेते।
    • अब: VisCoder2 एक मास्टर शेफ है। टेस्ट में, इसने सबसे महंगे, प्रोप्राइटरी शेफ (जैसे GPT-4.1) के लगभग बराबर प्रदर्शन किया।
    • "सेल्फ-डीबग" सुपरपावर: जब VisCoder2 कोई गलती करता है, तो वह केवल यह नहीं कहता "मैं यह नहीं कर सकता।" वह त्रुटि को देखता है, सोचता है, "ओह, मैं एक सेमीकोलन भूल गया था," और उसे ठीक करता है। कुछ कठिन भाषाओं में, इस आत्म-सुधार ने इसकी सफलता दर को लगभग 50% से बढ़ाकर 82% से अधिक कर दिया।

बड़ी तस्वीर: यह क्यों मायने रखता है

सोचिए कि डेटा विज़ुअलाइज़ेशन कच्चे नंबरों और मानवीय समझ के बीच एक पुल है।

  • पुराना तरीका: आप एक AI से एक पुल मांगते हैं। वह एक डगमगाता हुआ पुल बनाता है, वह ढह जाता है, और AI वहां से चला जाता है।
  • VisCoder2 का तरीका: आप एक पुल मांगते हैं। AI इसे बनाता है, देखता है कि यह डगमगा रहा है, इसके स्तंभों को मजबूत करता है, पेंट की जाँच करता है, और आपको एक मजबूत, सुंदर पुल सौंपता है।

संक्षेप में: यह पेपर एक नए AI को पेश करता है जो 12 अलग-अलग कोडिंग भाषाओं को बोल सकता है, जिसने 679,000 गलतियों और सुधारों के उदाहरणों से सीखा है, और अब यह जटिल डेटा विज़ुअलाइज़ेशन को लगभग उतना ही अच्छी तरह से बना और सुधार सकता है जितना कि सर्वश्रेष्ठ मानव विशेषज्ञ या महंगे कॉर्पोरेट AI। यह AI को एक "एक-बार के अनुमान लगाने वाले" से बदलकर एक "लगातार समस्या सुलझाने वाले" में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →