← नवीनतम पेपर
💻 computer science

CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution

CharTide चार्ट-टू-कोड जनरेशन के लिए एक नवीन डेटा-केंद्रित फ्रेमवर्क है जो विजुअल और लॉजिकल ट्रेनिंग को अलग करने के लिए एक ट्राइ-परस्पेक्टिव ट्यूनिंग रणनीति का उपयोग करता है और ऑब्जेक्टिव, वेरिफिकेशन-आधारित रिवार्ड्स के माध्यम से अलाइनमेंट सुनिश्चित करने के लिए एक इनक्वायरी-ड्रिवन आरएल (RL) फ्रेमवर्क का उपयोग करता है।

मूल लेखक: Xiangxi Zheng, Kuang He, Jiayi Hu, Ping Yu, Rui Yan, Yuan Yao, Peng Hou, Anxiang Zeng, Alex Jinpeng Wang

प्रकाशित 2026-04-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xiangxi Zheng, Kuang He, Jiayi Hu, Ping Yu, Rui Yan, Yuan Yao, Peng Hou, Anxiang Zeng, Alex Jinpeng Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर आर्किटेक्ट हैं, और कोई आपको एक भविष्यवादी गगनचुंबी इमारत का एक सुंदर, हाथ से बना हुआ स्केच थमाता है। आपका काम केवल उस इमारत का वर्णन करना नहीं है, बल्कि उसके सटीक, जटिल गणितीय ब्लूप्रिंट (यानी "कोड") लिखना है ताकि एक रोबोट उसे पूरी तरह से बना सके—खिड़कियों पर नीले रंग के सटीक शेड से लेकर छत के बगीचे के सटीक कोण तक।

यदि आप केवल स्केच को देखते हैं और एक ही बार में पूरे ब्लूप्रिंट लिखने की कोशिश करते हैं, तो आप अभिभूत हो सकते हैं। हो सकता है कि आपको आकार याद रहे लेकिन सटीक माप भूल जाएं, या आप गणित तो सही कर लें लेकिन गलत रंगों का उपयोग कर दें।

यह वह समस्या है जिसका सामना "चार्ट-टू-कोड" (Chart-to-Code) AI शोधकर्ता करते हैं। वे एक ऐसा AI चाहते हैं जो किसी जटिल चार्ट (जैसे स्टॉक मार्केट ग्राफ या वैज्ञानिक प्लॉट) को देख सके और तुरंत उस सटीक चार्ट को फिर से बनाने के लिए कंप्यूटर कोड लिख सके।

शोधकर्ताओं ने इसे हल करने के लिए CharTide बनाया है। उन्होंने इसे दो मुख्य "प्रशिक्षण रहस्यों" का उपयोग करके कैसे किया, यहाँ बताया गया है।

1. "तीन-विषय वाला छात्र" रणनीति (Tri-Perspective Tuning)

अधिकांश AI मॉडल सब कुछ एक साथ सीखने की कोशिश करते हैं: "चित्र को देखो, गणित को समझो, और कोड लिखो।" यह एक ही घंटे में पियानो बजाना, फ्रेंच बोलना और कैलकुलस हल करना सीखने जैसा है। इससे "दिमागी धुंध" (जिसे शोधकर्ता hallucinations कहते हैं) पैदा होती है।

CharTide एक स्मार्ट तरीका अपनाता है। यह प्रशिक्षण को तीन अलग-अलग "कक्षाओं" में विभाजित करता है:

  • कक्षा 1: कलाकार (दृश्य धारणा - Visual Perception): AI चार्ट को देखता है और बस साधारण शब्दों में उनका वर्णन करता है। यह इसे रंगों और लेबल जैसे सूक्ष्म विवरणों को देखना सिखाता है।
  • कक्षा 2: कोडर (शुद्ध तर्क - Pure Logic): AI को टेक्स्ट विवरण दिए जाते हैं और कोड लिखने के लिए कहा जाता है। यह इसे चित्रों को देखने के व्याकुलता के बिना कोडिंग के व्याकरण को सिखाता है।
  • कक्षा 3: मास्टर (मोडैलिटी फ्यूजन - Modality Fusion): अंत में, यह दोनों को जोड़ देता है। यह चार्ट को देखता है और कोड लिखता है।

इन तीनों विषयों को अलग-अलग महारत हासिल करके, AI उन मॉडलों की तुलना में बहुत अधिक सटीक हो जाता है जो पहले दिन से ही "मल्टीटास्किंग" करने की कोशिश करते हैं।

2. "सख्त शिक्षक" पद्धति (Inquiry-Driven RL)

आमतौर पर, जब एक AI गलती करता है, तो "शिक्षक" (मूल्यांकन प्रणाली) थोड़ा अस्पष्ट होता है। वह कह सकता है, "यह ठीक लग रहा है, 7/10।" यह एक ऐसे शिक्षक की तरह है जो आपको बिना कारण बताए ग्रेड देता है। इससे आपको सुधार करने में मदद नहीं मिलती।

CharTide एक बहुत ही कठिन, अधिक वस्तुनिष्ठ शिक्षक का उपयोग करता है जिसे "इंस्पेक्टर" (Inspector) कहा जाता है। एक अस्पष्ट स्कोर देने के बजाय, इंस्पेक्टर AI से उस चार्ट के बारे में जो उसने अभी बनाया है, कई "पॉप क्विज़" प्रश्न पूछता है:

  • "क्या लेजेंड (legend) ऊपर-दाएं कोने में है?"
  • "जून में नीले बार का सटीक मान क्या है?"
  • "क्या रेखा टूटी हुई (dashed) है या ठोस (solid)?"

यदि AI का कोड एक ऐसा चार्ट बनाता है जो इन प्रश्नों के गलत उत्तर देता है, तो उसे खराब ग्रेड मिलता है। यह AI को "अनुमान लगाने" के बजाय गणितीय और दृश्य रूप से पूर्ण होने के लिए मजबूर करता है। यह एक शिक्षक के "अच्छा काम किया!" कहने और एक शिक्षक के "आपने 10 में से 9 गणित के सवाल सही किए" कहने के बीच का अंतर है।

परिणाम

इस विशेष प्रशिक्षण के कारण, CharTide एक पावरहाउस है। भले ही यह एक अपेक्षाकृत "छोटा" मॉडल (7B या 8B पैरामीटर) है, यह GPT-4o जैसे विशाल, महंगे AI सिस्टम के बराबर—या कभी-कभी उनसे बेहतर—प्रदर्शन करता है। यह केवल चार्ट के रूप की "नकल" नहीं करता है; यह डेटा की आत्मा और कोड के तर्क को समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →