From Data to Insights: Exploring Program-of-Thoughts Prompting for Chart Summarization
यह शोध पत्र एक ज़ीरो-शॉट प्रोग्राम-ऑफ़-थॉट प्रॉम्प्टिंग रणनीति पेश करता है जो सटीक और कुशल चार्ट सारांशीकरण के लिए पायथन कोड उत्पन्न करने हेतु हल्के विज़ुअल लैंग्वेज मॉडल्स और एक नवीन चार्ट-टू-डिक्शनरी ऑक्सिलरी टास्क का लाभ उठाता है, जो मौजूदा विधियों के तुलनीय प्रदर्शन प्राप्त करते हुए तथ्यात्मक शुद्धता में सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक जटिल चार्ट है, जैसे कि मौसम का नक्शा या शेयर बाजार का ग्राफ। आपका लक्ष्य एक छोटी कहानी लिखना है जो यह समझा सके कि वह चार्ट क्या कह रहा है। इसे "चार्ट सारांशीकरण" (chart summarization) कहा जाता है।
समस्या यह है कि कंप्यूटर (विशेष रूप से विजुअल लैंग्वेज मॉडल्स जैसे AI) चित्रों को देखने में तो बहुत अच्छे होते हैं, लेकिन वे गणित करने में अक्सर बहुत खराब होते हैं। यदि आप किसी AI से किसी ग्राफ को देखकर औसत तापमान या उच्चतम बिक्री का आंकड़ा बताने के लिए कहते हैं, तो वह अक्सर केवल अनुमान लगा लेता है। वह कह सकता है कि औसत 50 डिग्री है जबकि वास्तव में यह 72 है, या वह ऐसे नंबर बना सकता है जो अस्तित्व में ही नहीं हैं। यह एक कवि से टैक्स भरने के लिए कहने जैसा है; उनकी कल्पना तो शानदार है, लेकिन उन्हें अकाउंटेंट के रूप में प्रशिक्षित नहीं किया गया है।
समाधान: "प्रोग्राम ऑफ थॉट्स" (PoT)
यह शोध पत्र एक चतुर तकनीक पेश करता है जिसे प्रोग्राम-ऑफ-थॉट्स (PoT) कहा जाता है। AI को अपने दिमाग में "सोचने" और "गणना करने" (जहाँ वह गलतियाँ कर सकता है) के बजाय, शोधकर्ता उसे एक पायथन कंप्यूटर प्रोग्राम लिखने के लिए कहते हैं ताकि वह उसके लिए गणित कर सके।
इसे इस तरह सोचें:
- पुराना तरीका (डायरेक्ट प्रॉम्प्टिंग): आप AI से पूछते हैं, "कुल बिक्री कितनी है?" AI चार्ट को देखता है, अपनी आँखें सिकोड़ता है और एक नंबर का अनुमान लगाता है। यह एक शेफ से बिना तराजू के स्टेक का वजन अनुमान लगाने के लिए पूछने जैसा है।
- नया तरीका (PoT): आप AI से कहते हैं, "एक कंप्यूटर स्क्रिप्ट लिखें जो स्टेक के वजन को पढ़े और उसे जोड़ दे।" AI कोड लिखता है। फिर, एक कंप्यूटर उस कोड को चलाता है। कंप्यूटर गणित में एकदम सटीक होता है, इसलिए परिणाम सटीक होता है। AI फिर उस सटीक नंबर का उपयोग करके अपना सारांश लिखता है।
नया टूल: "डिक्शनरी" (शब्दकोश)
इसे काम करने योग्य बनाने के लिए, शोधकर्ताओं को AI को चार्ट के बारे में बात करने का एक नया तरीका सिखाना पड़ा। आमतौर पर, AI चार्ट को एक स्प्रेडशीट (तालिका) में बदलने की कोशिश करता है। लेकिन चार्ट अव्यवस्थित होते हैं; उनमें रंग, आकार और लेबल होते हैं जो पंक्तियों और कॉलमों में ठीक से फिट नहीं बैठते।
लेखकों ने चार्ट-टू-डिक्शनरी नामक एक नया चरण बनाया।
- कल्पना कीजिए कि चार्ट एक बिखरा हुआ कमरा है।
- एक टेबल (तालिका) हर चीज़ को एक कठोर बॉक्स में डालने की कोशिश करती है। यदि कोई चीज़ फिट नहीं होती, तो वह खो जाती है।
- एक डिक्शनरी (शब्दकोश) एक स्मार्ट लेबल मेकर की तरह है। AI चार्ट को देखता है और कहता है, "ठीक है, यहाँ वस्तुओं की एक सूची है:
{'sales': [100, 200, 300], 'months': ['Jan', 'Feb', 'Mar']}।" यह डेटा को एक लचीली, व्यवस्थित सूची के रूप में कैप्चर करता है जिसे कंप्यूटर आसानी से पढ़ और गणना कर सकता है।
उन्होंने इसका परीक्षण कैसे किया
शोधकर्ताओं ने वास्तविक दुनिया के चार्ट्स (जैसे बार ग्राफ, लाइन चार्ट और पाई चार्ट) का उपयोग करके इस "गणित करने के लिए कोड लिखें" रणनीति का परीक्षण कई अलग-अलग AI मॉडल्स पर किया। उन्होंने तीन तरीकों की तुलना की:
- डायरेक्ट (Direct): बस AI को सारांश लिखने के लिए कहें।
- MCoT: AI को शब्दों में कदम-दर-कदम सोचने के लिए कहें (जैसे एक इंसान ज़ोर से सोचता है)।
- PoT: AI को नंबरों की गणना करने के लिए एक पायथन प्रोग्राम लिखने के लिए कहें, फिर सारांश लिखें।
उन्हें क्या पता चला
परिणाम कुछ इस तरह के थे जैसे एक स्पोर्ट्स टीम जहाँ रणनीति पूरी तरह से इस बात पर निर्भर करती है कि आपके पास कौन सा खिलाड़ी है:
- यह कुछ AI मॉडल्स के लिए बहुत अच्छा काम करता है: उन मॉडल्स के लिए जो टेक्स्ट और डेटा को समझने में अच्छे हैं (जैसे InternVL और Qwen), PoT तरीका विजेता रहा। इसने उन्हें नकली नंबर बनाने से बचने में मदद की और उनके सारांश की सटीकता में सुधार किया। यह एक अच्छे छात्र को कैलकुलेटर देने जैसा था; वे पहले से ही कहानी लिखना जानते थे, लेकिन कैलकुलेटर ने तथ्यों को एकदम सही बना दिया।
- यह अन्य मॉडल्स के साथ संघर्ष करता है: कुछ अन्य मॉडल्स (जैसे DeepSeek) के लिए, PoT विधि ने वास्तव में चीजों को बदतर बना दिया। ऐसा लगता है कि ये मॉडल्स कोड लिखने के अतिरिक्त चरण से भ्रमित हो गए, या उन्होंने खराब कोड लिखा जिससे प्रक्रिया टूट गई। यह किसी ऐसे व्यक्ति को कैलकुलेटर देने जैसा है जिसे नहीं पता कि उसका उपयोग कैसे करना है; वे शायद उसे गिरा देंगे या गलत बटन दबा देंगे।
- "डिक्शनरी" मददगार है: चार्ट को पायथन डिक्शनरीज़ (लचीली सूचियों) में बदलने का नया तरीका सफल रहा। इसने AI को गणित करने से पहले डेटा को "देखने" का एक बेहतर तरीका दिया।
मुख्य निष्कर्ष
यह शोध पत्र दिखाता है कि यदि आप चाहते हैं कि आपका AI किसी चार्ट का सटीक सारांश दे, तो आपको केवल उसे "गणित करने" के लिए नहीं कहना चाहिए। इसके बजाय, आपको उसे गणित करने के लिए एक टूल (कोड) लिखने के लिए कहना चाहिए, और फिर एक कंप्यूटर को उस टूल को चलाने देना चाहिए।
हालाँकि, यह ट्रिक हर AI के लिए जादू की छड़ी नहीं है। यह विशेष प्रकार के AI मॉडल्स के साथ सबसे अच्छा काम करती है जो पहले से ही टेक्स्ट और डेटा को संभालने में अच्छे हैं। इन मॉडल्स के लिए, यह विधि एक सुरक्षा जाल (safety net) की तरह काम करती है, जो AI को नकली नंबर बनाने से पहले ही पकड़ लेती है, जिससे यह सुनिश्चित होता है कि अंतिम कहानी दिलचस्प और तथ्यात्मक रूप से सही दोनों है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।