SheetMind: An End-to-End LLM-Powered Multi-Agent Framework for Spreadsheet Automation
यह शोध पत्र SheetMind को प्रस्तुत करता है, जो बड़े भाषा मॉडलों (LLMs) द्वारा संचालित एक मॉड्यूलर मल्टी-एजेंट फ्रेमवर्क है जो मैनेजर, एक्शन और रिफ्लेक्शन एजेंटों की एक पदानुक्रमित प्रणाली के माध्यम से स्प्रेडशीट कार्यों को स्वचालित करता है, और मौजूदा विधियों की तुलना में SheetCopilot बेंचमार्क पर बेहतर कार्यात्मक शुद्धता और पूर्ण निष्पादन विश्वसनीयता प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट लेकिन थोड़े भुलक्कड़ रोबोट को स्प्रेडशीट चलाना सिखाने की कोशिश कर रहे हैं। आप उसे एक बड़ा, उलझा हुआ निर्देश देते हैं, जैसे, "कॉलम पांच से नंबर से शुरू होने वाली किसी भी चीज़ को हटा दें, बाकी कॉलम को शानदार बना दें, और फिर देखें कि 'Q2' कितनी बार आया है।" यदि आप केवल एक मानक AI से यह करने के लिए कहते हैं, तो वह एक ही विशाल, भ्रमित छलांग लगाने की कोशिश कर सकता है, प्रोग्राम को क्रैश कर सकता है, या आपको गलत उत्तर दे सकता है क्योंकि उसने चरणों को आपस में मिला दिया है।
यहाँ SheetMind आता है, जो एक नया सिस्टम है जो आपके कंप्यूटर के भीतर एक छोटे, अत्यधिक संगठित कारखाने की तरह काम करता है। एक अकेला रोबोट सब कुछ करने के बजाय, SheetMind तीन विशिष्ट "एजेंटों" (अलग-अलग श्रमिकों के रूप में जिन्हें विशिष्ट कार्य दिए गए हैं) की एक टीम का उपयोग करता है ताकि बिना किसी परेशानी के काम पूरा किया जा सके।
तीन-श्रमिक कारखाना
- मैनेजर (बॉस): जब आप अपना अनुरोध टाइप करते हैं, तो मैनेजर केवल कूद नहीं पड़ता। यह आपके बड़े, जटिल वाक्य को छोटे, सरल चरणों की एक व्यवस्थित सूची में तोड़ देता है। यह एक शेफ की तरह है जो एक जटिल रेसिपी पढ़ता है और कहता है, "पहले, प्याज काटें। दूसरा, उन्हें भूनें। तीसरा, सॉस डालें।" यह टीम को एक ही बड़े बर्तन में पूरा भोजन बनाने की कोशिश करने से रोकता है।
- एक्शन एजेंट (निर्माता): यह कार्यकर्ता मैनेजर के सरल चरणों को लेता है और उन्हें कोड में बदल देता है। लेकिन सबसे खास बात यह है कि इस कार्यकर्ता को अपने नियम बनाने से सख्ती से मना किया गया है। इसे एक विशिष्ट, पूर्व-अनुमोदित "व्याकरण" (BNF नामक सख्त निर्माण निर्देशों का एक सेट) का उपयोग करके कमांड बनाना होगा। इसे लेगो (LEGO) सेट की तरह समझें जहाँ आप केवल उन टुकड़ों को जोड़ सकते हैं जो भौतिक रूप से संभव तरीके से फिट होते हैं। इसका मतलब है कि रोबोट को ऐसे कमांड लिखने के लिए डिज़ाइन किया गया है जो सिंटैक्टिक रूप से वैध हों, और अनुभवजन्य परीक्षणों ने दिखाया कि प्रत्येक जनरेट किया गया एक्शन वास्तव में बिना स्प्रेडशीट क्रैश किए निष्पादित किया जा सका।
- रिफ्लेक्शन एजेंट (निरीक्षक): निर्माता एक चरण पूरा करने के बाद, निरीक्षक केवल सिर हिलाकर "अच्छा काम किया" नहीं कहता। वह वास्तव में परिवर्तन से पहले और बाद में स्प्रेडशीट को देखता है ताकि यह देख सके कि क्या यह आपके द्वारा मांगे गए विवरण से मेल खाता है। यदि निर्माता ने गलती से सॉस को गलत डिश पर डाल दिया है, तो निरीक्षक इसे तुरंत पकड़ लेता है और कहता है, "हे, यह गलत है! फिर से कोशिश करें।" यदि निर्माता बार-बार एक ही गलती करता है, तो निरीक्षक अधिक सख्त हो जाता है, संकेत देता है और निर्माता को एक अलग रणनीति आज़माने के लिए कहता है।
परिणाम: पूर्ण सुरक्षा, अच्छी सटीकता
शोधकर्ताओं ने इस कारखाने का परीक्षण SheetCopilot Benchmark पर किया, जिसमें सरल फॉर्मेटिंग से लेकर जटिल चार्ट और फॉर्मूला तक 221 विभिन्न स्प्रेडशीट कार्य शामिल हैं। उन्होंने श्रमिकों को संचालित करने के लिए एक लोकप्रिय AI मॉडल (GPT-3.5-Turbo) का उपयोग किया।
यहाँ उन्होंने पाया:
- "नो क्रैश" रिकॉर्ड: इस विशिष्ट 221 कार्यों के बेंचमार्क पर, SheetMind ने 100% निष्पादन सफलता प्राप्त की। इसका अर्थ है कि इस परीक्षण सेट के प्रत्येक कार्य के लिए, सिस्टम बिना किसी प्रोग्राम क्रैश या एरर के समाप्त हुआ। पिछले सिस्टम, जैसे SheetCopilot और SheetAgent, ने इसी बेंचमार्क पर क्रमशः 87.3% और 94.1% की सफलता दर हासिल की थी। एक्शन एजेंट द्वारा पालन किए जाने वाले सख्त "व्याकरण" नियमों ने उन "सिंटैक्स त्रुटियों" को पूरी तरह से समाप्त कर दिया है जो आमतौर पर प्रोग्राम को तोड़ देते हैं।
- "सही उत्तर" स्कोर: हालांकि इस परीक्षण के दौरान सिस्टम कभी क्रैश नहीं हुआ, लेकिन यह हमेशा परफेक्ट उत्तर नहीं दे पाया। SheetMind ने 54.8% बार सही कार्यात्मक परिणाम प्राप्त किया। यह पुराने SheetCopilot सिस्टम (44.3%) से बेहतर है, लेकिन यह अभी भी SheetAgent (61.1%) से पीछे है।
यह कभी-कभी लक्ष्य क्यों चूक जाता है
पेपर सुझाव देता है कि SheetMind के परफेक्ट स्कोर न पाने का मुख्य कारण यह नहीं है कि कारखाना टूटा हुआ है, बल्कि इसलिए है क्योंकि "दिमाग" (AI मॉडल) कभी-कभी तार्किक गलतियाँ करता है।
100 कार्यों के उनके विश्लेषण में, जहाँ सिस्टम सही उत्तर देने में विफल रहा, 64% विफलताएं केवल इसलिए थीं क्योंकि AI ने गलत तर्क लगाया। उदाहरण के लिए, सिस्टम एक फॉर्मूला सही ढंग से बना सकता है लेकिन दो नंबरों को गलत क्रम में बदल सकता है, या ऐसा फंक्शन उपयोग कर सकता है जिसे स्प्रेडशीट सॉफ्टवेयर वास्तव में कैलकुलेट नहीं कर सकता। इंस्पेक्टर (रिफ्लेक्शन एजेंट) इन त्रुटियों को पकड़ लेता है और दोबारा करने के लिए कहता है, लेकिन कभी-कभी AI गलत तर्क के साथ ही बार-बार कोशिश करता रहता है, भले ही उसे बताया गया हो कि वह गलत है।
इसका आपके लिए क्या अर्थ है
शोधकर्ताओं ने इस सिस्टम को Google Sheets के एक वास्तविक विस्तार के रूप में बनाया है, इसलिए आप अभी अपनी स्प्रेडशीट के साथ चैट कर सकते हैं। उन्होंने पाया कि कठिन कार्यों के लिए "मैनेजर" कार्यकर्ता अत्यंत महत्वपूर्ण है; इसके बिना, जटिल निर्देशों के लिए सफलता दर 71% से गिरकर केवल 24% रह जाती है। "इंस्पेक्टर" भी एक बड़ा उछाल लाता है, जो अकेले ही सफलता दर में लगभग 12–14% का सुधार करता है।
हालांकि यह सिस्टम अभी तक हर स्प्रेडशीट समस्या को पूरी तरह से हल करने वाला कोई जादुई डंडा नहीं है, लेकिन यह साबित करता है कि बड़े कार्यों को छोटे टुकड़ों में तोड़ने और AI को सख्त निर्माण नियमों का पालन करने के लिए मजबूर करने से यह अविश्वसनीय रूप से विश्वसनीय बन जाता है। लेखक सुझाव देते हैं कि जैसे-जैसे AI मॉडल तर्क करने में स्मार्ट होते जाएंगे, SheetMind की सटीकता भी बढ़ेगी, जो भविष्य में और भी उच्च सफलता दर तक पहुँच सकती है। फिलहाल, यह एक ऐसा टूल है जो वादा करता है कि आपके स्प्रेडशीट के दौरान (इन विशिष्ट परीक्षणों में) कभी क्रैश नहीं होगा, भले ही गणित को बिल्कुल सही करने के लिए इसे कभी-कभी दूसरे अनुमान की आवश्यकता हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।