FACTS: Table Summarization via Offline Template Generation with Agentic Workflows
यह शोध पत्र FACTS प्रस्तुत करता है, जो एक एजेंटिक वर्कफ़्लो है जो पुन: प्रयोज्य ऑफलाइन SQL और Jinja2 टेम्प्लेट उत्पन्न करता है ताकि बिना किसी महंगी फाइन-ट्यूनिंग या संवेदनशील डेटा को उजागर किए, तेज़, सटीक और गोपनीयता-अनुपालक क्वेरी-केंद्रित तालिका सारांश सक्षम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास स्प्रेडशीट्स (टेबल्स) का एक विशाल पुस्तकालय है जो संवेदनशील डेटा, जैसे बैंक लेनदेन या रोगी के रिकॉर्ड से भरा हुआ है। आप एक प्रश्न पूछना चाहते हैं जैसे, "पिछले वर्ष के शीर्ष 3 बचतकर्ताओं को दिखाएं," और एक अच्छा, पठनीय पैराग्राफ के रूप में उत्तर प्राप्त करना चाहते हैं।
समस्या यह है कि वर्तमान AI उपकरण अति-कार्यभार वाले इंटर्न (overworked interns) की तरह हैं जो एक अकेले प्रश्न का उत्तर देने के लिए पूरे पुस्तकालय को पढ़ने की कोशिश करते हैं। वे भ्रमित हो जाते हैं (hallucinations), नंबरों के बारे में गलत अनुमान लगाते हैं, बहुत अधिक निजी जानकारी पढ़ लेते हैं, और यदि आप नए वर्ष के डेटा के बारे में वही प्रश्न पूछते हैं तो वे थक जाते हैं (धीमे हो जाते हैं)।
मिलिए FACTS से (फास्ट, एक्यूरेट, एंड प्राइवेसी-कम्प्लायंट टेबल समराइजेशन)। FACTS को एक इंटर्न के रूप में नहीं, बल्कि एक मास्टर आर्किटेक्ट और एक क्वालिटी कंट्रोल टीम के रूप में सोचें जो मिलकर एक स्थायी, पुन: प्रयोज्य (reusable) मशीन बनाने के लिए काम कर रहे हैं जो आपके प्रश्नों का उत्तर पूरी तरह से देती है।
यहाँ बताया गया है कि FACTS कैसे काम करता है, जिसे सरल चरणों में विभाजित किया गया है:
1. पुराने तरीके के साथ समस्या (द "डायरेक्ट" अप्रोच)
कल्पना कीजिए कि आप एक AI को एक टेबल का सारांश लिखने के लिए कहते हैं।
- पुराना तरीका: आप AI को पूरा स्प्रेडशीट (निजी नामों और नंबरों सहित) सौंप देते हैं और कहते हैं, "एक सारांश लिखें।"
- जोखिम: AI गलत नंबरों का अनुमान लगा सकता है, पूरी शीट को पढ़ने में बहुत समय लगता है, और आपने अभी-अभी एक अजनबी को अपना निजी डेटा सौंप दिया है। यदि आपके पास 10 साल का डेटा है, तो आपको इसके लिए 10 बार यह करना होगा।
2. FACTS समाधान: एक "रेसिपी बुक" बनाना
AI से हर बार डेटा पढ़ने के लिए कहने के बजाय, FACTS एक स्थायी रेसिपी बुक (जिसे ऑफलाइन टेम्पलेट कहा जाता है) बनाता है जो किसी भी स्प्रेडशीट के लिए काम करती है जिसमें समान संरचना (कॉलम) हो, भले ही उसके अंदर के नंबर बदल जाएं।
यह प्रक्रिया तीन चरणों में होती है, जिसकी निगरानी एक क्वालिटी कंट्रोल टीम (LLM काउंसिल) द्वारा की जाती है।
चरण 1: ब्लूप्रिंट (स्कीमा-गाइडेड स्पेसिफिकेशन)
- क्या होता है: AI आपके स्प्रेडशीट की संरचना (जैसे "नाम", "बैलेंस", "तारीख" जैसे कॉलम के नाम) को देखता है लेकिन वास्तविक नंबर कभी नहीं देखता।
- उपमा: कल्पना कीजिए कि आप एक शेफ को रसोई में उपलब्ध सामग्रियों का मेनू (स्कीमा) दे रहे हैं, लेकिन अभी तक वास्तविक भोजन नहीं दे रहे हैं। शेफ स्पष्ट करने वाले प्रश्न पूछता है: "क्या आप केवल ताजी सब्जियां चाहते हैं? क्या आप तीखे आइटम्स को बाहर करना चाहते हैं?"
- परिणाम: AI नियमों का एक सेट बनाता है (जैसे, "केवल उन पंक्तियों को देखें जहाँ श्रेणी 'आय' है")।
चरण 2: मशीन (SQL जनरेशन)
- क्या होता है: AI चरण 1 के नियमों के आधार पर सटीक डेटा प्राप्त करने के लिए एक सटीक कंप्यूटर कमांड (SQL) लिखता है।
- उपमा: शेफ अब रसोई रोबोट के लिए एक विशिष्ट निर्देश लिखता है: "फ्रिज में जाओ, वजन के हिसाब से शीर्ष 3 सेब उठाओ, और उन्हें एक कटोरे में डाल दो।"
- सुरक्षा जांच: इससे पहले कि यह निर्देश अंतिम रूप से तैयार हो, क्वालिटी कंट्रोल टीम (विभिन्न AI का एक समूह) इसकी जांच करती है। वे पूछते हैं: "क्या यह कमांड काम करेगा? क्या यह क्रैश हो जाएगा? क्या यह सही चीजें उठा रहा है?" यदि यह गलत है, तो वे इसे तब तक ठीक करते हैं जब तक कि यह एकदम सही न हो जाए।
चरण 3: स्टोरीटेलर (Jinja2 टेम्पलेट)
- क्या होता है: AI एक "खाली स्थान भरने वाला" स्क्रिप्ट (एक Jinja2 टेम्पलेट) बनाता है जो रोबोट से प्राप्त कच्चे नंबरों को मानव-पठनीय कहानी में बदल देता है।
- उपमा: शेफ सेब के कटोरे को लेता है और एक नोट लिखता है: "यहाँ शीर्ष 3 सेब हैं: [नाम 1] जिसका वजन [वजन 1] है, [नाम 2] जिसका वजन [वजन 2] है..."
- सुरक्षा जांच: क्वालिटी कंट्रोल टीम अंतिम बार यह सुनिश्चित करने के लिए जांच करती है कि कहानी कटोरे में मौजूद सेबों से मेल खाती है या नहीं।
3. जादू: पुन: प्रयोज्यता और गोपनीयता
एक बार जब यह "रेसिपी बुक" (ऑफलाइन टेम्पलेट) बन जाती है, तो इसे सेव (save) कर लिया जाता है।
- गोपनीयता (Privacy): AI ने वास्तविक नंबर कभी नहीं देखे। उसने केवल डेटा के "लेबल" (जैसे कॉलम के नाम) देखे और निर्देश लिखे। वास्तविक डेटा आपके सुरक्षित डेटाबेस में रहता है।
- गति (Speed): अगले वर्ष, जब आपके पास समान कॉलम वाला नया स्प्रेडशीट हो लेकिन नंबर अलग हों, तो आपको फिर से AI को सोचने के लिए कहने की आवश्यकता नहीं है। आपको बस उस मशीन को सौंपना है जिसे आपने बनाया है। यह कमांड चलाएगा और कहानी को तुरंत भर देगा।
- स्केलेबिलिटी (Scalability): चाहे आपके स्प्रेडशीट में 10 पंक्तियाँ हों या 1 करोड़, मशीन उतनी ही तेज़ी से काम करेगी क्योंकि इसे केवल कमांड चलाना होता है, पूरी किताब पढ़ने की आवश्यकता नहीं होती।
सारांश: यह एक बड़ी बात क्यों है?
- तेज़: यह एक बार टूल बनाता है और इसे हमेशा के लिए उपयोग करता है।
- सटीक: यह नंबरों को प्राप्त करने के लिए गणित (SQL) का उपयोग करता है, इसलिए यह अनुमान नहीं लगाता।
- निजी: यह आपके संवेदनशील डेटा को कभी नहीं देखता, केवल डेटा के "लेबल" को देखता है।
- विश्वसनीय: यह आपको अंतिम उत्तर देने से पहले अपने काम को दोबारा जांचने के लिए AI की एक टीम का उपयोग करता है।
संक्षेप में, FACTS AI को "पढ़ने और अनुमान लगाने" के बजाय "गणना करने और सच बताने वाली मशीन बनाने" के लिए सिखाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।