← नवीनतम पेपर
🤖 AI

TSQAgent: Rating Time Series Data Quality via Dedicated Agentic Reasoning

यह शोध पत्र TSQAgent को प्रस्तुत करता है, जो एक नवीन एजेंटिक रीजनिंग फ्रेमवर्क है जो प्रासंगिक आयामों की गतिशील रूप से पहचान करके और आधारित मात्रात्मक तुलना करके बड़े भाषा मॉडलों की टाइम सीरीज़ डेटा गुणवत्ता का आकलन करने की क्षमता को बढ़ाता है, जिससे डाउनस्ट्रीम डेटा चयन और मॉडल प्रदर्शन में सुधार होता है।

मूल लेखक: Shunyu Wu, Dan Li, Haozheng Ye, Weibin Feng, Jian Lou, Bo Zhang, Wenjie Feng, Chenjuan Guo, See-Kiong Ng

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shunyu Wu, Dan Li, Haozheng Ye, Weibin Feng, Jian Lou, Bo Zhang, Wenjie Feng, Chenjuan Guo, See-Kiong Ng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक स्वादिष्ट सूप बनाने की कोशिश कर रहे हैं। आपके सामने सब्जियों की दो बाल्टियाँ रखी हैं। एक बाल्टी में ताजी, कुरकुरी गाजर और बेहतरीन आलू हैं। दूसरी बाल्टी में कुछ सड़ी हुई चीजें, कीचड़ वाला पानी और अजीब, असंगत आकारों में कटी हुई सब्जियां हैं।

यदि आप केवल बाल्टियों पर एक नज़र डालते हैं, तो आपको लग सकता है कि वे "ठीक" दिख रही हैं। लेकिन एक बेहतरीन सूप बनाने के लिए, आपको यह जानना होगा कि कौन सी बाल्टी बेहतर है और क्यों। क्या पहली बाल्टी इसलिए बेहतर है क्योंकि गाजर ताजी है? या क्या दूसरी बाल्टी वास्तव में बेहतर है क्योंकि आलू बड़े हैं, भले ही गाजर थोड़ी खराब हो?

यह बिल्कुल वही समस्या है जिसे पेपर TSQAgent हल करने की कोशिश कर रहा है, लेकिन सूप के बजाय, यह टाइम सीरीज़ डेटा (जैसे शेयर की कीमतें, मौसम की रिपोर्ट, या हृदय गति मॉनिटर) से निपट रहा है।

समस्या: AI डेटा को "सूंघने" में बुरा है

शोधकर्ताओं ने पाया कि वर्तमान आर्टिफिशियल इंटेलिजेंस (विशेष रूप से लार्ज लैंग्वेज मॉडल्स, या LLMs) इस डेटा की गुणवत्ता का आकलन करने में आश्चर्यजनक रूप से खराब है।

  • "अनुमान लगाने का खेल": जब दो डेटा सेटों की तुलना करने के लिए कहा जाता है, तो AI अक्सर गलत कारणों से अनुमान लगाता है। यह कह सकता है, "यह डेटा खराब है क्योंकि इसका रंग ऐसा है," जबकि वास्तविक समस्या यह है कि नंबर गायब हैं या पैटर्न टूट गया है।
  • "गणित का संघर्ष": भले ही AI जानता हो कि उसे क्या देखना है, लेकिन वह इसे साबित करने के लिए वास्तविक गणित करने में बहुत बुरा है। यह शोर (noise) या रुझानों (trends) के सटीक अंतर की गणना करने के बजाय "हैलुसिनेट" (चीजें बनाना) करने लगता है।

इसे साबित करने के लिए, लेखकों ने TSQBench नामक एक परीक्षण बनाया। यह AI के लिए एक मानकीकृत परीक्षा की तरह है, जहाँ वे दो डेटा सेट लेते हैं, गुप्त रूप से एक को विशिष्ट तरीकों से खराब करते हैं (जैसे स्टैटिक नॉइज़ जोड़ना या डेटा के हिस्सों को हटाना), और AI को अंतर पहचानने के लिए कहते हैं। परिणामों ने दिखाया कि सबसे स्मार्ट AI मॉडल भी संघर्ष कर रहे थे, वे अक्सर "क्यों" को गलत समझते थे और "कौन सा बेहतर है" का उत्तर केवल एक सिक्के के उछाल (coin flip) से थोड़ा ही बेहतर था।

समाधान: "तीन सिरों वाला जासूस" (TSQAgent)

इसे ठीक करने के लिए, लेखकों ने TSQAgent नामक एक नया सिस्टम बनाया। एक अकेले AI से सब कुछ करने के लिए कहने के बजाय, उन्होंने तीन विशिष्ट "एजेंटों" (AI भूमिकाओं) की एक टीम बनाई जो एक जासूसी दल की तरह मिलकर काम करती है:

  1. परसीवर (लूप-ने वाले आवर्धक लेंस वाला जासूस):

    • काम: यह एजेंट दो डेटा सेटों को देखता है और तय करता है कि क्या जांचना है।
    • तरीका: हर चीज़ की जाँच करने के बजाय (जिससे समय बर्बाद होता है और भ्रम होता है), यह एजेंट शोर को अनदेखा करने और केवल सबसे महत्वपूर्ण सुरागों पर ध्यान केंद्रित करने के लिए प्रशिक्षित है, जैसे "क्या डेटा गायब है?" या "क्या पैटर्न सुसंगत है?" यह सही "क्वालिटी डायमेंशन" चुनने में माहिर है।
  2. इंस्पेक्टर (लैब तकनीशियन):

    • काम: एक बार जब परसीवर कहता है, "शोर के स्तर की जाँच करें," तो इंस्पेक्टर कार्यभार संभाल लेता है।
    • तरीका: यह एजेंट केवल अनुमान नहीं लगाता। यह बाहरी उपकरणों (जैसे कैलकुलेटर या माइक्रोस्कोप) से लैस है। यह डेटा पर वास्तविक गणितीय परीक्षण चलाता है ताकि कठिन आंकड़े प्राप्त किए जा सकें। यदि परसीवर कहता है "ट्रेंड की जाँच करें," तो इंस्पेक्टर एक टूल का उपयोग करके ढलान (slope) को मापता है और कहता है, "ठीक है, सीरीज़ A 5% ऊपर जाती है, सीरीज़ B 2% ऊपर जाती है।" यह AI को मनगढ़ंत बातें बनाने से रोकता है।
  3. एडजुडिकेटर (न्यायाधीश):

    • काम: यह एजेंट इंस्पेक्टर की रिपोर्ट एकत्र करता है।
    • तरीका: यह एक अदालत में न्यायाधीश की तरह कार्य करता है। यह सभी सबूतों को देखता है। यदि सबूत कमजोर या विरोधाभासी हैं, तो यह मामले को दोबारा जांचने के लिए इंस्पेक्टर को वापस भेज देता है या परसीवर से नए सुराग खोजने के लिए कहता है। एक बार जब सब कुछ स्पष्ट हो जाता है, तो यह अंतिम फैसला सुनाता है: "सीरीज़ A उच्च गुणवत्ता वाली है," साथ ही एक कॉन्फिडेंस स्कोर और एक स्पष्ट स्पष्टीकरण भी देता है।

परिणाम: स्मार्ट डेटा, बेहतर सूप

शोधकर्ताओं ने वास्तविक दुनिया के डेटा (जैसे बिजली का उपयोग, यातायात के पैटर्न और मेडिकल रिकॉर्ड) पर इस नए "तीन सिरों वाले जासूस" सिस्टम का परीक्षण किया।

  • बेहतर निर्णय: सिस्टम यह पहचानने में बहुत बेहतर हो गया कि डेटा क्यों खराब था और कौन सा डेटा बेहतर था।
  • दक्षता: क्योंकि सिस्टम डेटा चुनने में इतना अच्छा था, वे अपने AI मॉडल को प्रशिक्षित करने के लिए 25% "खराब" डेटा को फेंक सकते थे और फिर भी उतना ही अच्छा परिणाम प्राप्त कर सकते थे जितना कि उन्होंने 100% डेटा का उपयोग करके किया होता।
  • "जादुई" आंकड़ा: एक प्रयोग में, उन्होंने एक विशाल AI मॉडल को प्रशिक्षित करने के लिए अपने सिस्टम का उपयोग करके केवल 75% उपलब्ध डेटा का चयन किया। परिणाम क्या रहा? मॉडल ने ठीक उतना ही प्रदर्शन किया जितना कि यदि इसे 100% डेटा पर प्रशिक्षित किया गया होता।

सारांश

संक्षेप में, पेपर कहता है: "वर्तमान AI डेटा की गुणवत्ता का निर्णय लेने में बुरा है क्योंकि यह गणना करने के बजाय अनुमान लगाता है। हमने AI एजेंटों की एक टीम बनाई है जो मिलकर काम करती है—एक सही सुराग चुनने के लिए, एक टूल्स के साथ गणित करने के लिए, और एक अंतिम निर्णय लेने के लिए। यह सिस्टम हमें 'सड़ी हुई सब्जियों' में से 'ताजी सब्जियों' को चुनने में मदद करता है, जिससे हम कम डेटा का उपयोग करके बेहतर AI मॉडल बना सकते हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →