← नवीनतम पेपर
💬 NLP

TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning

यह शोधपत्र TimeSage-MT को प्रस्तुत करता है, जो एजेंटिक टाइम सीरीज़ रीजनिंग (agentic time series reasoning) का मूल्यांकन करने के लिए आठ वास्तविक दुनिया के डोमेन में 240 कार्यों वाला एक मल्टी-टर्न बेंचमार्क है, जो वर्तमान LLMs में मेमोरी, अनिश्चितता प्रबंधन और निर्णय लेने के संबंध में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और भविष्य के विकास के लिए एक आधार प्रदान करता है।

मूल लेखक: Yaxuan Kong, Qingren Yao, Yuqi Nie, Yichen Li, Yilei Shao, Stefan Zohren, Anna Vettoruzzo, Joaquin Vanschoren, Ming Jin, Qingsong Wen

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yaxuan Kong, Qingren Yao, Yuqi Nie, Yichen Li, Yilei Shao, Stefan Zohren, Anna Vettoruzzo, Joaquin Vanschoren, Ming Jin, Qingsong Wen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक नया वित्तीय विश्लेषक (financial analyst), एक मौसम विज्ञानी (weather forecaster), या एक अस्पताल डेटा विशेषज्ञ (hospital data specialist) नियुक्त किया है। आप नहीं चाहते कि वे केवल एक स्प्रेडशीट को देखें और एक संख्या का अनुमान लगाएं। आप चाहते हैं कि वे आपके साथ बैठें, स्पष्ट करने वाले प्रश्न पूछें, अपने काम की जांच करें, नई जानकारी मिलने पर अपना विचार बदलें, और अंत में आपको साक्ष्यों के आधार पर एक ठोस योजना दें।

यह शोध पत्र TimeSage-MT पेश करता है, जो एक "फाइनल एग्जाम" है जिसे यह परीक्षण करने के लिए डिज़ाइन किया गया है कि क्या AI एजेंट (स्मार्ट कंप्यूटर प्रोग्राम) वास्तव में इस तरह के वास्तविक दुनिया के, बहु-चरणीय टाइम सीरीज़ विश्लेषण (multi-step time series analysis) को कर सकते हैं।

यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. समस्या: "वन-शॉट" ट्रैप (The "One-Shot" Trap)

आजकल के अधिकांश AI परीक्षण एक 'पॉप क्विज़' की तरह होते हैं: "यह स्टॉक की कीमतों का चार्ट है। कल यह क्या होगा?" AI अनुमान लगाता है, एक स्कोर प्राप्त करता है, और परीक्षण समाप्त हो जाता है।

  • वास्तविकता: वास्तविक जीवन पॉप क्विज़ नहीं है। एक वास्तविक विश्लेषक कहता है, "रुको, डेटा अजीब लग रहा है। मुझे त्रुटियों की जांच करने दो। ओह, यहाँ एक हॉलिडे इफेक्ट (holiday effect) है। चलो, इसे एडजस्ट करते हैं। अब, इसे देखते हुए, क्या हमें खरीदना चाहिए या बेचना?"
  • अंतराल (The Gap): वर्तमान AI मॉडल "पॉप क्विज़" में बहुत अच्छे हैं लेकिन जब बातचीत लंबी, जटिल हो जाती है, या इसमें पांच मिनट पहले कही गई बात को याद रखने की आवश्यकता होती है, तो वे अक्सर विफल हो जाते हैं। वे नंबरों की कल्पना (hallucinate) कर सकते हैं या उस डेटा को भूल सकते हैं जिसे उन्होंने अभी देखा था।

2. समाधान: "TimeSage-MT" परीक्षा

लेखकों ने एक विशाल, यथार्थवादी टेस्ट सुइट बनाया है जिसे TimeSage-MT कहा जाता है। इसे एक सिमुलेशन गेम की तरह समझें जहाँ AI को एक 'डेटा जासूस' के रूप में कार्य करना होता है।

  • सेटअप: इसमें 8 वास्तविक दुनिया के क्षेत्रों (जैसे वित्त, स्वास्थ्य सेवा, ऊर्जा और रिटेल) में 240 अलग-अलग परिदृश्य शामिल हैं।
  • बातचीत: एक प्रश्न के बजाय, प्रत्येक परिदृश्य एक बहु-चरणीय बातचीत (multi-turn conversation) है जो 3 से 20 संदेशों तक लंबी होती है।
  • कठिनाई के स्तर:
    • लेवल 1 (ओपन एक्सप्लोरेशन): "हे, यह डेटा कैसा दिखता है?" (बेसिक प्रोफाइलिंग)।
    • लेवल 2 (मल्टी-स्किल): "अजीब स्पाइक्स (spikes) खोजें, फिर अगले सप्ताह का पूर्वानुमान लगाएं।" (टास्क को जोड़ना)।
    • लेवल 3 (ग्राउंडेड सिंथेसिस): "पूर्वानुमान और विसंगति जांच (anomaly check) को मिलाकर एक रिपोर्ट लिखें।" (सब कुछ एक साथ लाना)।
    • लेवल 4 (फुल डिसीजन): "इन सभी के आधार पर, क्या हमें पावर ग्रिड को बंद कर देना चाहिए या चालू रखना चाहिए?" (उच्च-दांव वाला निर्णय लेना)।

3. उन्होंने इसे कैसे बनाया (द "फैक्ट्री")

एक ऐसा परीक्षण बनाना जहाँ उत्तर 100% सही हो, कठिन है। यदि आप एक AI को परीक्षण लिखने के लिए कहते हैं, तो वह झूठ बोल सकता है।

  • फैक्ट्री: लेखकों ने एक "पुनरुत्पादक पाइपलाइन" (reproducible pipeline) बनाई। उन्होंने वास्तविक डेटा लिया, सटीक उत्तरों (गोल्ड स्टैंडर्ड) की गणना करने के लिए सख्त कंप्यूटर कोड का उपयोग किया, और फिर उन उत्तरों के इर्द-गिर्द बातचीत उत्पन्न करने के लिए एक AI का उपयोग किया।
  • सेफ्टी नेट: उनके पास एक "क्वालिटी कंट्रोल" टीम (मानव और स्वचालित दोनों) है जो प्रत्येक परीक्षण की जांच करती है ताकि यह सुनिश्चित हो सके कि AI ने गलती से उत्तर को प्रश्न में लीक नहीं किया है या तथ्य नहीं बनाए हैं।

4. "TimeSage" एजेंट

यह दिखाने के लिए कि उनका परीक्षण कैसे काम करता है, उन्होंने अपना खुद का AI एजेंट बनाया जिसे TimeSage कहा जाता है।

  • टूलबॉक्स: केवल अनुमान लगाने के बजाय, TimeSage के पास टाइम सीरीज़ गणित के लिए 226 विशिष्ट टूल्स (कौशल) की एक लाइब्रेरी है। यह एक मैकेनिक को केवल अपने हाथों से "कार ठीक करने" के लिए कहने के बजाय उसे रिंच (wrenches) का एक पूरा सेट देने जैसा है।
  • प्रक्रिया: TimeSage अपने चरणों की योजना बनाता है, अपने काम की जांच करता है, और केवल तभी बोलता है जब उसके पास कोड-आधारित साक्ष्य होता है।

5. परिणाम: क्या हुआ?

उन्होंने दुनिया के सबसे स्मार्ट AI मॉडलों (जैसे GPT-5, Claude और अन्य) का इस परीक्षा के विरुद्ध परीक्षण किया। यहाँ उन्होंने क्या पाया:

  • "कोड" का लाभ: जब AI को गणित करने के लिए पायथन (Python) कोड लिखने और चलाने की अनुमति दी गई, तो वह बहुत बेहतर हो गया। जब उसने अपनी याददाश्त से नंबरों का "अनुमान" लगाने की कोशिश की, तो वह बुरी तरह विफल रहा।
  • "मेमोरी" में गिरावट: जैसे-जैसे बातचीत लंबी होती गई (लेवल 1 से लेवल 4 की ओर बढ़ते हुए), AI का प्रदर्शन तेजी से गिरा। वे शुरुआती कुछ दौर में अच्छे थे लेकिन जैसे-जैसे चैट आगे बढ़ी, वे पुराने तथ्यों को भूलने लगे या नंबर बनाने लगे।
  • "डिसीजन" गैप: AI डेटा का वर्णन करने में ठीक था, लेकिन निर्णय लेने में बहुत खराब था। उसे यह कहने में संघर्ष करना पड़ा कि, "क्योंकि X हुआ, इसलिए हमें Y करना चाहिए," खासकर जब अनिश्चितता शामिल थी।
  • "टूल" का ट्रेड-ऑफ: AI को एक संरचित "TimeSage" सिस्टम (कड़े नियमों और एक प्लानर के साथ) देने से उसे नंबरों के साथ अधिक सटीक होने में मदद मिली, लेकिन कभी-कभी इससे वह प्राकृतिक, लचीली रिपोर्ट लिखने में कमजोर हो गया। यह एक कठोर कैलकुलेटर और एक लचीले वार्ताकार के बीच का ट्रेड-ऑफ है।

6. मुख्य निष्कर्ष (The Big Takeaway)

शोध पत्र निष्कर्ष निकालता है कि हालांकि AI स्मार्ट हो रहा है, फिर भी उसे टाइम सीरीज़ डेटा में विश्वसनीय, लंबे समय के तर्क (long-horizon reasoning) के साथ संघर्ष करना पड़ता है।

  • यह संदर्भ (context) को हमेशा याद नहीं रख पाता।
  • यह अनिश्चितता (uncertainty) को हमेशा नहीं संभाल पाता (नंबर बनाने के बजाय "मुझे यकीन नहीं है" कहना)।
  • इसे डेटा को वास्तविक दुनिया के निर्णय में बदलने में कठिनाई होती है।

TimeSage-MT अब एक सार्वजनिक लीडरबोर्ड है जहाँ कोई भी अपने AI एजेंटों का परीक्षण कर सकता है कि क्या वे वास्तव में एक वास्तविक नौकरी संभाल सकते हैं, न कि केवल एक पॉप क्विज़। यह डेवलपर्स को केवल अंतिम उत्तर देखने के बजाय इस बात पर ध्यान केंद्रित करने के लिए मजबूर करता है कि AI वहां कैसे पहुँचा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →