← नवीनतम पेपर
🤖 AI

Time Series Reasoning via Process-Verifiable Thinking Data Synthesis and Scheduling for Tailored LLM Reasoning

यह शोध पत्र VeriTime को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो प्रोसेस-वेरिफिएबल (प्रक्रिया-सत्यापनीय) चेन-ऑफ-थॉट डेटा को संश्लेषित करके, एक सिद्धांतपूर्ण डेटा शेड्यूलिंग तंत्र को लागू करके, और अनुकूलित दो-चरणीय सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) को लागू करके टाइम सीरीज़ रीजनिंग के लिए लार्ज लैंग्वेज मॉडल्स को उन्नत करता है, जिससे कॉम्पैक्ट मॉडल्स बड़े प्रोप्रायटरी सिस्टम के प्रदर्शन के बराबर या उससे अधिक प्रदर्शन करने में सक्षम होते हैं।

मूल लेखक: Jiahui Zhou, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Lin Li, Zhuomin Chen, Jian Lou, See-Kiong Ng

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiahui Zhou, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Lin Li, Zhuomin Chen, Jian Lou, See-Kiong Ng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ VeriTime पेपर का विवरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) में विभाजित किया गया है।

बड़ी तस्वीर: एक रोबोट को समय के बारे में "सोचना" सिखाना

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो कहानियाँ लिखने और सामान्य ज्ञान के सवालों के जवाब देने में माहिर है। हालाँकि, जब आप उसे स्टॉक की कीमतों, दिल की धड़कन या मौसम के पैटर्न का एक ग्राफ दिखाते हैं, तो वह अक्सर बिना यह समझे कि उत्तर क्यों आया, केवल अंदाज़ा लगा लेता है। यह उस छात्र की तरह है जिसने उत्तर कुंजी (answer key) रट ली है लेकिन उसे नहीं पता कि गणित की समस्या को हल कैसे करना है।

इस पेपर के लेखकों ने, VeriTime, इन रोबोट्स को यह सिखाने के लिए बनाया कि वे टाइम सीरीज़ डेटा (वह डेटा जो समय के साथ बदलता रहता है) के माध्यम से वास्तव में तर्क (reasoning) कैसे करें। उन्होंने पाया कि रोबोट को केवल अधिक डेटा दिखाना पर्याप्त नहीं था। इसके बजाय, उन्होंने रोबोट को एक जासूस बनाने के लिए एक तीन-भाग वाली प्रशिक्षण प्रणाली बनाई।


भाग 1: "प्रक्रिया-सत्यापन योग्य" पाठ्यपुस्तक (डेटा सिंथेसिस)

समस्या: इन रोबोट्स के लिए अधिकांश प्रशिक्षण डेटा एक बहुविकल्पीय परीक्षा (multiple-choice test) की तरह है जहाँ आप केवल प्रश्न और अंतिम उत्तर देखते हैं। रोबोट उत्तर का अनुमान लगाना सीख जाता है, न कि वहाँ तक पहुँचने का तरीका।

समाधान: टीम ने एक नया डेटासेट बनाया जिसे TSRBench कहा जाता है।

  • उपमा: कल्पना कीजिए कि आप एक छात्र को रहस्य सुलझाना सिखा रहे हैं। केवल अपराधी का नाम देने के बजाय, आप उन्हें एक चरण-दर चरण जासूसी नोटबुक देते हैं।
  • यह कैसे काम करता है: उन्होंने टाइम सीरीज़ के बारे में प्रश्न (जैसे "तापमान क्यों गिरा?") उत्पन्न करने के लिए एक सुपर-स्मार्ट AI का उपयोग किया और महत्वपूर्ण रूप से, उत्तर तक पहुँचने की पूरी विचार प्रक्रिया (thought process) को विस्तार से लिखा।
  • "सत्यापन योग्य" (Verifiable) भाग: उन्होंने केवल चरण ही नहीं लिखे; उन्होंने "चेकपॉइंट्स" भी जोड़े। यह एक गणित शिक्षक की तरह है जो न केवल अंतिम संख्या की जाँच करता है, बल्कि यह सुनिश्चित करने के लिए छात्र के काम की हर एक लाइन की जाँच करता है कि हर चरण पर तर्क सही था या नहीं। यह एक ऐसा डेटासेट बनाता है जहाँ "उत्तर देने" जितना ही "सोचने" का भी महत्व है।

भाग 2: स्मार्ट स्टडी शेड्यूल (डेटा शेड्यूलिंग)

समस्या: यदि आप एक छात्र को 1,000 गणित की समस्याओं के कमरे में डाल देते हैं, तो कुछ आसान होती हैं (1+1) और कुछ असंभव (क्वांटम भौतिकी)। यदि वे पहले कठिन समस्याओं को हल करने की कोशिश करते हैं, तो वे निराश हो जाते हैं और कुछ नहीं सीख पाते। यदि वे केवल आसान काम करते हैं, तो वे कभी बेहतर नहीं हो पाते।

समाधान: टीम ने एक डेटा शेड्यूलिंग (Data Scheduling) प्रणाली डिज़ाइन की।

  • उपमा: इसे एक व्यक्तिगत जिम ट्रेनर के रूप में सोचें।
    • वार्म-अप: पहले, रोबोट "सोचने" के बुनियादी प्रारूप को सीखने के लिए आसान समस्याओं का अभ्यास करता है।
    • फ़िल्टर: ट्रेनर रोबोट को देखता है। यदि रोबोट एक समस्या को सही ढंग से हल करता है, तो ट्रेनर उसे "आसान" ढेर में डाल देता है ताकि उसे सुदृढीकरण (reinforcement) मिल सके। यदि रोबोट संघर्ष करता है, तो ट्रेनर उसे "कठिन" ढेर में डाल देता है।
    • लक्षित प्रशिक्षण (Targeted Training): रोबोट केवल उन समस्याओं पर 'रीइन्फोर्समेंट लर्निंग' (गहन, प्रयास-और-त्रुटि वाला प्रशिक्षण) करता है जिन्हें उसने लगभग सही प्राप्त कर लिया था या जो उसे कठिन लगी थीं। वह उन समस्याओं पर समय बर्बाद नहीं करता जिन्हें वह पहले से जानता है या जो वर्तमान में उसके लिए असंभव हैं। यह प्रशिक्षण को बहुत तेज़ और अधिक कुशल बनाता है।

भाग 3: "गोल्ड स्टार" सिस्टम (मल्टी-ऑब्जेक्टिव रिवॉर्ड्स)

समस्या: पारंपरिक प्रशिक्षण में, रोबोट को केवल तभी "गोल्ड स्टार" मिलता है जब अंतिम उत्तर सही होता है। यदि उसने शुद्ध भाग्य या गलत तर्क से सही उत्तर प्राप्त किया, तो भी उसे स्टार मिलता है। यह रोबोट को नकल करना सिखाता है।

समाधान: VeriTime एक मल्टी-ऑब्जेक्टिव रिवॉर्ड (Multi-Objective Reward) प्रणाली का उपयोग करता है।

  • उपमा: एक जिम्नास्टिक्स प्रतियोगिता में एक जज की कल्पना करें।

    • कठिन रिवॉर्ड: क्या आपने जंप को सफलतापूर्वक लैंड किया? (अंतिम उत्तर)।
    • प्रक्रिया रिवॉर्ड (Process Rewards): क्या आपने अपनी फॉर्म बनाए रखी? क्या आपने लैंडिंग को सही ढंग से किया? क्या आपने रूटीन के नियमों का पालन किया?
  • यह कैसे काम करता है: रोबोट को न केवल अंतिम उत्तर के लिए, बल्कि उसके सोचने के विशिष्ट चरणों के लिए भी अंक मिलते हैं:

    1. क्या उसने समझा कि प्रश्न क्या पूछ रहा था?
    2. क्या उसने डेटा में महत्वपूर्ण पैटर्न को पहचाना?
    3. क्या उसने अंतिम उत्तर देने से पहले अपने काम की जाँच की?
    4. क्या उसने अपने उत्तर को सही प्रारूप (format) में प्रस्तुत किया?

    प्रक्रिया को पुरस्कृत करके, रोबोट एक सावधान, तार्किक विचारक बनना सीखता है, न कि केवल एक भाग्यशाली अनुमान लगाने वाला।

परिणाम: छोटे रोबोट, बड़े दिमाग

पेपर का दावा है कि इस तीन-चरणीय विधि (स्मार्ट पाठ्यपुस्तक + व्यक्तिगत शेड्यूल + प्रक्रिया पुरस्कार) का उपयोग करके, वे छोटे, कॉम्पैक्ट AI मॉडल्स (केवल 3 से 4 बिलियन पैरामीटर्स) को बहुत बड़े, महंगे "प्रोपराइटरी" मॉडल्स के बराबर या उनसे बेहतर प्रदर्शन करने में सक्षम बनाने में सफल रहे।

  • मुख्य बात (Takeaway): यदि आप इसे सही तरीके से सोचना सिखाते हैं, तो आपको जटिल समय पहेलियों को हल करने के लिए एक विशाल, महंगे दिमाग की आवश्यकता नहीं है।
  • दक्षता (Efficiency): रोबोट सही निष्कर्ष तक पहुँचने के लिए कम "टोकन" (शब्दों/विचारों के शब्द) का उपयोग करके तेज़ भी हो गए, जिसका अर्थ है कि वे अनावश्यक रूप से ज़्यादा नहीं बोलते।

सारांश

VeriTime एक ऐसा फ्रेमवर्क है जो AI को निम्नलिखित तरीकों से समय-आधारित डेटा के बारे में तर्क करना सिखाता है:

  1. ऐसा प्रशिक्षण डेटा बनाना जिसमें सत्यापित चरण-दर-चरण विचार शामिल हों।
  2. प्रशिक्षण को शेड्यूल करना ताकि AI सही समय पर सही कठिनाई स्तर का अभ्यास कर सके।
  3. AI को केवल अंतिम उत्तर सही होने के लिए नहीं, बल्कि एक तार्किक, चरण-दर-चरण प्रक्रिया रखने के लिए पुरस्कृत करना।

परिणामस्वरूप, यह एक स्मार्ट, अधिक कुशल AI है जो एक टाइम-सीरीज़ विशेषज्ञ की तरह कार्य कर सकता है, भले ही वह एक "छोटा" मॉडल हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →