Thoth: Mid-Training Bridges LLMs to Time Series Understanding
यह शोधपत्र थॉथ (Thoth) को प्रस्तुत करता है, जो मिड-ट्रेन्ड (mid-trained) लार्ज लैंग्वेज मॉडल्स का पहला परिवार है जो प्राकृतिक भाषा और टाइम सीरीज़ डेटा के बीच के अंतर को पाटने के लिए उच्च-गुणवत्ता वाले "बुक-ऑफ-थॉथ" (Book-of-Thoth) कॉर्पस का लाभ उठाता है, जो मौजूदा मॉडल्स की तुलना में टेम्पोरल रीजनिंग और ज्ञान-गहन बेंचमार्क पर प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार, विश्व स्तरीय जासूस (एक लार्ज लैंग्वेज मॉडल, या LLM) है जिसने दुनिया की हर किताब, समाचार पत्र और वेबसाइट को पढ़ा है। यह जासूस रहस्य सुलझाने, कहानियाँ लिखने और मानवीय बातचीत को समझने में अद्भुत है।
हालाँकि, एक चीज़ है जिसमें यह जासूस बहुत बुरा है: समय की लय (rhythm of time) को पढ़ना।
यदि आप उन्हें स्टॉक की कीमतों का ग्राफ, किसी मरीज की हृदय गति, या एक शहर का साल भर का तापमान दिखाएं, तो वे शायद केवल टेढ़ी-मेढ़ी रेखाएं देखेंगे। वे उस पैटर्न को "महसूस" नहीं कर सकते। वे यह नहीं समझ पाते कि अचानक आया उछाल एक संकट का संकेत है, या धीरे-धीरे होने वाली निरंतर वृद्धि एक रुझान (trend) है। वे एक ऐसे संगीत समीक्षक की तरह हैं जिसने संगीत सिद्धांत की हर किताब तो पढ़ ली है, लेकिन वास्तव में कभी कोई गाना सुना नहीं है।
यह पेपर Thoth को पेश करता है, जो एक नए प्रकार का AI जासूस है जिसे इस समस्या को ठीक करने के लिए बनाया गया है।
इसे कैसे किया गया, इसकी कहानी यहाँ सरल रूप में दी गई है:
1. समस्या: "भाषा" का अंतर
अधिकांश AI मॉडल टेक्स्ट (शब्दों) पर प्रशिक्षित होते हैं। टाइम सीरीज़ डेटा (समय के साथ बदलते नंबर) पूरी तरह से एक अलग भाषा है।
- पुराना तरीका: शोधकर्ताओं ने जासूस को विशिष्ट मामलों के लिए विशिष्ट तरकीबें सिखाने की कोशिश की। "यदि आप स्टॉक गिरते देखें, तो 'बेचें' कहें।" "यदि आप बुखार देखें, तो 'डॉक्टर को बुलाएं' कहें।"
- दोष: यह एक छात्र को किसी विशिष्ट परीक्षा के लिए उत्तर रटाने जैसा है। यदि परीक्षा थोड़ी भी बदल जाती है, तो वे विफल हो जाते हैं। वे समय की अवधारणा को वास्तव में समझते नहीं हैं।
2. समाधान: "मिड-ट्रेनिंग" (The Bridge)
लेखकों ने महसूस किया कि केवल अंत में जासूस को विशिष्ट तरकीबें सिखाने के बजाय, उन्हें उनके प्रशिक्षण के बीच में एक विशेष शिक्षा देने की आवश्यकता थी।
इसे इस तरह सोचें:
- प्री-ट्रेनिंग (Pre-Training): जासूस पूरी लाइब्रेरी पढ़ता है (सामान्य ज्ञान)।
- मिड-ट्रेनिंग (The Thoth Bridge): विशिष्ट मामले हल करने से पहले, वे एक वर्ष तक एक मौसम विज्ञानी और एक स्टॉकब्रोकर के रूप में काम करते हैं। वे हजारों मौसम चार्ट और वित्तीय ग्राफ का अध्ययन करते हैं, उन्हें शब्दों में वर्णित करना सीखते हैं और शब्दों से उनकी भविष्यवाणी करना सीखते हैं।
- पोस्ट-ट्रेनिंग (Post-Training): अब, जब वे वापस एक सामान्य जासूस के रूप में जाते हैं, तो उनके पास एक सुपरपावर होती है: वे किसी भी टाइमलाइन को देख सकते हैं और तुरंत उस कहानी को समझ सकते हैं जो वह बताती है।
3. गुप्त सामग्री: "द बुक ऑफ थॉथ" (The Book of Thoth)
AI को यह नई भाषा सिखाने के लिए, शोधकर्ताओं ने Book-of-Thoth नामक एक विशाल पाठ्यपुस्तक बनाई।
- इसमें क्या है? यह केवल नंबर नहीं है। यह एक दो-तरफा शब्दकोश है।
- टाइम-टू-टेक्स्ट (Time-to-Text): उन्होंने हजारों ग्राफ लिए और एक AI से उनके बारे में एक कहानी लिखने को कहा। "यह रेखा धीरे-धीरे ऊपर जाती है, फिर तेजी से गिरती है।"
- टेक्स्ट-टू-टाइम (Text-to-Time): उन्होंने "एक ऐसा स्टॉक जो एक सप्ताह तक लगातार बढ़ता है और फिर गिर जाता है" जैसा विवरण लिया और उससे मेल खाने वाला सटीक ग्राफ तैयार किया।
- यह क्यों शानदार है? यह AI को यह सीखने के लिए मजबूर करता है कि नंबरों में "अचानक गिरावट" का अर्थ शब्दों में "क्रैश" होना ही है। यह डेटा की दृश्य दुनिया और भाषा की तार्किक दुनिया के बीच के अंतर को पाटता है।
4. नया बेंचमार्क: "KnoTS"
यह साबित करने के लिए कि उनका जासूस वास्तव में अधिक स्मार्ट है, उन्होंने KnoTS (Knowledge-intensive Time Series) नामक एक नया परीक्षण बनाया।
- पुराने परीक्षण: "यहाँ एक ग्राफ है। क्या यह ऊपर जा रहा है या नीचे?" (बहुत आसान)।
- KnoTS: "यहाँ मिट्टी में CO2 के स्तर का एक ग्राफ है। हम जानते हैं कि बारिश गैस को रोकती है। ग्राफ में तूफान के बाद एक अजीब सा डिप (गिरावट) दिख रहा है। क्यों ऐसा हुआ?"
- परिणाम: Thoth ने केवल अनुमान नहीं लगाया; इसने अपने नए "मिड-ट्रेनिंग" का उपयोग करके ग्राफ को वास्तविक दुनिया के ज्ञान (जैसे कि बारिश मिट्टी को कैसे प्रभावित करती है) के साथ जोड़ने के लिए किया ताकि रहस्य को सुलझाया जा सके।
5. परिणाम: एक सुपर डिटेक्टिव
जब उन्होंने Thoth का परीक्षण किया:
- इसने समय-आधारित डेटा को समझने में वर्तमान में उपलब्ध सबसे बड़े, सबसे स्मार्ट AI मॉडलों (जैसे GPT-4 और Gemini) को पछाड़ दिया।
- विशिष्ट कार्यों (जैसे ऊर्जा उपयोग की भविष्यवाणी करना या हृदय संबंधी विसंगतियों का पता लगाना) में विशेषज्ञ बनने के लिए इसे बहुत कम अतिरिक्त प्रशिक्षण की आवश्यकता थी।
- इसने अपनी मानवीय भाषा बोलने की क्षमता को नहीं भुलाया; इसने बस अपने मौजूदा कौशल के ऊपर एक नई सुपरपावर जोड़ ली।
बड़ी तस्वीर (The Big Picture)
यह पेपर AI को समय के प्रवाह को महसूस करना सिखाने के बारे में है।
पहले, AI एक ऐसे व्यक्ति की तरह था जो नक्शा तो पढ़ सकता था लेकिन कार नहीं चला सकता था। Thoth और Book-of-Thoth के साथ, उन्होंने AI को ड्राइविंग लाइसेंस दे दिया है। अब यह सड़क (डेटा) को देख सकता है, ट्रैफिक पैटर्न (रुझान) को समझ सकता है, और आगे कहाँ जाना है इसके बारे में स्मार्ट निर्णय ले सकता है।
यह वास्तविक दुनिया में AI के उपयोग की दिशा में एक बड़ा कदम है, जहाँ लगभग सब कुछ—आपके बैंक खाते से लेकर आपके स्वास्थ्य तक—समय के साथ नंबरों में लिखी एक कहानी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।