← नवीनतम पेपर
🤖 machine learning

TSDS-Toolbox: A Toolbox for Measuring Time-Series Dataset Similarity

यह शोध पत्र TSDS-Toolbox प्रस्तुत करता है, जो एक एकीकृत और विस्तार योग्य ढांचा है जिसे फाइन-ट्यूनिंग फाउंडेशन मॉडल्स जैसे कार्यों के लिए टाइम-सीरीज डेटासेट समानता विधियों के व्यवस्थित, पुनरुत्पादनीय और सुसंगत मूल्यांकन को सक्षम करके मौजूदा बेंचमार्क में मौजूद विखंडन को दूर करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Yen-Ku Liu, Hongjie Chen, Ryan A. Rossi, Franck Dernoncourt

प्रकाशित 2026-08-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yen-Ku Liu, Hongjie Chen, Ryan A. Rossi, Franck Dernoncourt

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक नई रेसिपी बनाने की कोशिश कर रहे हैं। आपके मन में एक लक्षित व्यंजन है—शायद एक तीखा नूडल सूप—लेकिन आपको नहीं पता कि कौन सी मौजूदा रेसिपी बुक आपको इसे सीखने में सबसे अच्छी मदद करेगी। क्या आप एक फ्रांसीसी कुकबुक से शुरुआत करेंगे, एक थाई स्ट्रीट-फूड गाइड से, या एक क्लासिक इतालवी मैनुअल से? आर्टिफिशियल इंटेलिजेंस की दुनिया में, विशेष रूप से "टाइम-सीरीज" डेटा (जो केवल एक फैंसी तरीका है यह कहने का कि डेटा समय के साथ बदलता है, जैसे शेयर की कीमतें, दिल की धड़कनें, या मौसम के पैटर्न) के साथ, AI मॉडल को भी इसी तरह की समस्या का सामना करना पड़ता है। उन्हें भविष्य की भविष्यवाणी करने या अजीब पैटर्न को पहचानने के लिए पुराने डेटा से सीखने की आवश्यकता होती है। लेकिन सभी पुराना डेटा एक जैसा नहीं होता। कुछ डेटासेट आपके लक्षित व्यंजन के "कजिन" (भाई-बहन) की तरह होते हैं; वे एक ही तरह का स्वाद साझा करते हैं। अन्य पूरी तरह से अजनबी की तरह होते हैं। यह समझना कि कौन से डेटासेट उपयोग के लिए कितने "समान" हैं, एक बड़ी चुनौती है। अभी, वैज्ञानिकों के पास इस समानता को मापने के कई अलग-अलग तरीके हैं, लेकिन वे सभी अलग-अलग पैमाने, अलग-अलग माप और अलग-अलग रसोई का उपयोग कर रहे हैं, जिससे उनकी निष्पक्ष तुलना करना असंभव हो जाता है।

यहीं पर TSDS-Toolbox आता है। इसे एक विशाल, मानकीकृत "टेस्ट-टेस्ट किचन" के रूप में समझें जिसे शोधकर्ता येन-कु लियू, होंगजे चेन, रयान ए. रॉसी और फ्रैंक डर्ननकोर्ट द्वारा बनाया गया है। इस टूल के अस्तित्व में आने से पहले, यदि आप जानना चाहते थे कि क्या डेटासेट A, डेटासेट B की तुलना में डेटासेट C से अधिक समान है, तो आपको अपना खुद का कोड लिखना पड़ सकता था, अपना डेटा साफ करना पड़ सकता था और अपने स्वयं के प्रयोग चलाने पड़ सकते थे, और अंत में आपको पता चलता कि आपके परिणाम किसी और के साथ तुलना नहीं किए जा सकते। लेखकों ने एक एकीकृत ढांचा बनाया है जो एक विशाल, स्वचालित न्यायाधीश के रूप में कार्य करता है। यह विभिन्न "समानता विधियों" (दो समूहों के डेटा के बीच समानता को मापने के विभिन्न तरीकों) को लेता है और उन सभी का परीक्षण बिल्कुल समान परिस्थितियों में करता है। उन्होंने केवल एक पैमाना नहीं बनाया; उन्होंने यह परीक्षण करने के लिए एक पूरा लैब बनाया कि क्या वह पैमाना वास्तव में आपको बेहतर खाना पकाने में मदद करता है।

टीम ने अपने टूलबॉक्स का परीक्षण 25 विभिन्न वास्तविक दुनिया के डेटासेटों का उपयोग करके किया, जो ट्रैफिक पैटर्न और मौसम की रिपोर्ट से लेकर बिजली के उपयोग और पर्यटन संख्या तक फैले हुए थे। उन्होंने एक सरल लेकिन पेचीदा सवाल पूछा: "क्या यह जानना कि दो डेटासेट 'समान' हैं, वास्तव में एक AI मॉडल को नए कार्य पर बेहतर प्रदर्शन करने में मदद करता है?" उन्होंने यह देखने के लिए परीक्षण किया कि क्या समानता स्कोर यह अनुमान लगा सकते हैं कि एक AI भविष्य की पूर्वानुमान (forecasting) लगाने या वर्गीकरण (classification) (चीजों को श्रेणियों में छांटने) में कैसा प्रदर्शन करेगा।

यहाँ उन्हें क्या मिला, और यह थोड़ा चौंकाने वाला है। उन्होंने पाया कि कोई एक "जादुई पैमाना" नहीं है जो हर स्थिति में सबसे अच्छा काम करता है। यह पूछने जैसा है कि दूरी मापने के लिए टेप माप, लेजर डिस्टेंस फाइंडर या पेडोमीटर में से कौन सा उपकरण सबसे अच्छा है। उत्तर पूरी तरह से इस पर निर्भर करता है कि आप क्या माप रहे हैं और क्यों।

  • कुछ कार्यों के लिए, जैसे कि Time-MoE नामक एक विशिष्ट प्रकार के AI मॉडल के साथ भविष्य की भविष्यवाणी करना, Match-and-Deform (जो दो डांस रूटीन को मिलाने जैसा है, भले ही वे थोड़े तालमेल से बाहर हों) नामक एक विधि सफलता का सबसे अच्छा भविष्यवक्ता साबित हुई।
  • अन्य कार्यों के लिए, Wasserstein Distance (जो डेटा को एक आकार से दूसरे आकार में ले जाने की "लागत" को मापता है) नामक एक विधि ने बहुत अच्छा प्रदर्शन किया।
  • दिलचस्प बात यह है कि कुछ विधियाँ जो कागज पर बहुत अच्छी लगती थीं, वे व्यवहार में AI को बेहतर प्रदर्शन करने में मदद नहीं कर पाईं।

शोधकर्ताओं ने डेटा को मापने से पहले उसे सरल बनाने के दो अलग-अलग तरीकों का भी परीक्षण किया: DBA (जो डेटा को औसत निकाल कर सरल बनाता है जैसे कि "औसत" डांस मूव ढूंढना) और PCA (जो डेटा में सबसे महत्वपूर्ण "दिशाओं" को ढूंढता है)। उन्होंने पाया कि DBA आम तौर पर AI को सीखने में मदद करने के लिए बेहतर था, विशेष रूप से वर्गीकरण कार्यों के लिए, लेकिन PCA विशिष्ट पूर्वानुमान परिदृश्यों में अपनी जगह बनाए रखने में सक्षम था।

इस अध्ययन का सबसे महत्वपूर्ण निष्कर्ष यह है कि आप केवल एक समानता विधि चुनकर यह मान नहीं सकते कि यह हर चीज के लिए सबसे अच्छी है। शोध पत्र सुझाव देता है कि समानता को मापने का "सर्वश्रेष्ठ" तरीका पूरी तरह से इस पर निर्भर करता है कि आप डेटा के साथ क्या करने की कोशिश कर रहे हैं। यदि आप मौसम की भविष्यवाणी करने की कोशिश कर रहे हैं, तो एक उपकरण आपका सबसे अच्छा दोस्त हो सकता है; यदि आप दिल के दौरे का पता लगाने की कोशिश कर रहे हैं, तो एक पूरी तरह से अलग उपकरण नायक होगा।

इस ओपन-सोर्स टूलबॉक्स को प्रदान करके, लेखकों ने वैज्ञानिक समुदाय को अनुमान लगाने के बजाय परीक्षण करने का एक तरीका दिया है। सिद्धांत में यह बहस करने के बजाय कि कौन सा पैमाना सबसे अच्छा है, अब शोधकर्ता अपने स्वयं के प्रयोगों को इस साझा रसोई में चला सकते हैं ताकि यह देख सकें कि कौन सा उपकरण उनके विशिष्ट AI मॉडल को सबसे अच्छा परिणाम पकाने में मदद करता है। यह AI को स्मार्ट बनाने की दिशा में एक कदम है, जिससे इसे शुरुआत से ही सही सामग्री चुनने में मदद मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →