← नवीनतम पेपर
💬 NLP

RHYTHM: Reasoning with Hierarchical Temporal Tokenization for Human Mobility

RHYTHM एक एकीकृत ढांचा है जो बहु-स्तरीय आवधिक निर्भरताओं (multi-scale periodic dependencies) को कैप्चर करने के लिए एक फ्रोजन लार्ज लैंग्वेज मॉडल को पदानुक्रमित टेम्पोरल टोकनाइज़ेशन (hierarchical temporal tokenization) के साथ जोड़कर मानव गतिशीलता की कुशलतापूर्वक भविष्यवाणी करता है, जिससे अत्याधुनिक तरीकों की तुलना में सटीकता और प्रशिक्षण गति में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Haoyu He, Haozheng Luo, Yan Chen, Qi R. Wang

प्रकाशित 2026-02-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoyu He, Haozheng Luo, Yan Chen, Qi R. Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि कल कोई व्यक्ति कहाँ होगा, इसका पूर्वानुमान लगाने की कोशिश करना। यह एक वाक्य में अगले शब्द का अनुमान लगाने जैसा है, लेकिन शब्दों के बजाय, आप स्थानों का अनुमान लगा रहे हैं।

लंबे समय से, कंप्यूटर ऐसा करने के लिए किसी व्यक्ति के आंदोलनों के पूरे इतिहास को डेटा पॉइंट्स की एक विशाल, अव्यवस्थित सूची के रूप में देखते रहे हैं। लेकिन मानवीय गति यादृच्छिक (random) नहीं होती; इसमें एक लय (rhythm) होती है। हमारी दैनिक दिनचर्या होती है (जागना, काम पर जाना, घर जाना) और साप्ताहिक लय होती है (कार्यदिवस बनाम सप्ताहांत)।

यह शोध पत्र एक नई प्रणाली पेश करता है जिसे RHYTHM (Reasoning with Hierarchical Temporal Tokenization for Human Mobility) कहा जाता है। इसे एक "सुपर-प्रेडिक्टर" के रूप में समझें जो अंततः मानव जीवन की ताल को समझता है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: एक उपन्यास को एक-एक अक्षर करके पढ़ना

कल्पना कीजिए कि आप एक कहानी समझने की कोशिश कर रहे हैं, लेकिन पूरे वाक्यों या अनुच्छेदों के बजाय, कंप्यूटर को हर एक अक्षर को एक-एक करके पढ़ने के लिए मजबूर किया जाता है।

  • पुराने तरीके: वे हर एक स्थान चेक-इन (हर 30 मिनट में) को एक अलग आइटम के रूप में देखते हैं। यदि आपके पास एक सप्ताह का डेटा है, तो वह सैकड़ों आइटम होंगे। यह धीमा है, भ्रमित करने वाला है, और कंप्यूटर थक जाता है (वह "बड़ी तस्वीर" जैसे पैटर्न को खो देता है, जैसे "ओह, यह व्यक्ति हर मंगलवार को जिम जाता है")।
  • परिणाम: कंप्यूटर डेटा की भारी मात्रा से अभिभूत हो जाता है और स्पष्ट पैटर्न को मिस कर देता है।

2. समाधान: RHYTHM का "अध्याय" दृष्टिकोण

RHYTHM डेटा को समूहित करके खेल बदल देता है। एक-एक अक्षर पढ़ने के बजाय, यह अध्याय-दर-अध्याय पढ़ता है।

  • उपमा: कल्पना कीजिए कि आपका एक सप्ताह का मूवमेंट एक किताब है।
    • पुराना तरीका: कंप्यूटर हर एक शब्द (हर 30-मिनट का चेक-इन) पढ़ता है।
    • RHYTHM का तरीका: RHYTHM शब्दों को दैनिक अध्यायों (Daily Chapters) में समूहित करता है। यह कहता है, "ठीक है, सोमवार एक अध्याय है, मंगलवार दूसरा है।"
    • यह कैसे मदद करता है: यह 1,000 पन्नों की किताब को 7 अध्यायों वाली एक लघु कथा (novella) में बदल देता है। अब कंप्यूटर बहुत तेज़ी से सप्ताह की कहानी देख सकता है। यह "दैनिक दिनचर्या" (अध्याय) और "साप्ताहिक पैटर्न" (पूरी किताब) को एक साथ पकड़ सकता है।

3. "मस्तिष्क": एक विशाल भाषा मॉडल (LLM) का उपयोग करना

RHYTHM एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग करता है—वही तरह का AI जो कविताएँ लिखता है या प्रश्नों के उत्तर देता है—एक मस्तिष्क के रूप में।

  • जादू: LLM संदर्भ (context) समझने में विशेषज्ञ हैं। वे जानते हैं कि "मुझे भूख लगी है" आमतौर पर "मैं रेस्तरां जाता हूँ" की ओर ले जाता है।
  • RHYTHM की तरकीब: यह LLM को स्थानों (locations) को शब्दों की तरह मानने के लिए सिखाता है।
    • यह कहने के बजाय कि "उपयोगकर्ता निर्देशांक X,Y पर है," यह कहता है, "उपयोगकर्ता 'घर' पर है।"
    • फिर यह LLM से पूछता है: "इस सप्ताह की कहानी के आधार पर, उपयोगकर्ता अगली बार कहाँ जाने की संभावना है?"
    • क्योंकि LLM भाषा में पैटर्न पहचानने में इतना अच्छा है, इसलिए यह गति (movement) में पैटर्न पहचानने में भी आश्चर्यजनक रूप से अच्छा हो जाता है।

4. "चीट शीट": पूर्व-निर्धारित प्रॉम्प्ट्स (Pre-computed Prompts)

RHYTHM का सबसे स्मार्ट हिस्सा यह है कि यह समय कैसे बचाता है।

  • समस्या: किसी भविष्यवाणी को करने के लिए हर बार एक विशाल AI को पूरी किताब पढ़ने के लिए कहना धीमा और महंगा है।
  • समाधान: RHYTHM प्रशिक्षण शुरू होने से पहले ही एक "चीट शीट" (जिसे सिमेंटिक एम्बेडिंग्स/Semantic Embeddings कहा जाता है) तैयार करता है।
    • यह एक दिन के विवरण को लेता है (जैसे, "एक बरसाती मंगलवार जहाँ उपयोगकर्ता काम पर गया और फिर जिम गया") और उसे एक सारांश नोट में बदल देता है।
    • जब मॉडल को भविष्यवाणी करने की आवश्यकता होती है, तो यह केवल सारांश नोट पढ़ता है। इसे पूरी किताब को दोबारा पढ़ने की आवश्यकता नहीं होती। यह इसे चलाने के लिए अविश्वसनीय रूप से तेज़ और सस्ता बनाता है।

5. परिणाम: तेज़, स्मार्ट और बेहतर

शोध पत्र ने तीन जापानी शहरों (कुमामोटो, सैप्पोरो, हिरोशिमा) के वास्तविक डेटा पर RHYTHM का परीक्षण किया।

  • सटीकता: इसने पिछले किसी भी तरीके की तुलना में स्थानों की बेहतर भविष्यवाणी की, विशेष रूप से सप्ताहांत (weekends) पर। क्यों? क्योंकि सप्ताहांत अराजक होते हैं और कम नियमित होते हैं। पुराने मॉडल यहाँ विफल हो जाते हैं क्योंकि वे केवल पैटर्न को याद करते हैं। RHYTHM उस अराजकता के माध्यम से तर्क (reasoning) करता है, ठीक वैसे ही जैसे एक इंसान करता है।
  • गति: डेटा को "अध्यायों" में समूहित करके और "चीट शीट" का उपयोग करके, यह अपने प्रतिस्पर्धियों की तुलना में 24% तेज़ी से प्रशिक्षित होता है और कम मेमोरी का उपयोग करता है।

सारांश उपमा

यदि मानव गति की भविष्यवाणी करना एक दौड़ थी:

  • पुराने मॉडल एक ऐसे धावक की तरह थे जो फिनिश लाइन खोजने के लिए समुद्र तट पर रेत के प्रत्येक कण को गिनने की कोशिश कर रहा है। वे धीमे थे और विवरणों में खो जाते थे।
  • RHYTHM एक ऐसे धावक की तरह है जो मानचित्र को देखता है, "दैनिक मार्गों" और "साप्ताहिक आदतों" को देखता है, और सहजता से यह जानने के लिए एक स्मार्ट गाइड (LLM) का उपयोग करता है कि फिनिश लाइन कहाँ है।

संक्षेप में: RHYTHM मानव गति के बिखरे हुए, अराजक डेटा को एक संरचित कहानी में बदल देता है जिसे एक सुपर-स्मार्ट AI उच्च सटीकता और कम लागत के साथ पढ़, समझ और भविष्यवाणी कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →