← नवीनतम पेपर
🤖 machine learning

Benchmark Datasets for Lead-Lag Forecasting on Social Platforms

यह शोध पत्र लीड-लैग फोरकास्टिंग (LLF) प्रतिमान को प्रस्तुत करता है और प्रारंभिक सोशल प्लेटफॉर्म इंटरैक्शन से विलंबित उच्च-प्रभाव वाले परिणामों की भविष्यवाणी करने पर व्यवस्थित अनुसंधान को सक्षम करने के लिए arXiv और GitHub से दो उच्च-मात्रा वाले बेंचमार्क डेटासेट स्थापित करता है।

मूल लेखक: Kimia Kazemian (Department of Computer Science, Cornell University), Zhenzhen Liu (Department of Computer Science, Cornell University), Yangfanyu Yang (Department of Information Science, Cornell Unive
प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kimia Kazemian (Department of Computer Science, Cornell University), Zhenzhen Liu (Department of Computer Science, Cornell University), Yangfanyu Yang (Department of Information Science, Cornell University), Katie Luo (Department of Computer Science, Stanford University), Shuhan Gu (Department of Computer Science, Cornell University), Audrey Du (Department of Computer Science, Cornell University), Xinyu Yang (Department of Information Science, Cornell University), Jack Jansons (Department of Computer Science, Cornell University), Kilian Q. Weinberger (Department of Computer Science, Cornell University), John Thickstun (Department of Computer Science, Cornell University), Yian Yin (Department of Information Science, Cornell University), Sarah Dean (Department of Computer Science, Cornell University)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक टैलेंट स्काउट (प्रतिभा खोजकर्ता) हैं जो यह अनुमान लगाने की कोशिश कर रहे हैं कि कौन सी नई फिल्म ब्लॉकबस्टर बनेगी, या कौन सा नया गाना सालों तक चार्ट्स में टॉप पर रहेगा। आप यह जानने के लिए पांच साल इंतजार नहीं कर सकते; आपको यह अभी जानना है, शुरुआती संकेतों के आधार पर।

यह शोध पत्र इस समस्या के बारे में सोचने के एक नए तरीके को पेश करता है, जिसे लीड-लैग फोरकास्टिंग (Lead-Lag Forecasting) कहा जाता है।

मुख्य विचार: "लीड" और "लैग"

एक नए उत्पाद (जैसे कि एक वैज्ञानिक शोध पत्र या एक सॉफ्टवेयर कोड) को एक बीज की तरह समझें जिसे बोया जा रहा है।

  • द लीड (The Lead): ये शुरुआती, त्वरित इंटरैक्शन हैं। यह एक बीज को अंकुरित होते देखने जैसा है, या यह देखने जैसा है कि कुछ लोग एक नया मूवी ट्रेलर देखकर रुक रहे हैं। वास्तविक दुनिया में, ये चीज़ें "व्यूज़" (views), "लाइक्स" (likes), "डाउनलोड्स" (downloads), या किसी कोड रिपॉजिटरी में "पुश" (pushes) जैसी होती हैं। ये तुरंत होती हैं।
  • द लैग (The Lag): यह बड़ा, दीर्घकालिक प्रभाव है। यह उस पेड़ की तरह है जो बीज से विकसित होता है, या वह फिल्म है जो पांच साल बाद ऑस्कर जीतती है। वास्तविक दुनिया में, ये "साइटेशन्स" (citations - अन्य वैज्ञानिकों द्वारा शोध पत्र का संदर्भ देना) या "फोर्क्स" (forks - अन्य डेवलपर्स द्वारा कोड को कॉपी करना और उसमें सुधार करना) हैं।

समस्या: आमतौर पर, ये दोनों चीजें बहुत अलग गति से होती हैं। "लीड" आज होती है; "लैग" को दिखने में सालों लग सकते हैं। अधिकांश कंप्यूटर मॉडल यह अनुमान लगाने में अच्छे होते हैं कि आगे क्या होगा (जैसे कल का मौसम), लेकिन वे यह अनुमान लगाने में संघर्ष करते हैं कि वर्षों बाद क्या होगा जो आज हो रहा है।

समाधान: दो विशाल डेटासेट्स

कंप्यूटरों को ये दीर्घकालिक भविष्यवाणियां करना सिखाने के लिए, लेखकों ने दो विशाल "ट्रेनिंग जिम" (डेटासेट्स) बनाए हैं जहाँ "लीड" और "लैग" स्पष्ट रूप से दर्ज किए गए हैं:

  1. द arXiv जिम (विज्ञान): उन्होंने 2.3 मिलियन वैज्ञानिक शोध पत्रों को ट्रैक किया।
    • द लीड: शोध पत्र के पहले कुछ हफ्तों में कितने लोगों ने इसे डाउनलोड या देखा।
    • द लैग: अगले 5 वर्षों में अन्य वैज्ञानिकों द्वारा उस शोध पत्र को कितनी बार साइट (cite) किया गया।
  2. द GitHub जिम (तकनीक): उन्होंने 3 मिलियन सॉफ्टवेयर प्रोजेक्ट्स को ट्रैक किया।
    • द लीड: कितने लोगों ने कोड "पुश" किया (अपडेट किया) या प्रोजेक्ट को "स्टार" (लाइक) दिया।
    • द लैग: अगले 5 वर्षों में कितने लोगों ने प्रोजेक्ट को "फोर्क" (कॉपी और मॉडिफाई) किया।

ये विशेष क्यों हैं:

  • धोखाधड़ी नहीं (No Cheating): कई पुराने डेटासेट्स केवल उन्हीं चीज़ों को देखते हैं जो जीवित रहीं (सर्वाइवरशिप बायस); ये डेटासेट्स हर पेपर और प्रोजेक्ट को शामिल करते हैं, यहाँ तक कि उन्हें भी जिन्हें कभी किसी ने नहीं देखा। यह वास्तविकता की एक निष्पक्ष तस्वीर देता है।
  • लॉन्ग गेम: वे 5 साल के क्षितिज (horizon) को देखते हैं। यह कठिन है क्योंकि "आज के व्यू" और "पांच साल बाद के साइटेशन" के बीच का संबंध जटिल और अव्यवस्थित होता है।

उन्होंने क्या पाया

लेखकों ने विभिन्न कंप्यूटर मॉडलों (साधारण गणित से लेकर जटिल AI तक) का परीक्षण किया कि क्या वे अतीत के आधार पर भविष्य का अनुमान लगा सकते हैं।

  • शुरुआती संकेत शक्तिशाली होते हैं: उन्होंने पाया कि शुरुआती गतिविधि (जैसे व्यूज़ या स्टार्स) वास्तव में दीर्घकालिक सफलता का एक बहुत मजबूत भविष्यवक्ता है। उदाहरण के लिए, यदि किसी शोध पत्र को पहले 30 दिनों में बहुत अधिक व्यूज़ मिलते हैं, तो इसकी अत्यधिक संभावना है कि पांच साल बाद इसे बहुत अधिक साइटेशन मिलेंगे।
  • क्रॉस-चैनल मैजिक: मॉडल तब सबसे अच्छा काम करते थे जब वे एक साथ अलग-अलग प्रकार के संकेतों को देखते थे। उदाहरण के लिए, GitHub डेटा में, "पुश" (अपडेट्स) और "स्टार्स" (लाइक्स) दोनों को एक साथ देखना केवल एक को देखने की तुलना में बेहतर था। यह एक टैलेंट स्काउट की तरह है जो स्टारडम की भविष्यवाणी करने के लिए केवल एक चीज़ के बजाय गायक की आवाज़ और उसकी स्टेज प्रेजेंस दोनों का उपयोग करता है।
  • समय मायने रखता है: कंप्यूटर जितनी लंबी अवधि तक शुरुआती गतिविधि को देखता है, भविष्यवाणी उतनी ही बेहतर होती है। यदि आप केवल 30 दिनों तक देखते हैं, तो अनुमान ठीक है। यदि आप एक वर्ष तक देखते हैं, तो अनुमान बहुत सटीक होता है।

निचोड़ (The Bottom Line)

यह शोध पत्र केवल यह नहीं कहता कि "हम भविष्य की भविष्यवाणी कर सकते हैं।" इसके बजाय, यह कहता है: "यहाँ एक नए प्रकार के पूर्वानुमान के लिए नियम पुस्तिका और अभ्यास का मैदान है।"

उन्होंने एक नए प्रकार के अध्ययन को औपचारिक रूप दिया है कि कैसे शुरुआती, छोटी क्रियाएं बड़े, विलंबित परिणामों की ओर ले जाती हैं। उन्होंने डेटा और बेसलाइन स्कोर प्रदान किए हैं ताकि अन्य शोधकर्ता अब यह समझने के लिए बेहतर उपकरण बना सकें कि हमारी डिजिटल दुनिया में विचार और उत्पाद समय के साथ कैसे बढ़ते हैं।

संक्षेप में: उन्होंने "शुरुआती संकेतों" और "देर से मिलने वाले परिणामों" का एक विशाल पुस्तकालय बनाया है ताकि कंप्यूटर को यह पहचानना सिखाया जा सके कि भविष्य का हिट क्या होने वाला है, इससे पहले कि वह वास्तव में हिट हो जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →