← नवीनतम पेपर
💰 quantitative finance

DatedGPT: Preventing Lookahead Bias in Large Language Models with Time-Aware Pretraining

यह शोध पत्र DatedGPT को प्रस्तुत करता है, जो बारह 1.3B-पैरामीटर वाले भाषा मॉडलों का एक परिवार है, जिन्हें वित्तीय पूर्वानुमान में लुकअहेड बायस (lookahead bias) को समाप्त करने के लिए 2013 से 2024 तक सख्त वार्षिक कटऑफ के साथ टेम्पोरली पार्टिशन किए गए (temporally partitioned) डेटा पर प्रशिक्षित किया गया है, जबकि प्रतिस्पर्धी प्रदर्शन को भी बनाए रखा गया है।

मूल लेखक: Yutong Yan, Raphael Tang, Zhenyu Gao, Wenxi Jiang, Yao Lu

प्रकाशित 2026-03-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yutong Yan, Raphael Tang, Zhenyu Gao, Wenxi Jiang, Yao Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अगले साल के शेयर बाजार की भविष्यवाणी करने में मदद करने के लिए एक वित्तीय सलाहकार (financial advisor) को काम पर रख रहे हैं। आप चाहते हैं कि वे शानदार हों, लेकिन आप यह भी चाहते हैं कि वे अपनी जानकारी के बारे में ईमानदार रहें।

अधिकांश आधुनिक AI मॉडल (Large Language Models) के साथ समस्या यह है कि वे उन छात्रों की तरह हैं जिन्होंने परीक्षा देने से पहले चुपके से उत्तर कुंजी (answer key) देख ली है। उन्हें पूरे इंटरनेट पर प्रशिक्षित किया गया है, जिसमें 2024 की खबरें भी शामिल हैं। इसलिए यदि आप उनसे पूछते हैं, "2024 में शेयर बाजार में क्या हुआ था?" तो वे एक सटीक उत्तर दे सकते हैं। लेकिन यह इसलिए नहीं है क्योंकि वे भविष्य की भविष्यवाणी करने में स्मार्ट हैं; बल्कि इसलिए क्योंकि उन्होंने भविष्य को पहले ही देख लिया है। वित्त (finance) में, इसे लुकअहेड बायस (Lookahead Bias) कहा जाता है, और यह उन्हें वास्तविक दुनिया के निवेश के लिए बेकार बना देता है।

पेश है DATEDGPT

"टाइम-ट्रैवलिंग लाइब्रेरियन" (समय यात्रा करने वाले पुस्तकालयाध्यक्ष) का रूपक

इस शोध पत्र के पीछे के शोधकर्ताओं को टाइम-ट्रैवलिंग लाइब्रेरियन की एक टीम के रूप में सोचें।

एक AI मॉडल को पूरे इंटरनेट का इतिहास (जो अव्यवस्थित है और जिसमें स्पॉइलर भरे हुए हैं) देने के बजाय, उन्होंने 12 अलग-अलग लाइब्रेरी बनाईं, जो 2013 से 2024 तक के प्रत्येक वर्ष के लिए एक है।

  • 2013 की लाइब्रेरी: इसमें केवल वही किताबें, समाचार और वेबसाइटें हैं जो 31 दिसंबर, 2013 तक उपलब्ध थीं।
  • 2020 की लाइब्रेरी: इसमें 2020 तक की सब कुछ शामिल है, लेकिन 2021, 2022 या 2023 से कुछ भी नहीं है।
  • 2024 की लाइब्रेरी: इसमें सबसे हालिया डेटा है, लेकिन यह सख्ती से 2024 के अंत पर रुक जाता है।

इसके बाद उन्होंने प्रत्येक लाइब्रेरी के लिए एक विशिष्ट AI "छात्र" को प्रशिक्षित किया। जिसने 2013 की लाइब्रेरी में पढ़ाई की है, उसने कभी ChatGPT, 2020 की महामारी, या 2024 के चुनाव के बारे में नहीं सुना है। यदि आप उनसे इन चीजों के बारे में पूछते हैं, तो वे वास्तव में नहीं जानते। वे "भूल" नहीं रहे हैं; उन्हें यह जानकारी कभी सिखाई ही नहीं गई थी।

उन्होंने यह कैसे किया (नुस्खा/विधि)

  1. सामग्री (डेटा): उन्होंने इंटरनेट टेक्स्ट का एक विशाल ढेर (लगभग 100 बिलियन शब्द प्रति वर्ष) लिया और उन्हें सख्ती से उस तारीख के आधार पर विभाजित किया जब उन्हें सर्च इंजन द्वारा क्रॉल (crawled) किया गया था। उन्होंने यह सुनिश्चित किया कि कोई भी "भविष्य" की सामग्री "अतीत" के बर्तनों में न फिसल जाए।
  2. पकाना (प्रशिक्षण): उन्होंने शून्य से 12 अलग-अलग AI मॉडल तैयार किए। प्रत्येक मॉडल ने केवल अपने विशिष्ट वर्ष में उपलब्ध भोजन का सेवन किया।
  3. विशेष सॉस (इंस्ट्रक्शन ट्यूनिंग): इन मॉडलों को मददगार चैटबॉट बनाने के लिए, उन्होंने उन्हें निर्देशों का पालन करना सिखाया (जैसे "ईमेल लिखें" या "इस समाचार का विश्लेषण करें")। लेकिन वे यहाँ भी बहुत सावधान रहे। उन्होंने किसी भी ऐसे निर्देश को हटा दिया जिसमें भविष्य की घटनाओं का उल्लेख हो। उदाहरण के लिए, वे 2018 के मॉडल से यह नहीं पूछेंगे कि "2020 के ओलंपिक के बारे में एक स्क्रिप्ट लिखें" क्योंकि यह धोखाधड़ी होगी।

यह क्यों महत्वपूर्ण है: "परप्लेक्सिटी" (Perplexity) परीक्षण

हमें कैसे पता चलेगा कि 2020 वाला मॉडल 2021 के बारे में नहीं जानता?

शोधकर्ताओं ने परप्लेक्सिटी (Perplexity) नामक एक परीक्षण का उपयोग किया। कल्पना कीजिए कि आप एक किताब पढ़ रहे हैं। यदि किताब उन चीजों के बारे में बात करती है जो आपने पहले पढ़ी हैं, तो इसे समझना आसान है (कम "भ्रम" या perplexity)। यदि यह उन चीजों के बारे में बात करती है जो आपने पहले कभी नहीं देखी हैं, तो यह भ्रमित करने वाला होता है (उच्च perplexity)।

उन्होंने 2020 के मॉडल को 2013, 2014 से लेकर 2024 तक की समाचार सुर्खियां खिलाईं।

  • 2020 से पहले: मॉडल ने समाचारों को आसानी से समझ लिया (कम भ्रम)।
  • 2020 के बाद: मॉडल अचानक बहुत भ्रमित हो गया (उच्च भ्रम) क्योंकि उसने पहले कभी इन शब्दों को नहीं देखा था।

भ्रम में यह "जंप" (उछाल) ने सिद्ध किया कि मॉडल वास्तव में भविष्य के प्रति अंधा था। वह केवल दिखावा नहीं कर रहा था; वह वास्तव में अनभिज्ञ था।

परिणाम: एक निष्पक्ष पूर्वानुमान उपकरण

यह शोध पत्र दिखाता है कि ये "टाइम-ट्रैवलिंग" मॉडल वास्तव में काफी स्मार्ट हैं। भले ही वे आज के विशाल AI मॉडलों की तुलना में छोटे हैं, फिर भी वे प्रश्नों के उत्तर देने या कहानियाँ लिखने जैसे सामान्य कार्यों पर समान रूप से अच्छा प्रदर्शन करते हैं।

लेकिन उनकी महाशक्ति उनकी निष्ठा (integrity) है।

  • यदि आप जानना चाहते हैं कि 2019 के निवेशक ने किसी स्टॉक के बारे में क्या सोचा होगा, तो आप 2019 के मॉडल से पूछते हैं।
  • यदि आप जानना चाहते हैं कि 2024 का निवेशक क्या सोचता है, तो आप 2024 के मॉडल से पूछते हैं।

वे एक वेब डेमो (एक टाइम मशीन चैट इंटरफेस की तरह) प्रदान करते हैं जहाँ आप यह देखने के लिए कि जैसे-जैसे समय आगे बढ़ता है उनके उत्तर कैसे बदलते हैं, इन मॉडलों के बीच स्विच कर सकते हैं।

संक्षेप में

DATEDGPT मॉडलों का एक परिवार है जो ईमानदार इतिहासकारों की तरह कार्य करते हैं। वे भविष्य में झाँककर धोखाधड़ी नहीं करते हैं। उन्हें विशेष रूप से वित्त और भविष्यवाणी कार्यों के लिए डिज़ाइन किया गया है जहाँ यह जानना कि घटना होने से पहले ही उसका उत्तर पता है, पूरे खेल को बिगाड़ देता है। एक विशिष्ट तिथि पर अपनी जानकारी को सख्ती से रोककर, वे यह सुनिश्चित करते हैं कि जब वे कोई भविष्यवाणी करते हैं, तो वह उस समय की वास्तविक जानकारी पर आधारित होती है, न कि उस पर जिसे उन्होंने गुप्त रूप से कल (भविष्य) से याद किया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →