Detecting Lookahead Bias in LLM Forecasts
यह शोध पत्र 'लुकअहेड प्रोपेंसिटी' (LAP) नामक एक सांख्यिकीय प्रक्रिया प्रस्तुत करता है जो लार्ज लैंग्वेज मॉडल के आर्थिक पूर्वानुमानों में लुकअहेड बायस (lookahead bias) का पता लगाने और उसे मापने का कार्य करता है, यह प्रदर्शित करते हुए कि मॉडलों की भविष्य कहने की क्षमता काफी हद तक उनके प्रशिक्षण डेटा में उपलब्ध भविष्य की जानकारी को आत्मसात करने से संचालित होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक छात्र को पिछले साल पढ़े गए इतिहास की किताब पर टेस्ट देने के लिए काम पर रख रहे हैं। आप उससे किसी विशिष्ट घटना के बारे में एक प्रश्न पूछते हैं, जैसे "29 जुलाई, 2020 को कोडेक (Kodak) के शेयर की कीमत का क्या हुआ था?"
यदि छात्र सही उत्तर देता है, तो आप सोच सकते हैं, "वाह, वे अर्थशास्त्र को वास्तव में समझते हैं और समाचारों का विश्लेषण कर सकते हैं!" लेकिन क्या होगा अगर वे वास्तव में समाचारों का विश्लेषण नहीं कर रहे हैं? क्या होगा अगर उन्होंने केवल उस पुस्तक से उत्तर कुंजी (answer key) याद कर ली है क्योंकि वह विशिष्ट घटना प्रसिद्ध थी और उनके अध्ययन की सामग्री में दिखाई दी थी?
यह झेनयु गाओ (Zhenyu Gao), वेनक्सी जियांग (Wenxi Jiang), और युटोंग यान (Yutong Yan) के शोध पत्र द्वारा उठाया गया मुख्य मुद्दा है। उन्हें चिंता है कि जब आर्टिफिशियल इंटेलिजेंस (AI) मॉडल भविष्य की भविष्यवाणी करते हैं (जैसे स्टॉक की कीमतें या कंपनी का खर्च), तो वे वास्तव में "सोच" या "तर्क" नहीं कर रहे होते हैं। इसके बजाय, वे अपने प्रशिक्षण डेटा (training data) से उत्तर याद करके नकल (cheating) कर रहे हो सकते हैं।
यहाँ उनके अध्ययन का एक सरल विवरण दिया गया है:
1. समस्या: "चीट शीट" प्रभाव (The "Cheat Sheet" Effect)
लार्ज लैंग्वेज मॉडल्स (LLMs) को इंटरनेट से प्राप्त विशाल मात्रा में टेक्स्ट पर प्रशिक्षित किया जाता है। यदि किसी कंपनी की 2020 में कोई बड़ी समाचार घटना हुई थी (जैसे कोडेक को भारी ऋण मिला और उसके शेयर आसमान छू गए), तो उस कहानी के बारे में हजारों लेख लिखे गए होंगे, उनका विश्लेषण किया गया होगा और सारांश दिया गया होगा। AI ने अपने प्रशिक्षण के दौरान उन सभी लेखों को "खा लिया" है।
जब आप आज AI से एक हेडलाइन के आधार पर यह अनुमान लगाने के लिए कहते हैं कि 2020 में कोडेक के स्टॉक का क्या हुआ था, तो हो सकता है कि वह हेडलाइन के बारे में तर्क न कर रहा हो। वह केवल अपने प्रशिक्षण डेटा में देखे गए परिणाम को याद (recall) कर रहा हो सकता है। यह उस छात्र की तरह है जिसने विषय सीखने के बजाय टेस्ट के उत्तर रट लिए हैं।
2. समाधान: "मेमोरी टेस्ट" (लुकअहेड प्रोपेंसिटी - Lookahead Propensity)
लेखकों ने AI को नकल करते हुए पकड़ने का एक चतुर तरीका बनाया है। वे इसे लुकअहेड प्रोपेंसिटी (LAP) कहते हैं।
इसे एक "मेमोरी टेस्ट" के रूप में समझें जो वास्तविक टेस्ट से पहले होता है।
- वास्तविक टेस्ट: आप AI को एक समाचार हेडलाइन देते हैं और पूछते हैं, "क्या स्टॉक ऊपर जाएगा या नीचे?"
- मेमोरी टेस्ट: आप AI को हेडलाइन के बिना केवल कंपनी का नाम और तारीख देते हैं। आप पूछते हैं, "क्या आप जानते हैं कि इस विशिष्ट तिथि पर इस कंपनी के साथ क्या हुआ था?"
यदि AI उच्च आत्मविश्वास के साथ कहता है, "मुझे पता है! यह ऊपर गया था!", भले ही आपने उसे कोई समाचार न दिया हो, तो इसका मतलब है कि AI ने परिणाम को याद (memorize) कर लिया है।
- उच्च LAP स्कोर: AI को उत्तर पता है (वह नकल कर रहा है/याद कर रहा है)।
- निम्न LAP स्कोर: AI कहता है, "मुझे नहीं पता," क्योंकि वह तिथि उसकी स्मृति से बाहर है (वह नकल नहीं कर रहा है)।
3. प्रयोग: AI को रंगे हाथों पकड़ना
शोधकर्ताओं ने दो वास्तविक दुनिया के परिदृश्यों पर इसका परीक्षण किया:
- स्टॉक समाचार: एक समाचार हेडलाइन के आधार पर यह अनुमान लगाना कि स्टॉक ऊपर जाएगा या नीचे।
- अर्निंग कॉल्स (Earnings Calls): एक CEO के भाषण के ट्रांसक्रिप्ट के आधार पर यह अनुमान लगाना कि एक कंपनी कितना पैसा खर्च करेगी (CapEx)।
उन्होंने Llama-3.3-70B नामक मॉडल का उपयोग किया, जिसका "नॉलेज कटऑफ" (ज्ञान की सीमा) दिसंबर 2023 है। इसका मतलब है कि मॉडल को उस तारीख तक के डेटा पर प्रशिक्षित किया गया है लेकिन वह इसके बाद की घटनाओं के बारे में कुछ नहीं जानता।
परिणाम:
- कटऑफ से पहले ("चीट" ज़ोन): जब AI से 2020, 2021 या 2022 की तारीखों के बारे में पूछा गया, तो उसका LAP स्कोर उच्च था। वह आत्मविश्वास से परिणामों को "जानता" था। जब उन्होंने AI की भविष्यवाणियों की जांच की, तो उन्होंने पाया कि AI उन दिनों में परिणाम की भविष्यवाणी करने में बहुत बेहतर था जहाँ उसका मेमोरी स्कोर अधिक था। इससे यह सिद्ध हुआ कि AI अपनी "चीट शीट" (याददाश्त) का उपयोग करके अपनी सटीकता बढ़ा रहा था, न कि केवल तर्क का।
- कटऑफ के बाद ("ईमानदार" ज़ोन): जब उन्होंने AI से 2024 (उसके प्रशिक्षण समाप्त होने के बाद) की तारीखों के बारे में पूछा, तो LAP स्कोर शून्य हो गया। AI ईमानदारी से कहता है, "मुझे नहीं पता।" इस ज़ोन में, भविष्य की भविष्यवाणी करने की AI की क्षमता काफी कम हो गई, जिससे यह साबित हुआ कि पहले जो "जादू" था वह मुख्य रूप से केवल याददाश्त थी।
4. बड़ा निष्कर्ष
यह पेपर यह नहीं कहता कि AI बेकार है। यह कहता है कि AI कार्य-विशिष्ट (task-specific) है।
- यदि आप AI से उसके अतीत की किसी प्रसिद्ध घटना के बारे में पूछते हैं, तो वह उत्तर को "हल" करने के बजाय केवल "सुना" (reciting) रहा हो सकता है।
- यदि आप उससे किसी नई चीज़ के बारे में पूछते हैं (उसके प्रशिक्षण कटऑफ के बाद), तो उसे वास्तव में तर्क करना होगा, और उसकी भविष्यवाणियां कम "परफेक्ट" लेकिन अधिक ईमानदार हो सकती हैं।
"लुकअहेड प्रोपेंसिटी" टेस्ट एक कम लागत वाला उपकरण है। शोधकर्ता इसका उपयोग यह जाँचने के लिए कर सकते हैं: "क्या यह AI वास्तव में स्मार्ट है, या यह केवल उन चीजों को दोहरा रहा है जो इसने सीखी हैं?"
सारांश उपमा (Summary Analogy)
कल्पना कीजिए कि एक जासूस (AI) अपराध को सुलझाने की कोशिश कर रहा है।
- पेपर की चिंता: जासूस केस को सुरागों को देखकर नहीं सुलझा रहा है, बल्कि इसलिए सुलझा रहा है क्योंकि उसने कल ही उस अपराध के परिणाम के बारे में अखबार का लेख पढ़ा है।
- टेस्ट: शोधकर्ता जासूस से पूछते हैं, "क्या आपको इस विशिष्ट मामले का परिणाम याद है?"
- यदि जासूस कहता है, "हाँ, मुझे यह पूरी तरह से याद है!" (High LAP), तो वह संभवतः केवल अखबार को दोहरा रहा है, न कि सोच रहा है।
- यदि जासूस कहता है, "मुझे कुछ नहीं पता," (Low LAP), तो उसका समाधान वास्तविक तर्क पर आधारित है।
लेखकों ने एक सांख्यिकीय उपकरण बनाया है जो ठीक से मापता है कि जासूस कितना "सुना" (reciting) रहा है बनाम कितना "सोच" (thinking) रहा है, जिससे यह सुनिश्चित होता है कि जब हम वित्तीय भविष्यवाणियों के लिए AI का उपयोग करते हैं, तो हमें पता हो कि हमें वास्तविक अंतर्दृष्टि मिल रही है या केवल स्मृति रिकॉल।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।