← नवीनतम पेपर
🤖 AI

Pre-trained Large Language Models Learn Hidden Markov Models In-context

यह शोध पत्र प्रदर्शित करता है कि पूर्व-प्रशिक्षित बड़े भाषा मॉडल इन-कॉन्टेक्स्ट लर्निंग के माध्यम से हिडन मार्कोव मॉडल्स द्वारा उत्पन्न अनुक्रमों को प्रभावी ढंग से सीख और अनुमानित कर सकते हैं, जो सिंथेटिक डेटा पर लगभग इष्टतम सटीकता और वास्तविक दुनिया के पशु निर्णय लेने वाले कार्यों पर प्रतिस्पर्धी प्रदर्शन प्राप्त करते हुए, जटिल वैज्ञानिक डेटा में छिपी संरचनाओं को उजागर करने के लिए ICL को एक शक्तिशाली उपकरण के रूप में स्थापित करते हैं।

मूल लेखक: Yijia Dai, Zhaolin Gao, Yahya Sattar, Sarah Dean, Jennifer J. Sun

प्रकाशित 2026-04-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yijia Dai, Zhaolin Gao, Yahya Sattar, Sarah Dean, Jennifer J. Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

पुस्तकालय में जासूस की उपमा (The "Detective in the Library" Analogy)

कल्पना कीजिए कि आप एक विशाल, प्राचीन पुस्तकालय में प्रवेश करने वाले एक जासूस हैं। आपको एक रहस्यमय व्यक्ति द्वारा छोड़े गए नोट्स की एक श्रृंखला मिलती है। ये नोट्स केवल बेतरतीब लकीरें नहीं हैं; वे एक छिपे हुए पैटर्न का पालन करते हैं। उदाहरण के लिए, हर बार जब वह व्यक्ति "Apple" लिखता है, तो वह लगभग हमेशा उसके बाद "Banana" लिखता है, लेकिन केवल तभी जब उसने पहले "Red" लिखा हो।

"हिडन मार्कोव मॉडल" (HMM) उसी गुप्त कोड की तरह है। यह एक ऐसी प्रणाली है जहाँ आप परिणाम (शब्द "Apple" और "Banana") देखते हैं, लेकिन आप उन छिपे हुए नियमों ( "Red" वाला नियम या व्यक्ति का मूड) को नहीं देख पाते हैं जिन्होंने उन्हें जन्म दिया। आमतौर पर, इस कोड को सुलझाने के लिए आपको एक सुपरकंप्यूटर और गणित में पीएचडी की आवश्यकता होती है ताकि जटिल, भारी-भरकम गणनाएँ की जा सकें।

यह शोध पत्र एक आश्चर्यजनक प्रश्न पूछता है: क्या होगा यदि हम ये नोट्स एक अत्यंत विद्वान, अविश्वसनीय रूप से बुद्धिमान लाइब्रेरियन (एक लार्ज लैंग्वेज मॉडल जैसे GPT या Llama) को सौंप दें और पूछें, "इन उदाहरणों के आधार पर, अगला नोट क्या होगा?"


शोधकर्ताओं ने क्या पाया

शोधकर्ताओं ने पाया कि ये "लाइब्रेरियन" (LLMs) हमारी सोच से कहीं अधिक बेहतर जासूस हैं। उन्हें "री-ट्रेन" करने या गणित की पाठ्यपुस्तक देने की आवश्यकता नहीं है; उन्हें बस प्रॉम्प्ट में कुछ उदाहरण देखने की आवश्यकता है (इसे इन-कॉन्टेक्स्ट लर्निंग कहा जाता है), और वे उस छिपे हुए पैटर्न को "महसूस" करने लगते हैं।

यहाँ उनकी खोज का विवरण दिया गया है:

1. लाइब्रेरियन एक स्वाभाविक पैटर्न-खोजकर्ता है

शोधकर्ताओं ने LLMs का हजारों "नकली" गुप्त कोडों पर परीक्षण किया। उन्होंने पाया कि LLMs केवल अनुमान नहीं लगा रहे थे; वे वास्तव में गणितीय रूप से संभव "परफेक्ट" के जितना हो सके उतना करीब पहुँच रहे थे। यह ऐसा है जैसे लाइब्रेरियन ने दस नोट्स देखे और कहा, "मैं पैटर्न समझ गया हूँ। अगला नोट निश्चित रूप से 'Banana' होगा।"

2. कुछ कोड दूसरों की तुलना में कठिन होते हैं

हर गुप्त कोड को सुलझाना आसान नहीं होता। शोधकर्ताओं ने पाया कि दो चीजें एक पैटर्न को "धुंधला" बनाती हैं:

  • "अराजकता" का कारक (एन्ट्रॉपी/Entropy): यदि नोट्स लिखने वाला व्यक्ति बहुत अनिश्चित और अप्रत्याशित है, तो सबसे बुद्धिमान लाइब्रेरियन भी संघर्ष करेगा।
  • "स्मृति" का कारक (मिक्सिंग रेट/Mixing Rate): यदि छिपे हुए नियम बहुत धीरे-धीरे बदलते हैं या लंबे समय तक एक ही मोड में अटके रहते हैं, तो लाइब्रेरियन को यह समझने के लिए कि क्या हो रहा है, नोट्स की एक बहुत लंबी "किताब" पढ़नी होगी।

3. वास्तविक दुनिया का जादू: जानवरों के सोचने के तरीके को देखना

यह केवल गणित के खेल तक सीमित नहीं था। शोधकर्ताओं ने इसे वास्तविक विज्ञान पर लागू किया। उन्होंने LLMs को लैब प्रयोगों में चूहों (mice and rats) द्वारा लिए गए निर्णयों के अनुक्रम (sequences) दिए।

  • एक मामले में, LLM वास्तव में मानव विशेषज्ञों द्वारा डिज़ाइन किए गए विशेष गणितीय मॉडलों की तुलना में यह भविष्यवाणी करने में बेहतर था कि चूहा आगे क्या करेगा!
  • यह सच है कि जानवरों के मस्तिष्क इन "छिपे हुए पैटर्न" का पालन करते हैं, और LLMs किसी जीवित प्राणी के व्यवहार की लय को "पढ़ने" में आश्चर्यजनक रूप से कुशल हैं।

यह क्यों महत्वपूर्ण है (इसका महत्व क्या है?)

अतीत में, यदि कोई वैज्ञानिक एक जटिल प्रणाली को समझना चाहता था—जैसे कि जलवायु पैटर्न कैसे बदलता है या मस्तिष्क कैसे पुरस्कार (reward) को प्रोसेस करता है—तो उसे एक कस्टम, महंगा गणितीय इंजन बनाना पड़ता था।

यह शोध पत्र एक नए, तेज़ तरीके का सुझाव देता है: "डायग्नोस्टिक टूल" दृष्टिकोण।

एक जटिल मशीन बनाने के बजाय, एक वैज्ञानिक बस अपने डेटा को एक LLM को "दिखा" सकता है।

  • यदि LLM अगले कदम की आसानी से भविष्यवाणी कर देता है, तो वैज्ञानिक जानता है, "ठीक है, मेरे डेटा में एक स्पष्ट, सीखने योग्य संरचना है।"
  • यदि LLM विफल हो जाता है, तो वैज्ञानिक जानता है, "मेरा डेटा या तो बहुत अराजक है या नियम इतनी तेज़ी से बदल रहे हैं कि उनकी भविष्यवाणी आसानी से नहीं की जा सकती।"

संक्षेप में: LLMs केवल कविता लिखने या कोडिंग करने के लिए नहीं हैं; वे शक्तिशाली, "प्लग-एंड-प्ले" सांख्यिकीय जासूस बन रहे हैं जो वैज्ञानिकों को प्राकृतिक दुनिया की छिपी हुई लय को उजागर करने में मदद कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →