← नवीनतम पेपर
🤖 machine learning

Lost in the Middle at Birth: An Exact Theory of Transformer Position Bias

यह शोध पत्र तर्क देता है कि लार्ज लैंग्वेज मॉडल्स में "लॉस्ट इन द मिडल" (Lost in the Middle) घटना कॉज़ल डिकोडर आर्किटेक्चर का एक अंतर्निहित ज्यामितीय गुण है जो इनिशियलाइजेशन के समय मौजूद होता है, जो कॉज़ल मास्किंग और रेसिडुअल कनेक्शन्स के बीच परस्पर क्रिया के कारण होता है जो कॉन्टेक्स्ट के मध्य में एक संरचनात्मक रूप से प्रतिकूल "डेड ज़ोन" (dead zone) बनाता है, एक ऐसा पूर्वाग्रह जो मानक प्रीट्रेनिंग के बाद भी बना रहता है।

मूल लेखक: Borun D Chowdhury

प्रकाशित 2026-03-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Borun D Chowdhury

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Lost in the Middle at Birth" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

मुख्य विचार: "U-आकार" की समस्या

कल्पना कीजिए कि आप एक बहुत लंबी कहानी (एक प्रॉम्प्ट) पढ़ रहे हैं जो एक बुद्धिमान रोबोट (एक Large Language Model) को दी गई है। आप रोबोट से उस चीज़ के बारे में एक सवाल पूछते हैं जिसका ज़िक्र कहानी के बीच में किया गया था।

आश्चर्यजनक रूप से, रोबोट अक्सर विफल हो जाता है। वह कहानी की शुरुआत को पूरी तरह याद रखता है और कहानी के अंत को भी पूरी तरह याद रखता है, लेकिन वह बीच में "खो" जाता है। इसे "Lost in the Middle" घटना कहा जाता है।

लंबे समय तक, इंजीनियरों को लगा कि यह रोबोट की "मेमोरी सेटिंग्स" (जैसे RoPE जैसे positional encodings) में कोई बग है या यह कुछ ऐसा है जो उसने समय के साथ सीखा है।

यह पेपर साबित करता है कि यह गलत है। रोबोट "बीच में खो" जाता है उतने ही समय में जब वह पैदा होता है, इससे पहले कि उसने कुछ भी सीखा हो। यह एक संरचनात्मक दोष (structural flaw) है जो रोबोट के कंकाल (skeleton) में ही बना हुआ है।


उपमा (Analogy): "पार्टी लाइन" और "टेलीपोर्टर"

यह समझने के लिए कि ऐसा क्यों होता है, कल्पना कीजिए कि रोबोट का मस्तिष्क एक विशाल पार्टी लाइन है जहाँ 24 परतों (layers) के लोग एक चेन में संदेश आगे बढ़ा रहे हैं।

1. शुरुआत: "प्राइमेसी टेल" (भीड़)

कल्पना कीजिए कि लाइन में पहला व्यक्ति (Token #1) एक संदेश चिल्लाकर शुरू करता है।

  • क्योंकि रोबot जिस तरह से बना है (Causal Masking), उनके पीछे का हर एक व्यक्ति पहले व्यक्ति की आवाज़ सुनता है।
  • जैसे-जैसे संदेश लाइन में आगे बढ़ता है, पहले व्यक्ति की आवाज़ हर परत द्वारा प्रवर्धित (amplify) होती जाती है। जब तक संदेश अंत तक पहुँचता है, पहले व्यक्ति की आवाज़ एक विशाल, गूँजते हुए समूह (chorus) में बदल चुकी होती है।
  • परिणाम: रोबोट वाक्य की शुरुआत पर बहुत अधिक ध्यान देता है।

2. अंत: "रीसेंसी एंकर" (टेलीपोर्टर)

अब, लाइन के बिल्कुल आखिरी व्यक्ति (Token #2048) की कल्पना करें।

  • इस व्यक्ति के पास एक गुप्त टेलीपोर्टर (एक Residual Connection) है जो उन्हें सीधे अंतिम आउटपुट से जोड़ता है।
  • उन्हें भीड़ के माध्यम से चिल्लाने की ज़रूरत नहीं है; वे बस टेलीपोर्टर के माध्यम से कदम रखते हैं और तुरंत फिनिश लाइन पर प्रकट हो जाते हैं।
  • परिणाम: रोबोट अंतिम शब्द पर बहुत अधिक ध्यान देता है।

3. बीच का हिस्सा: "डेड ज़ोन" (धुंध)

अब, लाइन के ठीक बीच में खड़े एक व्यक्ति (Token #1024) की कल्पना करें।

  • वे "गूँजते हुए समूह" (शुरुआत) बनने के लिए बहुत पीछे हैं।
  • वे "टेलीपोर्टर" (अंत) का उपयोग करने के लिए बहुत आगे हैं।
  • उन्हें भीड़ के माध्यम से चिल्लाना पड़ता है, लेकिन उनकी आवाज़ हर परत से गुजरते समय पतली होती जाती है। यह एक घनी धुंध में चिल्लाने जैसा है; जब तक आवाज़ अंत तक पहुँचती है, वह लगभग एक फुसफुसाहट बन जाती है।
  • गणित: यह पेपर गणना करता है कि बीच के हिस्से से आने वाला सिग्नल 1 / (24 factorial) के कारक से दब जाता है। यह एक ऐसी संख्या है जो इतनी छोटी है कि व्यावहारिक रूप से शून्य है।

U-आकार: यदि आप ग्राफ बनाएँ कि रोबोट हर शब्द पर कितना ध्यान देता है, तो यह एक U जैसा दिखेगा:

  • शुरुआत में ऊँचा (भीड़)।
  • बीच में नीचा (धुंध)।
  • अंत में ऊँचा (टेलीपोर्टर)।

बड़ी गलतफहमी: "यह सेटिंग्स के बारे में नहीं है!"

वर्षों तक, इंजीनियरों ने इसे अपनी "सेटिंग्स" (जैसे RoPE, जो रोबोट को बताता है कि शब्द कहाँ स्थित हैं) को ट्यून करके ठीक करने की कोशिश की। उन्होंने सोचा, "यदि हम केवल सेटिंग्स को सपाट (flatten) कर दें, तो रोबोट बीच में भूलना बंद कर देगा।"

यह पेपर कहता है: नहीं।

लेखकों ने एक बिल्कुल नए, बिना प्रशिक्षित रोबोट (Step 0) पर प्रयोग चलाया। उन्होंने सभी फैंसी सेटिंग्स को बंद कर दिया।

  • परिणाम: U-आकार अभी भी वहीं था!
  • क्यों? क्योंकि U-आकार सेटिंग्स के कारण नहीं है; यह आर्किटेक्चर (architecture) के कारण है (जिस तरह से परतें जुड़ी हुई हैं)। यह एक टूटे हुए पुल को ठीक करने के लिए उसे फिर से पेंट करने जैसा है; पुल संरचनात्मक रूप से असुरक्षित है, इसलिए पेंट से कोई फर्क नहीं पड़ता।

प्रशिक्षण (Training) के दौरान क्या होता है?

आप पूछ सकते हैं, "लेकिन क्या प्रशिक्षण इसे ठीक नहीं करता?"

पेपर दिखाता है कि प्रशिक्षण इसे ठीक करने की कोशिश करता है, लेकिन यह एक कठिन लड़ाई है।

  • रोबोट विशिष्ट महत्वपूर्ण शब्दों (जैसे डॉक्यूमेंट बाउंड्रीज़) को पकड़ने के लिए ध्यान के "स्पाइक्स" (spikes) बनाना सीख जाता है।
  • हालाँकि, U का समग्र आकार बना रहता है। बीच का हिस्सा अभी भी एक "ज्यामितीय घाटी" (geometric valley) है।
  • क्योंकि बीच तक पहुँचना बहुत कठिन है (ग्रेडिएंट बहुत कमजोर है), रोबोट स्वाभाविक रूप से "न्यूनतम प्रतिरोध के पथ" (path of least resistance) को चुनता है: वह शुरुआत और अंत पर बहुत अधिक निर्भर रहता है क्योंकि वे ही एकमात्र स्थान हैं जहाँ सिग्नल इतना मजबूत है कि आसानी से सीखा जा सके।

निष्कर्ष (The Takeaway)

  1. यह जन्मजात है, सीखा हुआ नहीं: वर्तमान AI मॉडल के लिए "Lost in the Middle" की समस्या एक ज्यामितीय जन्मसिद्ध अधिकार (geometric birthright) है। यह मॉडल के प्रशिक्षण डेटा का एक भी शब्द पढ़ने से पहले ही मौजूद होती है।
  2. यह संरचनात्मक है: यह "Causal Masking" (पीछे देखना) और "Residual Connections" (परतों को छोड़ना) के संयोजन के कारण है।
  3. समाधान: आप इसे ठीक करने के लिए केवल सेटिंग्स (जैसे RoPE) को ट्यून नहीं कर सकते। इसे वास्तव में हल करने के लिए, हमें स्वयं प्रशिक्षण प्रक्रिया (training process) को बदलने की आवश्यकता है। हमें रोबोट को बीच में ध्यान देने के लिए मजबूर करना होगा, शायद उसे दंडित करके जब वह बीच को अनदेखा करता है, या यह बदलकर कि वह कैसे सीखता है।

संक्षेप में: रोबोट बीच के हिस्से को इसलिए अनदेखा नहीं कर रहा है क्योंकि वह आलसी है या भ्रमित है; वह बीच के हिस्से को इसलिए अनदेखा कर रहा है क्योंकि उसका अपना मस्तिष्क शारीरिक रूप से इस तरह बना है कि बीच के हिस्से को सुनना बहुत कठिन हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →